
İzleme kurmak kolaydır; işe yarayan bir izleme kurmak zordur. Fazla uyarı üreten bir sistem görmezden gelinir, az uyaran bir sistem ise sorunları kaçırır. İkisi de aynı sonuca çıkar: kesintiyi müşterilerinizden öğrenirsiniz.
Bu rehber, fiziksel sunucular için dengeli bir izleme düzeni kurmayı anlatıyor.
Üç Katman
İzleme tek bir sistem değil, birbirini tamamlayan üç katmandır:
| Katman | Ne izler | Nerede çalışmalı |
|---|---|---|
| Dış erişilebilirlik | Site açılıyor mu? | Sunucunun dışında |
| Sistem metrikleri | CPU, bellek, disk, ağ | Sunucu üzerinde |
| Donanım sağlığı | RAID, disk, sıcaklık, güç | Yönetim denetleyicisi |
Birinci satırdaki "sunucunun dışında" vurgusu kritiktir: sunucu tamamen çöktüğünde üzerindeki izleme de çöker. Dış erişilebilirlik kontrolü, bağımsız bir yerden yapılmalıdır — yoksa en önemli olayı hiç öğrenemezsiniz.
Üçüncü satır ise fiziksel sunucuya özgüdür ve sanal ortamdan gelenlerin en sık atladığı katmandır.
İzlenmesi Gereken Metrikler
Sistem
- Disk doluluğu. En sık yaşanan ve en kolay önlenebilir arıza nedenidir. Eşiği erken kurun — dolmuş bir diskte müdahale etmek bile zorlaşır.
- Takas kullanımı. Kullanılmaya başlanması, bellek yetersizliğinin ve yaklaşan çökmenin en güvenilir erken sinyalidir.
- Yük ortalaması. Çekirdek sayısına göre yorumlanır. Kısa sıçramalar normaldir; kalıcı yükseklik müdahale gerektirir.
- I/O bekleme. Yüksekse sistem diski bekliyor demektir — CPU boş görünse bile performans düşüktür.
- Giden ağ trafiği. Açıklanamayan artış, kapasite sorunu değil güvenlik olayı göstergesidir.
Donanım
- RAID dizisi durumu. Bozulmuş bir dizi sessizdir; sistem normal çalışır. Fark edilmezse ikinci arızada veri kaybı yaşanır. Bu, fiziksel sunucuda izlenmesi gereken en kritik tek metriktir.
- Disk sağlık göstergeleri. Yeniden atanan sektör sayısındaki artış, arızayı haftalar önce haber verir.
- Sıcaklık ve fan hızları. Fan hızlarında kalıcı artış, hava akışı engeli veya arızalanan bir fan demektir.
- Güç kaynağı durumu. Yedekli güç kaynağında birinin arızalanması hizmeti kesmez — ve tam da bu yüzden fark edilmez.
- Bellek hata sayaçları. Düzeltilebilir hatalardaki artış, modülün arızalanma yolunda olduğunu gösterir.
Servis
- Kritik servislerin çalışıyor olması
- Web sunucusu yanıt süresi
- Veritabanı bağlantı sayısı
- SSL sertifikası bitiş tarihi
- Yedekleme görevinin tamamlanması
Eşik Belirleme
İzlemenin başarısı büyük ölçüde eşiklerin doğruluğuna bağlıdır. İki hata da maliyetlidir:
- Çok hassas eşik. Sürekli uyarı üretir. Bir süre sonra uyarılar görmezden gelinir ve gerçek bir sorun geldiğinde de fark edilmez. Bu, izleme sistemlerinin en yaygın ölüm biçimidir.
- Çok gevşek eşik. Sorun ancak kullanıcılar etkilendiğinde haber verir — yani geç kalır.
Doğru yaklaşım kademeli eşiktir: bir uyarı seviyesi (müdahale planlayın) ve bir kritik seviye (hemen müdahale edin). Ayrıca süre koşulu ekleyin — anlık bir sıçrama değil, belirli bir süre devam eden durum uyarı üretsin.
Bildirim Tasarımı
Uyarı üretmek yetmez; doğru kişiye, doğru kanaldan ve eyleme geçirilebilir bir içerikle ulaşmalıdır.
- Kanalı ciddiyete göre seçin. Kritik uyarılar için anlık bildirim (telefon, mesaj), bilgilendirme için e-posta. Her şeyi aynı kanaldan göndermek, önemliyi önemsizin içinde kaybeder.
- Mesajı eyleme dönük yazın. "Disk %92" yerine "sunucu-1 kök bölümü %92 dolu, temizlik gerekiyor" daha iyidir. Uyarıyı gece yarısı okuyacak kişiyi düşünün.
- Tekrarları bastırın. Aynı sorun için dakikada bir bildirim göndermek, sistemi kapatılmaya iter.
- Düzelmeyi de bildirin. Sorun çözüldüğünde haber verin ki kimse gereksiz yere müdahaleye koşmasın.
- Nöbet düzeni tanımlayın. Uyarı kime gidiyor? Yanıt vermezse kime yükseliyor? Tek bir kişinin telefonuna giden uyarılar, o kişi ulaşılamaz olduğunda kaybolur.
Log İzleme
Metrikler "sistem nasıl" sorusunu, loglar "ne oldu" sorusunu cevaplar. İkisi birlikte anlam kazanır.
İzlenmeye değer log kalıpları:
- Hata sayısındaki ani artış — metrikler normal görünürken bile sorunu haber verir
- Başarılı SSH girişleri — özellikle beklenmedik saatlerde veya kaynaklardan
- Yetkili anahtar dosyasında değişiklik
- Bellek tükenmesi kayıtları — açıklanamayan servis kapanmalarının nedeni
- Disk hata mesajları
Ayrıca logları sunucu dışına aktarın: sunucu ele geçirildiğinde yerel loglar değiştirilebilir, dışarıdakiler değiştirilemez.
Geçmiş Veri: Uyarıdan Daha Değerli
İzlemenin en az konuşulan faydası, geçmiş veridir. Uyarılar anlık sorunları yakalar; eğilim verisi ise sorun oluşmadan önce görmenizi sağlar.
Disk kullanımınız düzenli olarak artıyorsa, ne zaman eşiğe geleceğinizi bugünden hesaplayabilirsiniz. Bu, kapasite artırımını panik içinde değil planlı yapmanın tek yoludur.
Ayrıca normal davranışı bilmeden anormali tanıyamazsınız: salı günleri yükün ikiye katlandığını biliyorsanız bunu sorun sanmazsınız.
Sonuç
İyi bir izleme düzeni üç katmandan oluşur ve her biri farklı bir körlüğü kapatır: dış erişilebilirlik kontrolü (sunucu tamamen çöktüğünde haber alabilmek için sunucunun dışında olmalı), sistem metrikleri ve donanım sağlığı. Fiziksel sunucuda en kritik metrik RAID dizisi durumudur — çünkü bozulduğunda hiçbir belirti vermez ve fark edilmediğinde ikinci arızada veri kaybına dönüşür. Eşikleri kurarken tek kuralı hatırlayın: görmezden gelinen bir uyarı sistemi, hiç olmayan bir uyarı sisteminden daha tehlikelidir.
Sıkça Sorulan Sorular (SSS)
İzlemeye nereden başlamalıyım?
Üç şeyle: dışarıdan erişilebilirlik kontrolü, disk doluluğu uyarısı ve RAID dizisi durumu. Bu üçü, en sık yaşanan ve en ciddi sonuç doğuran olayları kapsar ve kurulumları kısadır.
Erişilebilirlik kontrolü neden sunucunun dışında olmalı?
Sunucu tamamen çöktüğünde üzerinde çalışan izleme de çöker ve size hiçbir bildirim gelmez. En kritik olayı öğrenememiş olursunuz. Bu kontrol bağımsız bir yerden yapılmalıdır.
Çok fazla uyarı alıyorum, ne yapmalıyım?
Eşikleri gözden geçirin ve süre koşulu ekleyin — anlık sıçramalar değil, belirli bir süre devam eden durumlar uyarı üretsin. Ayrıca uyarıları ciddiyete göre ayırın; her şey kritik değildir. Görmezden gelinen bir sistem, olmayan bir sistemle aynıdır.
RAID durumunu nasıl izlerim?
Donanımsal denetleyici kullanıyorsanız üreticinin yönetim aracı, yazılımsal RAID kullanıyorsanız sistemin durum dosyası bu bilgiyi verir. Önemli olan araç değil, dizi bozulduğunda size gerçekten ulaşan bir uyarı olmasıdır.