Incident Merkezli Bakış
Serverless gözlemlenebilirlik tartışmaları çoğu zaman araç listesinden başlar; gerçek ölçekteki kırılımlar ise çoğunlukla korelasyon kırığıdır. Bir ödeme incident'ında edge function, kuyruk worker'ı ve dış servis callback'i arasında trace zinciri kopuktu. Her panel tek tek sağlıklı görünürken kullanıcı yolculuğu uçtan uca bozulmuştu.
Geçici runtime ortamlarında trace, log ve iş metriklerini birlikte anlamlı tutmanın pratik yaklaşımı.
Dashboard'dan Önce Sinyal Tasarımı
Serverless ekiplerde gözlemlenebilirlik, altyapı metrikleri etrafında değil iş adımları etrafında tasarlanmalı. Her kritik iş adımını correlation id, tenant id ve intent metadatası içeren bir event sözleşmesiyle modellediğimizde, kopuk log kümelerinden tahmin yürütmek yerine gerçek akışı tekrar kurabiliyoruz.
İlk adımda uçtan uca correlation id standardı kurun. Edge'e gelen her istek, kuyruklar ve background job'lar boyunca taşınan stabil bir trace id üretmelidir.
İkinci adımda telemetri katmanlarını ayırın. Yüksek cardinality debug log'lar kısa süre saklanmalı; kalıcı iş olayları ise uzun ömürlü analitik depolara gitmelidir.
Operasyonel Müdahale Modeli
Runbook yapımız etki alanına göre ayrılır: checkout bozulması, kısmi retry fırtınası, downstream timeout zinciri. Her sınıfın net mitigation adımı ve geri dönüş penceresi vardır. Incident sırasında ham log taramasıyla değil, önce kullanıcı etkisi segmentiyle başlar sonra runtime katmanına ineriz.
Üçüncü adımda cold start, bağımlılık gecikmesi ve timeout sınırlarını birinci sınıf metrik olarak izleyin. Serverless yapılarda kullanıcı etkisini en erken bunlar haber verir.
En büyük anti-pattern, sağlayıcı varsayılanlarını ürün gözlemlenebilirliği sanmaktır. Platform dashboard'ları yararlıdır ancak alan modelinizi, kullanıcı yolculuklarını ve gelir kritik akışları doğal olarak temsil etmez.
Ölçek Büyüdüğünde Değişen Şey
Düşük trafikte ad-hoc loglama yeterli gibi görünebilir. Eşzamanlılık arttığında cardinality kontrolü, sampling politikası ve kalıcı event depolama birer mimari karara dönüşür. Bu kararları erteleyen ekipler daha uzun MTTR ve daha düşük release güveniyle karşılaşır.
Bu yazı için kontrol listesi:
- Implementasyon öncesi ölçülebilir başarı kriterini netleştirin.
- Mimari kararlara rollback ve sahiplik kuralları ekleyin.
- Production sinyallerini sadece incident anında değil düzenli izleyin.
- Her milestone için deployment ve migration stratejisini açık yazın.
Son not:
Ölçekte serverless gözlemlenebilirlik bir araç listesi değil, ürün yeteneğidir.



