Production'da çalışan uygulamada hata mutlaka olur. Soru "olacak mı?" değil, "olduğunda farkına varıp ne kadar hızlı çözeceksin?". Monitoring olmayan production = kör uçuş.
Observability'nin 3 ayağı
- Logs
- Olayların ham metni. "User 123 login failed at 14:32"
- Metrics
- Zaman serisi numerik. "CPU %72, request count 450/dk"
- Traces
- Request'in tüm sistem boyunca yolculuğu. Microservice debug.
Error tracking — Sentry
Frontend + backend hata yakalama. Stack trace, breadcrumb, user context, replay video. Free tier 5K event/ay. KOBİ için Pro $26/ay. Production'da olmazsa olmaz.
APM (Application Performance Monitoring)
- Datadog — sektör lideri, pahalı, kurumsal
- New Relic — Datadog rakibi
- Grafana Cloud — açık kaynak temelli managed
- AppSignal — KOBİ dostu, ucuz
- Sentry Performance — Sentry'nin APM modülü
Log management
- ELK stack
- Elasticsearch + Logstash + Kibana, self-host
- Loki
- Grafana ekosistemi, ucuz
- Datadog Logs
- Managed, pahalı ama güçlü
- Better Stack
- Modern log + monitoring
- Axiom
- Serverless log, modern
Uptime monitoring
- Uptime Kuma — self-host, ücretsiz
- Better Stack — modern UI
- Pingdom — eski popüler
- StatusCake — esnek
- Cloudflare — DNS + uptime + alert
OpenTelemetry — açık standard
OTel, log + metric + trace için açık kaynak instrumentation standart. Vendor lock-in'den kaçınmak için kritik. Modern app'lerde Otel ile instrument et, sonra herhangi bir backend'e (Datadog, Grafana, Honeycomb) gönder.
Alerting
- Error rate spike — %2'den %10'a çıktı
- Latency degradation — p95 > 1sn
- Uptime down — 5 dk kesinti
- Resource alert — CPU %85+ 10dk
- Custom business metrics — checkout dönüşüm %5 düştü
- Smart alert — anomali detection (AI)
Dashboard öncelikleri
- 01Request rate (RPM)
- 02Error rate (%)
- 03p50, p95, p99 latency
- 04Database query latency
- 05External API latency (Stripe, etc.)
- 06Memory + CPU utilization
- 07Business metrics — conversion, signup, MRR
KOBİ için pratik stack
Sentry (error) + Better Stack veya Uptime Kuma (uptime) + Vercel/Cloudflare built-in analytics. Aylık $30-100 maliyet. Datadog/New Relic enterprise için.
İncident response
- 01Alert al
- 02Severity belirle (P0-P3)
- 03On-call dev sorumlu
- 04Status page güncelle
- 05Müşteri iletişim (5+ dk kesintide)
- 06Çöz, doğrula, normalleştir
- 07Post-mortem yaz (24-48 saat içinde)
Şunu yapmayın: alert spam'i
Günde 50 alert gelirse ekip alert fatigue yaşar — kritikleri görmez. Sıkı threshold, smart grouping, severity-based routing kullan.
NotObservability stack kurulum: +90 537 729 40 97 (WhatsApp). Sentry + log + uptime + dashboard 1 hafta canlı.