이 문서는 데이터센스 플랫폼의 모니터링과 장애 알림이 어떤 컴포넌트로, 어떤 경로로 흐르는지 전체 그림을 설명한다. 개별 도구 사용 절차는 Manual에서 다룬다.
[메트릭] 앱/노드/ingress ─ Prometheus ─┬─ Grafana (대시보드)
└─ Alertmanager ─┐
[로그] 파드 ─ Alloy ─ Loki ─────────────┬─ Grafana │
└─ Loki ruler ──┤
[트레이스] 앱 ─ OTel Collector ─ Tempo ─ Grafana │
▼
Alerta (인시던트 허브)
│
▼
Discord (알림 채널)
세 가지 신호가 각각 다른 질문에 답한다.
| 신호 | 도구 | 답하는 질문 |
|---|---|---|
| 메트릭 | Prometheus / Grafana | 얼마나 나빠졌는가(범위·추세) |
| 로그 | Alloy / Loki | 무슨 일이 있었는가(오류 메시지) |
| 트레이스 | OTel / Tempo | 어디서 느려지거나 끊겼는가(병목) |
PrometheusRule(아래 인벤토리)을 평가해 alert를 발생.AlertmanagerConfig)가 severity=~warning|critical|major|minor alert를 Alerta webhook으로 전달. 그룹핑 키 alertname/service/instance, repeat 2h.k8s/infra/monitoring/manifests)| 파일 | 내용 |
|---|---|
platform-alert-rules.yaml |
배포 가용성, ingress 5xx, APM 에러율/지연(p95), Alerta/OTel/Tempo 상태, 파드 CIDR 잔재, Loki/Alloy 상태 |
platform-runtime-alerts.yaml |
CrashLoopBackOff, OOMKilled, CPU throttling, MySQL Ready 0, PVC 잔여, 노드 Memory/Disk Pressure |
platform-slo-rules.yaml |
가용성 SLO 레코딩 + 멀티윈도 번레이트(fast/slow) |
blackbox-exporter.yaml |
공개 엔드포인트 합성 프로브 + TLS 인증서 만료 임박 |
모든 규칙은 severity / environment / service / instance / group 라벨 스키마를 공유한다. 신규 규칙도 같은 스키마를 쓰므로 별도 라우팅 없이 같은 파이프라인을 탄다.
grafana.do4ai.com(NodePort 30300). 대시보드.grafana.do4ai.com Explore(데이터소스 Loki).alerta.do4ai.com(monitoring 네임스페이스). 인시던트 허브.TODO 확정 필요: 온콜/에스컬레이션 채널 분리).온보딩 트랙 3부. 관측과 SRE
이전: Alerta 사용법 (Manual) · 다음: 서비스별 관측과 조치 (지도) · 전체 경로: 시작하기: 신입 온보딩