이 문서는 알림 하나가 떴을 때, 그것을 어떻게 인시던트로 다루고 언제 사람을 더 부르는지(에스컬레이션) 흐름과 기준을 정리한다.
알림 발생 → Alerta 등록 → 분류(triage) → 대응 → 해소(resolve) → 회고
│
심각도/영향 판단
│
필요 시 에스컬레이션
플랫폼 알림은 4단계 라벨을 쓴다(platform-alert-rules.yaml 등).
| severity | 뜻 | 예 | 1차 기대 반응 |
|---|---|---|---|
| critical | 사용자 영향 큼/가용성 위협 | 배포 가용 0, MySQL Ready 0, fast burn, 엔드포인트 다운 | 즉시 대응 |
| major | 일부 기능·품질 저하 | 5xx 비율 높음, OOMKilled, PVC 잔여 부족 | 빠른 확인 |
| warning | 잠재 위험/추세 악화 | p95 상승, CPU throttling, slow burn, 인증서 임박 | 당일 내 조사 |
| minor | 경미/정보성 | 없음 | 모니터링 |
3. 운영 절차.아래는 제안값이다. 온콜 로테이션과 채널은 팀에서 확정해야 한다.
온보딩 트랙 3부. 관측과 SRE
이전: SLO·SLI와 에러 버짓 가이드 · 다음: 장애 대응 의사결정 가이드 · 전체 경로: 시작하기: 신입 온보딩