장애 상황에서 롤백할지, 핫픽스할지, 더 지켜볼지, 사람을 더 부를지를 같은 기준으로 빠르게 판단하기 위한 문서다.
이 답에 따라 아래 결정 표를 적용한다.
| 상황 | 1차 결정 |
|---|---|
| 최근 배포 직후 critical/에러율 급증 | 즉시 롤백(직전 정상 이미지/리비전). 원인 분석은 롤백 후. |
| 원인이 명확한 단순 버그(설정·환경값) | 핫픽스 후 재배포. 롤백보다 빠르면 우선. |
| 인프라 신호(노드 Pressure, PVC, MySQL Ready 0) | 앱 재배포가 아니라 인프라 조치(용량·재기동). |
| slow burn/추세 악화, 즉시 영향 미미 | 지켜보며 조사, 당일 개선 과제화. |
| 다중 서비스 동시 critical | 광역 장애로 간주, 즉시 에스컬레이션 + 공통 인프라(ingress/DB/관측) 우선 확인. |
3. 운영 절차, 도구 사용법은 Manual/04 ArgoCD 사용법·k3s 클러스터 접속과 GitOps 배포 점검.온보딩 트랙 3부. 관측과 SRE
이전: 알림에서 인시던트, 에스컬레이션까지 · 다음: Ingress, 도메인, 이미지, 환경 변수 변경 절차 (Manual) · 전체 경로: 시작하기: 신입 온보딩