요청이 도착하지 않으면 애플리케이션 로그도 부족합니다

8월 6일부터 7일까지 관측 데이터의 환경 식별을 정리하고 네트워크와 DNS 장애 신호를 보강했습니다. 애플리케이션 오류율이 낮더라도 요청이 서비스에 도달하기 전에 실패하면 사용자 경험은 나빠질 수 있습니다. 내부 연결과 이름 해석을 별도의 관측 대상으로 다뤘습니다.

환경 식별도 같은 작업에서 확인했습니다. 수집 데이터가 다른 환경처럼 표시되면 운영자는 잘못된 대상을 조사하게 됩니다. 로그, 지표, 추적에서 같은 환경을 일관되게 가리키는지 대조했습니다.

알림이 설명해야 할 계층

네트워크 실패와 DNS 실패를 구분하면 확인 순서가 짧아집니다. 연결 자체가 실패하는지, 이름을 해석하지 못하는지, 준비된 서비스가 응답하지 않는지에 따라 다음 질문이 달라집니다. 알림에는 현상과 함께 확인할 계층이 드러나도록 정리했습니다.

  • 연결 상태와 이름 해석 상태를 따로 확인합니다.
  • 관측 대상과 환경 라벨을 교차 검증합니다.
  • 복구된 조건이 오래된 알림으로 반복되지 않는지 확인합니다.

복구 후에도 알림 상태를 확인합니다

같은 기간에는 이미 회복된 SLO 조건의 오래된 통지도 정리했습니다. 서비스 회복과 관측 규칙의 정상 평가, 알림 상태의 회복은 각각 확인해야 합니다. 이번 작업으로 장애를 더 많이 알리는 것보다 실제로 조사할 신호를 구분하는 기준을 보강했습니다.