SLA / SLO / SLI 개념과 실무 운영 기준
도입 서비스 운영에서 “안정적이다”는 표현은 모호하다. 기준이 없으면 장애 판단도 달라진다. 그래서 실무에서는 숫자로 목표를 정의한다. 대표 개념이 SLA, SLO, S...
로그 설계, 분산 추적, 메트릭 등 시스템 가시성과 모니터링 방법론을 정리합니다.
도입 서비스 운영에서 “안정적이다”는 표현은 모호하다. 기준이 없으면 장애 판단도 달라진다. 그래서 실무에서는 숫자로 목표를 정의한다. 대표 개념이 SLA, SLO, S...
도입 서비스 운영에서 Metrics, Logs, Traces를 구분하지 않으면 분석 속도가 느려진다. 세 가지는 모두 필요하지만 역할이 완전히 다르다. 실무에서는 ...
이 글은 인프라·배포·운영을 시작할 때 자주 고민하게 되는 네 가지 주제 — 제로 다운타임 배포 전략, AWS RDS 운영 시 실수하기 쉬운 점, 서버 한 대에서 시작하는 모니터링...
도입 서비스가 여러 개로 분리되면 요청 하나의 흐름을 추적하기 어려워진다. 로그만으로는 어디서 느려졌는지, 어디서 실패했는지 파악이 힘들다. 이 문제를 해결하는 방...
도입 문자열 로그는 사람이 읽기는 쉽지만 검색과 집계가 어렵다. 서비스가 커질수록 로그는 분석 대상이 된다. 이때 필요한 방식이 Structured Logging이다. ...
도입 로그를 많이 남긴다고 운영이 쉬워지는 것은 아니다. 중요한 것은 상황에 맞는 로그 레벨을 일관되게 남기는 것이다. 로그 레벨이 섞이면 장애 상황에서 원인을 찾기 어렵...