SLA / SLO / SLI 개념과 실무 운영 기준
도입 서비스 운영에서 “안정적이다”는 표현은 모호하다. 기준이 없으면 장애 판단도 달라진다. 그래서 실무에서는 숫자로 목표를 정의한다. 대표 개념이 SLA, SLO, S...
Hee Blog
서버 운영, 모니터링, 백업·복구, 보안 설정 등 일상적인 운영과 트러블슈팅 기록을 모아둔 카테고리입니다.
도입 서비스 운영에서 “안정적이다”는 표현은 모호하다. 기준이 없으면 장애 판단도 달라진다. 그래서 실무에서는 숫자로 목표를 정의한다. 대표 개념이 SLA, SLO, S...
도입 서비스 운영에서 Metrics, Logs, Traces를 구분하지 않으면 분석 속도가 느려진다. 세 가지는 모두 필요하지만 역할이 완전히 다르다. 실무에서는 ...
이 글은 서비스 장애·안정성과 관련된 네 가지 주제 — 장애 대응 체크리스트, 포스트모템 작성 방법, 온콜(On-call) 경험 정리, 데이터베이스 장애 시나리오 — 를 개발자·운...
이 글은 인프라·배포·운영을 시작할 때 자주 고민하게 되는 네 가지 주제 — 제로 다운타임 배포 전략, AWS RDS 운영 시 실수하기 쉬운 점, 서버 한 대에서 시작하는 모니터링...
도입 서비스가 여러 개로 분리되면 요청 하나의 흐름을 추적하기 어려워진다. 로그만으로는 어디서 느려졌는지, 어디서 실패했는지 파악이 힘들다. 이 문제를 해결하는 방...
도입 문자열 로그는 사람이 읽기는 쉽지만 검색과 집계가 어렵다. 서비스가 커질수록 로그는 분석 대상이 된다. 이때 필요한 방식이 Structured Logging이다. ...
도입 로그를 많이 남긴다고 운영이 쉬워지는 것은 아니다. 중요한 것은 상황에 맞는 로그 레벨을 일관되게 남기는 것이다. 로그 레벨이 섞이면 장애 상황에서 원인을 찾기 어렵...
서비스 초기에는 단일 서버로도 충분하지만, 트래픽이 증가하면 구조적인 대응이 필요해진다. 단순히 서버 스펙을 올리는 것만으로는 한계가 있고, 일정 수준 이후에는 아키텍처 자체를 ...
서버 CPU 사용률이 높다는 것은 단순히 “바쁘다”는 의미가 아니다. 정상 트래픽인지, 비정상 반복 연산인지, 특정 프로세스 폭주인지 구분해야 한다. 무작정 서버 스펙을 올리는 ...
운영 중 서버가 다운되면 가장 중요한 것은 “빨리 고치는 것”이 아니라 “순서대로 확인하는 것”이다. 무작정 재부팅부터 하면 원인 분석이 불가능해지고, 동일 장애가 반복된다. ...
도입 외부 API나 다른 서비스가 느려지면 내 서비스까지 같이 느려지는 경우가 많다. 문제는 실패 자체보다 장애가 연쇄적으로 퍼지는 상황이다. 이걸 막기 위한 대표...
도입 애플리케이션이 root로 접속하면 SQL Injection이나 인증 정보 유출 한 번으로 서버 전체가 위험해진다. 필요한 작업별 역할을 만들고, 계정의 접속 출발지와 T...
서버 운영 중 자주 발생하는 오류와 그에 대한 처리 방법, 그리고 사전 방지 방안을 정리한 내용이다. 디스크, 메모리, 프로세스, 네트워크, 로그 관련 항목을 중심으로 서술한다. ...
도입 기능 배포는 했지만 사용자에게 바로 공개하면 위험한 경우가 많다. 특히 결제, 정산, 신규 UI 같은 기능은 문제가 생기면 영향 범위가 크다. 이때 사용하는 ...