PHP API 장애를 Metrics·JSON Logs·Traces로 좁히기 — request_id 연결 실습
PHP API 장애를 Metrics·JSON Logs·Traces로 좁히기 — request_id 연결 예시 도입 Metrics, Logs, Traces의 뜻을 각각 알고 ...
Hee Blog
서버 운영, 모니터링, 백업·복구, 보안 설정 등 일상적인 운영과 트러블슈팅 기록을 모아둔 카테고리입니다.
PHP API 장애를 Metrics·JSON Logs·Traces로 좁히기 — request_id 연결 예시 도입 Metrics, Logs, Traces의 뜻을 각각 알고 ...
도입 서비스 운영에서 “안정적이다”는 표현은 모호하다. 기준이 없으면 장애 판단도 달라진다. 그래서 실무에서는 숫자로 목표를 정의한다. 대표 개념이 SLA, SLO, S...
이 글은 서비스 장애·안정성과 관련된 네 가지 주제 — 장애 대응 체크리스트, 포스트모템 작성 방법, 온콜(On-call) 경험 정리, 데이터베이스 장애 시나리오 — 를 개발자·운...
블루·그린, 카나리와 롤링 배포를 모두 설명해도 서버 한 대에서 실제로 무엇을 실행할지 정해지지 않으면 도움이 되기 어렵다. 이 글은 Nginx와 PHP-FPM이 있는 단일 EC2...
트래픽이 증가한다고 Redis, 로드 밸런서, 복제 DB와 큐를 한꺼번에 추가하면 운영 지점만 늘어날 수 있다. 확장은 현재 병목과 실패 조건을 측정한 뒤 가장 작은 변화부터 적용...
도입 dump 명령이 성공하고 파일이 존재해도 그 파일이 원하는 시점과 범위의 데이터를 복원한다는 보장은 없다. 백업은 격리된 환경에 복원하고 구조·데이터·애플리케이션 읽기를...
서버 CPU 사용률이 높다는 것은 단순히 “바쁘다”는 의미가 아니다. 정상 트래픽인지, 비정상 반복 연산인지, 특정 프로세스 폭주인지 구분해야 한다. 무작정 서버 스펙을 올리는 ...
운영 중 서버가 다운되면 가장 중요한 것은 “빨리 고치는 것”이 아니라 “순서대로 확인하는 것”이다. 무작정 재부팅부터 하면 원인 분석이 불가능해지고, 동일 장애가 반복된다. ...
도입 브라우저 자물쇠만으로는 서버가 어떤 인증서 체인을 제공하고 어떤 호스트 이름을 포함하는지 기록하기 어렵다. OpenSSL은 TLS 연결, 인증서 체인, 유효기간과 Sub...
도입 외부 API나 다른 서비스가 느려지면 내 서비스까지 같이 느려지는 경우가 많다. 문제는 실패 자체보다 장애가 연쇄적으로 퍼지는 상황이다. 이걸 막기 위한 대표...
도입 최소 권한은 GRANT 문장을 작성하는 것으로 끝나지 않는다. 애플리케이션이 필요한 작업은 성공하고, 스키마 변경·계정 관리·시스템 테이블 조회는 실패하는지 실제 계정으...
서버 운영 중 자주 발생하는 오류와 그에 대한 처리 방법, 그리고 사전 방지 방안을 정리한 내용이다. 디스크, 메모리, 프로세스, 네트워크, 로그 관련 항목을 중심으로 서술한다. ...
도입 기능 배포는 했지만 사용자에게 바로 공개하면 위험한 경우가 많다. 특히 결제, 정산, 신규 UI 같은 기능은 문제가 생기면 영향 범위가 크다. 이때 사용하는 ...