기본 3-Phase 스펙에서 시작해 운영 중 나온 질문들이 방향을 바꿨습니다. 수십 개 세션에서 추린 결정적 순간들입니다.
Session 2 — 알림 임계치 설정 중, 개발/운영 서버 혼재 환경에서
개발자
이 시스템은 항상 최고의 퍼포먼스를 내는 주요 시스템 기준으로 진행해줘.
PRD 서버들은 임계치 엄격하게, 알림도 놓치지 않게 관리해야 해.
Claude
server_overrides로 PRD 5대 CPU warning=70% / critical=85% 별도 임계치 적용하고, 알림 쿨다운도 PRD는 5분, 그 외는 30분으로 분리합니다.
DataDog, New Relic 레퍼런스를 보면서 — 기능 로드맵 설계 시점
개발자
DataDog 같은 상용 APM 참고해서 사용자 체감 관점으로 고도화 우선순위 뽑아줘.
세분화된 페이지는 그대로 두고, 한눈에 조치까지 가능한 통합 뷰가 필요해.
Claude
우선순위: ① Apdex Score (응답 만족도 지수), ② 서비스 토폴로지 맵 (WAS↔DB 의존성), ③ 자동 장애 타임라인 (에러↔배포↔메트릭 상관), ④ 엔드포인트 트레이스 (요청~응답 전 구간). Unified Ops Center 뷰로 통합 구현합니다.
RCA AI 분석 비용 검토 — Gemini Free Tier 가능 여부 확인
개발자
RCA 분석 AI를 Gemini 2.5 Flash 무료 티어로 교체 가능해?
Rate Limit 걸리면 분석 횟수를 대폭 줄여야 할 텐데, 최적화 방안도 같이 설계해줘.
Claude
교체 가능합니다. 무료 티어 분당 15 RPM 제한 대응: ① 동일 에러 그룹 결과 캐싱 (TTL 1시간), ② 슬로우쿼리 EXPLAIN 결과 재사용, ③ 배포 분석은 배포 이벤트당 1회로 제한. 실질 API 호출 80% 이상 절감 가능합니다.
RCA 분석 결과가 맥락 부족으로 부정확하게 나온 이후
개발자
RCA가 에러 로그만 보고 판단하니까 배포나 트래픽 급증 같은 외부 요인을 못 잡아.
에러 단독 분석이 아니라 전후 컨텍스트까지 묶어서 분석하는 방식으로 고도화해줘.
Claude
RCA 컨텍스트 확장: ① 에러 발생 T-5분 CPU/메모리/스레드 스냅샷 자동 첨부, ② 직전 30분 배포 이력 포함, ③ 동일 시각 다른 서버 에러 상관 분석. 단일 에러가 아닌 타임라인 기반 원인 추론으로 전환합니다.
쿼리 분석 페이지 로딩이 느려지기 시작한 시점 — 데이터 규모 증가
개발자
쿼리 분석 페이지 로드가 점점 느려지는데, 근본 원인 파악하고 개선안 제시해줘.
단순 페이지네이션 말고 구조적으로 해결해야 할 것 같아.
Claude
원인: slow_queries 테이블 풀스캔 + 집계 쿼리 미캐싱. 개선안: ① duration_ms + created_at 복합 인덱스 추가, ② 히트맵 집계를 1시간 단위 materialized view로 전환, ③ 상위 100건만 로드 후 무한 스크롤 적용. 예상 응답 시간 8초 → 0.4초.