에이전트는 왜 기존 APM으로 안 보이는가
기존 APM은 "요청 하나가 정해진 경로를 따라 흐르고, 장애는 예외나 5xx로 드러난다"는 전제 위에 설계되었습니다. AI 에이전트는 이 전제를 정면으로 벗어납니다.
비결정적 다단계 실행: 같은 질문이라도 계획 단계의 판단에 따라 도구 호출이 3회로 끝날 수도, 17회를 돌 수도 있습니다. 평균 응답 시간 지표만 보면 p99 구간에서 무슨 일이 있었는지 재구성할 수 없습니다.계측 공백: 도구(Tool) 호출, 벡터 검색, 에이전트 간 핸드오프는 애플리케이션 프레임워크 바깥에서 일어나는 경우가 많아 자동 계측 범위에서 통째로 빠집니다.장애의 형태: 가장 위험한 실패는 예외가 아니라 HTTP 200으로 정상 반환된 그럴듯한 오답입니다. 상태 코드 기반 알림 규칙으로는 이 유형을 영원히 탐지하지 못합니다.결국 에이전트 운영에 필요한 관측은 "살아 있는가"가 아니라 "제대로 답했는가"를 대상으로 삼아야 합니다.
계측 표준: OpenTelemetry GenAI 시맨틱 컨벤션
OpenTelemetry는 생성형 AI 워크로드를 위한 GenAI 시맨틱 컨벤션을 정의하고 있습니다. 아직 실험적(experimental) 단계지만, 속성 이름을 표준에 맞춰 두면 관측 도구를 교체해도 데이터가 그대로 살아남습니다.
스팬 구조 설계
하나의 사용자 요청을 루트 스팬으로 두고, 그 아래에 계획 → 모델 추론 → 도구 호출 → 검증 → 최종 응답을 자식 스팬으로 중첩하는 구조가 기본입니다. 도구 호출 스팬에는 도구 이름, 입력 요약, 재시도 횟수, 실패 사유를 남깁니다.
필수 속성
모델 식별자, 요청 파라미터(temperature, max_tokens)입력/출력/추론 토큰 수와 캐시 적중 여부세션 ID와 대화 턴 번호(여러 요청을 하나의 세션으로 묶기 위함)프롬프트·응답 본문은 샘플링과 마스킹을 전제로 별도 저장벤더 전용 SDK에 프롬프트 로그를 가둬 두면 3년 뒤 도구를 바꿀 때 과거 품질 추이를 통째로 잃게 됩니다. 표준 속성으로 수집해 두는 것이 이관 비용을 줄이는 가장 확실한 방법입니다.
상시 평가(Continuous Evaluation) 파이프라인
배포 전 테스트셋 100건을 통과했다는 사실은 프로덕션 품질을 보장하지 않습니다. 실제 사용자 입력 분포는 테스트셋과 다르고, 모델 버전 업데이트만으로도 응답 성향이 바뀝니다.
샘플링 채점: 전체 트래픽의 5~10%를 LLM-as-judge로 채점해 정확성·근거 인용·형식 준수 점수를 트레이스에 다시 붙입니다.사람 검수 큐: 판정 점수가 임계값 미만이거나 판정기 신뢰도가 낮은 건만 큐로 보냅니다. 하루 10만 건 트래픽이라면 검수 대상은 수십 건 수준으로 관리 가능합니다.판정기 검증: 채점기 자체도 사람 라벨 200~300건과 정기적으로 일치율을 비교해야 합니다. 판정기가 흔들리면 모든 지표가 함께 흔들립니다.골든셋 회귀: 사람이 검수한 실패 사례는 즉시 회귀 테스트셋으로 승격시켜 다음 배포에서 재발 여부를 확인합니다.비용·품질·안전을 한 화면에서
트레이스에 토큰 수와 도구 호출 횟수가 붙어 있으면 요청 1건당 원가를 바로 계산할 수 있습니다. 이 단위 경제 지표는 실무에서 가장 빠르게 성과를 냅니다.
도구 호출이 평균 4회에서 9회로 늘어난 구간을 찾아내면 원인 프롬프트를 특정할 수 있습니다.응답 품질 점수를 유지하면서 추론 토큰을 줄이는 조합을 A/B로 비교합니다.정책 위반, 개인정보 노출, 프롬프트 인젝션 탐지 결과를 같은 트레이스 ID로 거버넌스 로그에 연결하면 사후 감사 대응 시간이 며칠에서 수 분으로 줄어듭니다.도입 로드맵
1단계 — 트레이싱: OpenTelemetry 기반으로 요청·도구 호출·토큰을 먼저 수집합니다. 보통 2~3주면 기본 가시성이 확보됩니다.2단계 — 평가셋 구축: 실제 트래픽에서 대표 사례 200~500건을 뽑아 골든셋을 만들고 채점 기준을 문서화합니다.3단계 — 회귀 감시 자동화: 배포 파이프라인에 품질 게이트를 붙이고, 점수 하락과 비용 급증에 알림을 겁니다.POLYGLOTSOFT는 AI 시스템 구축·운영 과정에서 트레이싱, 상시 평가, 비용 대시보드, 거버넌스 로그를 기본 세트로 함께 설계합니다. 이미 운영 중인 에이전트의 관측 체계를 점검하거나 신규 AI 프로젝트를 신뢰성 있게 시작하고 싶으시다면 언제든 문의해 주시기 바랍니다. 현재 구성을 진단하고 단계별 도입 계획을 함께 정리해 드리겠습니다.