정확도는 통과했는데 사용자가 떠나는 이유
사내 AI를 도입할 때 검증은 대개 답변 정확도에 집중됩니다. 그런데 운영을 시작하면 가장 먼저 나오는 불만은 "느리다"인 경우가 많습니다. 사용성 연구에서 오래 인용되어 온 기준에 따르면 응답이 1초를 넘으면 생각의 흐름이 끊기기 시작하고, 10초를 넘으면 사용자는 다른 일로 주의를 돌립니다. 답이 정확해도 기다리다 지친 직원이 검색창이나 옆자리 동료에게 돌아가면 활용률은 오르지 않습니다.
지연은 두 가지로 나눠서 봐야 합니다.
두 지표는 원인이 다르므로 처방도 다릅니다.
프롬프트 캐싱: 반복되는 앞부분을 다시 계산하지 않기
주요 LLM API는 요청의 앞부분이 이전 요청과 완전히 같으면 그 구간을 다시 계산하지 않고 재사용합니다. 캐시에서 읽은 입력 토큰은 제공사와 모델에 따라 정가의 절반에서 10% 이하 수준까지 낮게 과금되고, TTFT도 함께 줄어듭니다.
예를 들어 시스템 프롬프트와 사규 문서가 8,000토큰, 사용자 질문이 200토큰인 챗봇을 가정해 보겠습니다. 캐시 읽기 단가가 정가의 10%라면 캐시가 적중한 요청의 입력 비용은 8,200토큰분에서 1,000토큰분으로 약 88% 줄어듭니다. 다만 제공사에 따라 캐시를 처음 기록할 때 할증이 붙기도 하므로, 실제 절감 폭은 적중률에 달려 있습니다.
핵심은 변하지 않는 것을 앞에, 변하는 것을 뒤에 두는 순서입니다. 도구 정의 → 시스템 프롬프트 → 참조 문서 → 대화 이력 → 이번 질문 순으로 배치합니다. 적중률을 떨어뜨리는 흔한 실수는 다음과 같습니다.
실시간이 필요 없는 일은 배치로 돌리기
주요 제공사의 배치 API는 24시간 이내 처리를 조건으로 정가의 절반 수준 단가를 적용합니다. 판단 기준은 단순합니다. 결과를 기다리는 사람이 지금 화면 앞에 있는가입니다.
체감 속도를 바꾸는 스트리밍과 화면 설계
스트리밍은 전체 완료 시간을 줄이지 못합니다. 대신 기다리는 시간을 읽는 시간으로 바꿉니다.
업무별로 모델 크기와 출력 길이 조정하기
전체 완료 시간은 출력 토큰이 좌우합니다. 초당 50토큰을 생성하는 모델이라면 1,000토큰 답변은 20초, 300토큰 답변은 6초가 걸립니다.
측정 없이는 개선도 없다: 지연·비용 관측 지표
평균값은 문제를 숨깁니다. p50이 2초여도 p95가 20초라면 스무 번에 한 번은 20초 이상 기다린다는 뜻이고, 사용자는 그 한 번을 기억합니다.
POLYGLOTSOFT의 AI 서비스 최적화 지원
느린 AI는 모델을 바꾸기 전에 구조부터 점검해야 합니다. POLYGLOTSOFT는 운영 중인 사내 AI 서비스의 요청 로그를 분석해 지연 구간과 비용 구조를 진단하고, 프롬프트 재배치, 실시간·배치 경로 분리, 스트리밍 UI, 관측 대시보드 구축까지 지원합니다. 사내 AI의 속도와 비용이 고민이시라면 POLYGLOTSOFT에 문의해 주시기 바랍니다.
