블로그 목록으로
인공지능

사내 AI가 느리다는 불만이 나올 때: 프롬프트 캐싱·배치·스트리밍으로 응답 속도와 단가를 함께 잡는 설계

사내 AI가 느리다는 불만은 모델 교체보다 구조 개선으로 푸는 편이 빠릅니다. 프롬프트 캐싱, 배치 처리, 스트리밍, 출력 길이 조정으로 응답 속도와 건당 비용을 함께 낮추는 설계 방법을 정리했습니다.

POLYGLOTSOFT 기술팀2026-10-057분 소요0
프롬프트 캐싱LLM 응답속도배치 처리스트리밍AI 서비스 설계

정확도는 통과했는데 사용자가 떠나는 이유

사내 AI를 도입할 때 검증은 대개 답변 정확도에 집중됩니다. 그런데 운영을 시작하면 가장 먼저 나오는 불만은 "느리다"인 경우가 많습니다. 사용성 연구에서 오래 인용되어 온 기준에 따르면 응답이 1초를 넘으면 생각의 흐름이 끊기기 시작하고, 10초를 넘으면 사용자는 다른 일로 주의를 돌립니다. 답이 정확해도 기다리다 지친 직원이 검색창이나 옆자리 동료에게 돌아가면 활용률은 오르지 않습니다.

지연은 두 가지로 나눠서 봐야 합니다.

  • 첫 토큰 시간(TTFT): 요청 후 첫 글자가 나올 때까지의 시간입니다. 입력 길이와 검색·도구 호출 같은 전처리 단계가 좌우합니다.
  • 전체 완료 시간: 마지막 토큰까지 걸리는 시간입니다. 출력 길이에 거의 비례합니다.
  • 두 지표는 원인이 다르므로 처방도 다릅니다.

    프롬프트 캐싱: 반복되는 앞부분을 다시 계산하지 않기

    주요 LLM API는 요청의 앞부분이 이전 요청과 완전히 같으면 그 구간을 다시 계산하지 않고 재사용합니다. 캐시에서 읽은 입력 토큰은 제공사와 모델에 따라 정가의 절반에서 10% 이하 수준까지 낮게 과금되고, TTFT도 함께 줄어듭니다.

    예를 들어 시스템 프롬프트와 사규 문서가 8,000토큰, 사용자 질문이 200토큰인 챗봇을 가정해 보겠습니다. 캐시 읽기 단가가 정가의 10%라면 캐시가 적중한 요청의 입력 비용은 8,200토큰분에서 1,000토큰분으로 약 88% 줄어듭니다. 다만 제공사에 따라 캐시를 처음 기록할 때 할증이 붙기도 하므로, 실제 절감 폭은 적중률에 달려 있습니다.

    핵심은 변하지 않는 것을 앞에, 변하는 것을 뒤에 두는 순서입니다. 도구 정의 → 시스템 프롬프트 → 참조 문서 → 대화 이력 → 이번 질문 순으로 배치합니다. 적중률을 떨어뜨리는 흔한 실수는 다음과 같습니다.

  • 시스템 프롬프트 첫머리에 현재 시각이나 요청 ID를 넣는 경우
  • 검색된 문서나 도구 정의의 순서가 요청마다 달라지는 경우
  • 사용자 이름·부서 같은 개인화 정보를 고정 구간 앞에 두는 경우
  • 캐시 수명이 보통 수 분 단위라는 점을 놓쳐, 트래픽이 뜸한 서비스에서 매번 만료되는 경우
  • 실시간이 필요 없는 일은 배치로 돌리기

    주요 제공사의 배치 API는 24시간 이내 처리를 조건으로 정가의 절반 수준 단가를 적용합니다. 판단 기준은 단순합니다. 결과를 기다리는 사람이 지금 화면 앞에 있는가입니다.

  • 배치 대상: 회의록 야간 요약, 고객 문의 분류, 문서 태깅, 평가 세트 재실행
  • 실시간 경로와 배치 경로를 큐로 분리해, 대량 작업이 실시간 요청의 분당 호출 한도를 잠식하지 않게 합니다.
  • 배치 작업에는 멱등 키를 부여하고, 실패 건만 골라 재처리하는 구조를 둡니다.
  • 체감 속도를 바꾸는 스트리밍과 화면 설계

    스트리밍은 전체 완료 시간을 줄이지 못합니다. 대신 기다리는 시간을 읽는 시간으로 바꿉니다.

  • 진행 상태 표시: "문서 검색 중 → 3건 확인 → 답변 작성 중"처럼 단계를 보여 줍니다.
  • 중간 결과 노출: 답변보다 먼저 검색된 출처 목록을 띄웁니다.
  • 비동기 처리: 1분 이상 걸리는 보고서 생성 등은 접수 즉시 작업 ID를 돌려주고, 완료 시 사내 메신저나 메일로 알립니다.
  • 업무별로 모델 크기와 출력 길이 조정하기

    전체 완료 시간은 출력 토큰이 좌우합니다. 초당 50토큰을 생성하는 모델이라면 1,000토큰 답변은 20초, 300토큰 답변은 6초가 걸립니다.

  • 최대 출력 토큰을 업무별로 설정하고, "3줄 요약"처럼 형식을 지정합니다.
  • 상세 설명은 "자세히 보기"로 분리해 필요한 사람만 요청하게 합니다.
  • 분류·라우팅·정보 추출 같은 단계는 작은 모델로 충분한 경우가 많습니다. 실제 요청 100~200건으로 평가 세트를 만들어 큰 모델과 결과를 비교하고, 합격 기준을 넘는 단계부터 교체합니다.
  • 측정 없이는 개선도 없다: 지연·비용 관측 지표

    평균값은 문제를 숨깁니다. p50이 2초여도 p95가 20초라면 스무 번에 한 번은 20초 이상 기다린다는 뜻이고, 사용자는 그 한 번을 기억합니다.

  • 지연 분포: TTFT와 전체 완료 시간을 각각 p50/p95로 기록합니다.
  • 캐시 적중률: 전체 입력 토큰 중 캐시에서 읽은 비율입니다. 배포 직후 급락하면 프롬프트 앞부분이 바뀐 것입니다.
  • 건당 비용: 기능별·부서별로 집계해 어디에 돈이 쓰이는지 확인합니다.
  • 입출력 토큰 수: 지연과 비용의 원인을 추적하는 기본 자료입니다.
  • POLYGLOTSOFT의 AI 서비스 최적화 지원

    느린 AI는 모델을 바꾸기 전에 구조부터 점검해야 합니다. POLYGLOTSOFT는 운영 중인 사내 AI 서비스의 요청 로그를 분석해 지연 구간과 비용 구조를 진단하고, 프롬프트 재배치, 실시간·배치 경로 분리, 스트리밍 UI, 관측 대시보드 구축까지 지원합니다. 사내 AI의 속도와 비용이 고민이시라면 POLYGLOTSOFT에 문의해 주시기 바랍니다.

    기술 상담이 필요하신가요?

    스마트공장, AI, 물류자동화 분야의 전문 컨설턴트가 귀사의 요구사항을 분석해 드립니다.

    무료 상담 신청