AI 뉴스 · API 비용
GPT-6 캐싱, 할인율보다 재사용 조건을 봅니다
OpenAI가 GPT-6의 프롬프트 캐싱과 관측·진단 도구를 개선했습니다. 30분 안에 재사용하는 적격 문맥에 할인을 적용하며 최대 90% 할인은 전체 청구액이 아닌 캐시 입력 토큰 기준입니다.
이 글에서 다룰 내용
30분 재사용 조건, 캐시 대시보드·진단 도구, 명시적 경계와 추론 강도, 프리워밍과 비용 검증
답변을 복사하는 것이 아니라 입력 처리를 재사용합니다
OpenAI가 2026년 9월 22일 ‘Better prompt caching for GPT-6’를 발표했습니다. 이번 소식의 중심은 모델 출시 전반이 아니라 API 프롬프트 캐싱 개선과 관측·진단 도구 업데이트입니다.
AI 에이전트는 작업을 이어가면서 같은 지시문, 도구 정의, 앞선 대화 문맥을 반복해서 전달합니다. 프롬프트 캐싱은 이처럼 반복되는 입력 앞부분의 처리 결과를 재사용해 같은 내용을 처음부터 다시 계산하는 부담을 줄입니다.
이미 만든 답변을 그대로 반환하는 응답 캐시가 아닙니다. 모델은 재사용한 문맥과 새 입력을 바탕으로 답변을 새로 생성합니다.
30분 재사용과 최대 90% 할인, 적용 범위가 중요합니다
공식 발표는 적격 공유 프리픽스가 30분 창 안에서 재사용되면 캐시 할인 대상이 된다고 설명합니다. 프리픽스는 여러 요청에서 동일하게 유지되는 프롬프트의 앞부분을 뜻합니다.
모든 입력이나 모든 요청에 30분 동안 무조건 할인이 붙는다는 의미는 아닙니다. 앞부분의 일치 여부와 캐시 경계, 최소 길이 등 적격 조건을 충족해야 합니다.
최대 90% 할인도 캐시에서 재사용한 입력 토큰에 적용되는 할인입니다. 전체 API 비용이 90% 줄어든다는 보장이나 ChatGPT 구독료 인하 소식으로 해석하면 안 됩니다.
실제 청구액에는 새 입력과 출력, 캐시 쓰기 비용 등이 함께 반영됩니다. 반복 문맥이 많은 작업인지, 한 번만 처리하는 내용이 많은지에 따라 절감 효과가 달라집니다.
대시보드는 흐름을, 캐시 진단은 원인을 보여줍니다
새 Prompt Caching Dashboard에서는 기간별 캐시 적중률과 입력 구성을 확인합니다. 캐시 입력과 비캐시 입력이 어떻게 달라지는지 살펴보면 애플리케이션을 수정한 뒤 재사용 비중이 떨어졌는지도 파악할 수 있습니다.
캐시 진단 도구는 현재 요청을 최근 응답과 비교합니다. 모델, 도구, 설정, 입력의 변화 중 무엇이 예상한 문맥 재사용을 막았는지 알려주고 영향을 받은 토큰의 추정치도 제공합니다.
공식 예시의
tools_changed
는 도구 변경을 뜻합니다. 진단에 나오는 토큰 추정치는 문제의 영향을 가늠하는 정보이지, 실제 비용 절감 성과가 아닙니다.
진단 도구가 모든 실패 원인을 자동으로 해결하지는 않습니다. 확인된 원인을 수정한 뒤 다시 비교하고 실제 사용량과 청구 정보로 개선 여부를 판단해야 합니다.
고정 문맥은 앞쪽에, 바뀌는 내용은 뒤쪽에 둡니다
명시적 캐시 브레이크포인트는 재사용할 프롬프트 앞부분의 끝을 직접 선택하는 경계입니다. 공통 지시문과 참고 자료 뒤에 경계를 두면 뒤쪽의 개별 질문이 바뀌는 작업에서 재사용 범위를 설계하는 데 도움이 됩니다.
기본 원칙은 고정 자료를 앞쪽에, 사용자 질문이나 시각 정보처럼 자주 달라지는 내용을 뒤쪽에 배치하는 것입니다. 다만 같은 문장이 들어 있다는 이유만으로 캐시가 적용되는 것은 아니며 길이와 경계 조건도 맞아야 합니다.
도구 정의와 스키마, 나열 순서도 안정적으로 유지해야 합니다. 요청마다 도구 목록을 삭제하거나 재정렬하기보다
allowed_tools
로 호출 가능한 범위를 제한하는 방식이 안내됩니다.
도구가 필요 없는 요청에서는
tool_choice
를
none
으로 설정할 수 있습니다. 지시를 바꿀 때도 기존 문맥을 고치기보다 새로운
developer
메시지를 뒤에 추가하는 접근이 재사용을 보존하는 데 도움이 됩니다.
추론 강도는 기존 설정을 유지한 채 조정합니다
GPT-6에서는 대화 중 작업 난이도에 맞춰 추론 강도를 조정하면서 재사용 문맥을 보존하는 방법도 안내합니다. 핵심은 요청 최상위의
reasoning.effort
를 그대로 두고
configuration_update
를 추가하는 것입니다.
복잡한 분석에서는 추론 강도를 높이고 단순한 후속 요청에서는 낮추는 식으로 구분할 수 있습니다. 최상위 설정을 임의로 바꿔도 캐시가 유지된다는 뜻은 아니므로, 변경 위치와 방식을 구분해야 합니다.
프리워밍은 연산을 없애는 대신 대기 시간 밖으로 옮깁니다
프리워밍은 이미 알고 있는 지시문, 도구 정의, 참고 자료를 사용자 요청 전에 미리 처리하는 기능입니다. 예를 들어 애플리케이션을 시작할 때 공통 문맥을 준비해 두면 사용자가 질문한 뒤 기다리는 시간에서 입력 처리 일부를 앞당길 수 있습니다.
미리 처리한다고 연산이 무료가 되거나 총비용이 자동으로 줄어드는 것은 아닙니다. 캐시를 무기한 유지하는 기능도 아니므로, 실제 재사용 가능성과 사용자 대기 시간을 함께 살펴야 합니다.
실무에서는 할인율보다 전후 비교가 먼저입니다
다음은 발표된 고객 성과가 아니라 적용을 검토할 때의 실무 제안입니다. 먼저 대시보드에서 기준 캐시 적중률을 확인하고 예상보다 재사용이 적었던 최근 요청을 진단하는 순서가 좋습니다.
이후 고정 문맥의 배치와 도구 순서를 안정화하고 같은 작업의 변경 전후를 비교합니다. 확인할 항목은 캐시 입력 비중, 응답 지연, 전체 청구액, 답변 품질입니다.
뉴스레터 요약의 공통 편집 지침이나 코드 검토의 반복 규칙처럼 같은 문맥을 자주 쓰는 업무는 활용을 검토할 수 있습니다. 다만 이는 활용 예시이며, 모든 업무에서 같은 절감률이나 속도 개선을 보장하지는 않습니다.
이번 업데이트는 반복 문맥의 재사용을 관측하고 누락 원인을 진단할 수 있게 합니다. 모델 단가와 함께 입력 구조도 비용 관리의 점검 대상이 됩니다.
한 줄 요약: GPT-6 프롬프트 캐싱의 실익은 최대 할인율 자체보다, 재사용되는 문맥을 늘리고 전체 API 비용과 품질을 함께 검증하는 데 있습니다.
참고 출처
기준 발표일은 2026년 9월 22일입니다. 공식 발표 본문은 웹 추출로 확인하고 개발 문서·공식 RSS와 대조했습니다. 자동 직접 요청에서는 발표 페이지가 403을 반환했습니다.
