AI 에이전트 비용 | 2026.10.09 공식 사례
아사나의 비용 76배 절감, 모델 교체와 캐시 최적화를 함께 읽어야 합니다
아사나와 OpenAI가 공개한 브라우저 에이전트 실험 사례입니다. 기존 Model B 설정과 최적화된 GPT-6.1 Sol 작업 흐름을 비교한 수치이며, 모든 업무에서 같은 절감률이 나온다는 뜻은 아닙니다.
이 글에서 다룰 내용
76배 수치의 비교 기준, Astra와 Sol의 역할, 캐시가 깨진 이유, 실험 조건과 도입 점검
76배 절감, 무엇과 무엇을 비교했을까요?
아사나가 공개한 브라우저 AI 에이전트 실험의 핵심은 모델 교체와 작업 흐름 개선을 함께 적용했다는 점입니다. OpenAI의 2026년 10월 9일 고객 사례와 아사나의 10월 8일 엔지니어링 글에 따르면, StackAI 실험에서 Model B 기존 운영 설정 대비 최적화된 GPT-6.1 Sol 작업 흐름의 추정 모델 비용이 76배 낮고 실행이 5배 빨랐습니다.
여기서 76배는 아사나 전체 운영비의 변화가 아닙니다. GPT-6.1 Sol의 API 단가를 76분의 1로 내렸다는 뜻도 아닙니다. 서로 다른 모델과 서로 다른 실행 설정을 비교한, 회사 공개 실험의 특정 과제 결과입니다.
같은 Sol끼리 비교하면 최적화 전후 추정 모델 비용은 1.97달러에서 0.47달러로 약 4배 감소했습니다. Model B도 자체 최적화 후 최소 36.21달러에서 1.24달러로 약 29배 줄었습니다. 모델 선택뿐 아니라 요청을 구성하는 방식이 비용에 크게 작용한 셈입니다.
Astra는 연구했고, Sol은 실행했습니다
이번 사례에서 GPT-6 Astra와 GPT-6.1 Sol의 역할은 다릅니다. GPT-6 Astra는 Codex 안에서 코드를 조사하고 계측하며 조건을 탐색하고 병렬 실험과 분석을 수행한 연구·개발 역할을 맡았습니다. Sol은 개선된 브라우저 AI 에이전트의 실행 모델입니다.
사람은 목표와 평가 기준을 정하고 개선안을 선택해 결론을 검토했습니다. 아사나는 Command에 요청·실행 추적·결과를 저장하고 티켓과 PR 검토를 거쳐 StackAI에 변경을 배포했다고 설명했습니다.
실험과 운영 변경은 사람의 검토를 거쳤습니다. 연구를 맡은 AI와 실제 과제를 처리한 AI를 구분하면 어떤 개선을 누가 수행했는지 알 수 있습니다.
프롬프트 캐시를 깨뜨린 것은 이력 정리였습니다
기존 설정은 고정 도구와 시스템 지시만 캐싱했습니다. 에이전트가 탐색하면서 쌓은 페이지 글과 스크린샷 이력은 매번 다시 전송했습니다.
문제는 기록을 줄이는 방식에도 있었습니다. 오래된 스크린샷을 제거하고 글을 자르는 작업을 거의 매 단계 수행하면서 이전 요청의 앞부분이 계속 달라졌습니다. 입력량을 줄이려던 정리가 오히려 프롬프트 캐시 재사용을 깨뜨렸습니다.
개선 방향은 탐색 이력도 캐싱하고 기록을 매번 바꾸지 않는 것이었습니다. 이 사례는 AI 비용 최적화에서 “보내는 내용을 무조건 줄이자”만으로는 부족하다는 점을 보여줍니다. 반복되는 입력이 얼마나 안정적으로 유지되는지도 살펴야 합니다.
화면 20개와 48만 문자, 단위를 구분해야 합니다
주요 개선에는 화면 기록을 최대 20개까지 쌓은 뒤 최근 1개로 묶어 정리하는 방식이 포함됐습니다. 이력 예산을 12만 문자에서 48만 문자로 늘린 설정도 적용했습니다. 여기서 예산의 단위는 문자이며, 토큰 수나 모든 모델의 컨텍스트 한도가 아닙니다.
이력을 자주 잘라 요청 앞부분을 바꾸는 대신 재사용 가능한 상태로 유지하는 편이 이번 과제에서는 유리했습니다. 최적화된 Sol 실행은 입력의 89%를 캐시로 읽었다고 발표됐습니다.
다만 화면 기록의 ‘20 대 1’ 정리가 모든 업무의 정답은 아닙니다. 스크린샷을 아예 유지한 후속 실험도 있었습니다. 필요한 화면 정보와 캐시 재사용 사이의 균형은 과제별로 확인해야 합니다.
144회 실험이지만 조건별 반복은 3회입니다
공개 실험은 데모 도서 목록의 32권에서 각각 6개 정보를 수집하는 동일 과제로 진행했습니다. 4개 모델, 6개 캐시·화면 이력 정책, 2개 이력 예산을 조합하고 각 조건을 3회 반복해 전체 연구에서 총 144회 실행했습니다. 이후 12회의 후속 실험도 있었습니다.
모델 비용은 각 공급사의 토큰 카운터로 추정했고 결과는 별도로 준비한 정답으로 평가했습니다. 최적화된 Sol의 평균 추정 모델 비용은 0.47달러, 실행 시간은 약 4분이었습니다. 이 금액은 일반 요금표나 구독료가 아니며 서버 비용과 인건비까지 포함한 총비용도 아닙니다.
원본 일부 실행은 단계 상한에 도달해 미완료였습니다. 기준 비용과 시간 평균이 하한이므로 76배와 5배를 순수한 모델 성능 우위로 해석하면 안 됩니다. 조건마다 반복이 3회에 불과해 몇 퍼센트 수준의 차이를 정밀하게 구분하기 어렵다는 공식 한계도 있습니다.
이력 예산에 따른 정답 반환 차이도 보고됐습니다. Sol은 12만 문자 설정에서 응답 생성 18회 중 3회, 48만 문자 설정에서 18회 모두 정답을 반환했습니다. 다만 이 역시 해당 실험 결과이지, 긴 이력이 항상 정확도를 높인다는 보장은 아닙니다.
일반 운영 권고: 비용과 정답을 함께 비교합니다
다음은 이번 사례의 공식 기능 설명이 아닌 일반적인 운영 권고입니다. 자신의 과제에 적용하려면 같은 문제를 대상으로 정답·완료율·추정 모델 비용·실행 시간·캐시 읽기 비율을 함께 비교하는 편이 좋습니다. 비용만 낮아지고 과제를 끝내지 못한다면 실무 개선으로 보기 어렵습니다.
실험에는 단계·토큰·비용 상한을 두고 개인정보나 민감한 화면은 조직의 데이터 정책에 맞춰 다룹니다. 같은 모델의 설정 변경 결과도 확인하면 개선 원인을 파악하기 쉽습니다.
자신의 과제에서도 반복 입력과 이력 관리가 비용을 어떻게 바꾸는지 측정하며 정답과 완료 여부를 확인해야 합니다.
한 줄 요약: 아사나의 76배 절감은 특정 실험에서 모델 교체와 캐시·이력 최적화를 합친 결과이며, 실제 도입 판단은 같은 과제의 비용과 완료 품질을 함께 비교해야 합니다.
참고 출처
OpenAI 공식 발표일은 2026년 10월 9일이며, 아사나 엔지니어링 글은 2026년 10월 8일입니다. OpenAI 원문은 직접 요청에서 403을 반환해 같은 실행에서 확인한 본문 추출과 공식 RSS를 교차 검증했습니다. 아사나 원문에서는 실험 방법과 한계를 확인했습니다.
