AI 뉴스 · Kimi K3 on Amazon Bedrock
100만 토큰과 캐싱, 반복 업무의 모델 선택지가 늘었습니다
AWS가 2026년 9월 18일 Kimi K3의 Bedrock 제공을 시작했습니다. 장문맥과 명시적 프롬프트 캐싱을 지원하며 실제 비용과 데이터 처리 지역을 함께 확인해야 합니다.
이 글에서 다룰 내용
Bedrock 제공 시작과 장문맥, 캐싱 비용과 조건, API·추론 프로파일, 데이터 보호 범위, 도입 전 점검
Kimi K3, 이제 Bedrock에서 사용합니다
문샷 AI의 Kimi K3를 아마존 Bedrock에서 사용할 수 있게 됐습니다. AWS가 2026년 9월 18일 발표한 이번 소식은 모델 자체의 최초 공개가 아니라 Bedrock에서의 제공 시작입니다.
AWS는 Kimi K3를 코딩과 지식 업무에 활용하는 오픈웨이트 모델로 소개합니다. 네이티브 비전과 100만 토큰 컨텍스트를 지원해 코드, 문서, 이미지처럼 여러 자료를 함께 다루는 작업에서 검토할 선택지가 됐습니다.
넓은 컨텍스트에는 긴 저장소 지침과 관련 문서를 함께 담을 수 있습니다.
다만 입력 공간이 넓다고 모든 내용을 빠짐없이 이해하거나 항상 정확한 답을 내는 것은 아닙니다. 토큰을 한국어 글자 수로 단순 환산하기도 어렵습니다. 오픈웨이트라는 설명이 Bedrock 추론을 무료로 제공한다는 뜻도 아닙니다.
프롬프트 캐싱, 반복 입력이 있어야 유리합니다
이번 발표의 핵심은 Kimi K3가 Bedrock의 오픈웨이트 모델 중 처음으로 명시적 프롬프트 캐싱을 지원한다는 점입니다. 매번 보내는 긴 입력의 앞부분을 재사용하도록 지정하는 기능입니다.
예를 들어 저장소 작업 규칙, 도구 정의, 공통 참고 문서는 그대로 두고 마지막 질문만 바꾸는 흐름을 생각하면 쉽습니다. 동일한 자료를 반복해서 읽히는 업무가 주요 검토 대상입니다.
재사용할 접두사는 최소 1,024토큰이어야 하며 그 끝에
prompt_cache_breakpoint
를 표시할 수 있습니다. 캐시는 최소 30분 보관되고 캐시 쓰기에는 더 높은 요율이 적용됩니다.
이후 같은 접두사를 보내 캐시에 적중하면 해당 입력 토큰에 할인이 적용됩니다. 캐시에 적중한 입력 토큰은 분당 입력 토큰 할당량에서도 제외됩니다.
캐싱을 켰다고 비용이 줄어드는 것은 아닙니다. 반복되는 접두사가 거의 없다면 쓰기 비용을 충분히 상쇄하지 못할 수 있습니다. 할인율이나 최종 절감액은 실제 사용 내역으로 확인해야 합니다.
실무에서는 고정 자료와 매번 바뀌는 질문을 구분하고, 캐시 적중 여부와 실제 청구액을 함께 비교하는 방식이 좋습니다. 프롬프트 캐싱은 장기 기억이나 모든 대화를 영구 저장하는 기능과는 다릅니다.
연결 방법과 처리 지역은 따로 확인합니다
콘솔에서는 Bedrock의 Test > Playground로 이동해 Kimi K3를 선택하면 됩니다. 이용에는 AWS 계정과 적절한 권한이 필요합니다.
프로그램에서는
bedrock-runtime
엔드포인트를 사용합니다. OpenAI 호환 Responses·Chat Completions API와 Bedrock Invoke·Converse API를 지원합니다.
여기서 OpenAI 호환은 요청 인터페이스가 호환된다는 뜻입니다. 요청이 OpenAI 서버로 전송된다는 의미가 아니므로, 연결 방식과 데이터 처리 경로를 혼동하지 않아야 합니다.
추론 프로파일도 구분해야 합니다.
global.moonshotai.kimi-k3
는 전 세계에서 지원되는 상용 AWS 리전 중 하나로 요청을 라우팅합니다.
us.moonshotai.kimi-k3
는 미국 지리적 범위 안에서 처리합니다.
글로벌 프로파일이라고 모든 리전에서 즉시 사용할 수 있다는 뜻은 아닙니다. 한국이나 서울 리전 안에서만 데이터가 처리된다는 보장도 아닙니다. 기업 AI 도입에서는 사용 편의성뿐 아니라 조직의 데이터 위치 조건에 맞춰 프로파일을 골라야 합니다.
데이터 보호와 캐시 보관은 구분합니다
AWS는 Kimi K3 요청을 AWS 데이터 경계 안에서 처리하며 데이터를 모델 제공자와 공유하거나 기반 모델 학습에 사용하지 않는다고 설명합니다.
추론 요청에는 zero data retention을 적용한다고 밝힙니다. 추론 중 AWS 운영자도 프롬프트와 응답에 접근하지 못하도록 하는 zero operator access도 명시했습니다.
그렇다고 이를 “어디에도 데이터가 저장되지 않는다”로 해석하면 안 됩니다. 앞서 살펴본 명시적 캐시는 최소 30분 보관됩니다. 추론 데이터 보호 설명과 명시적으로 요청하는 캐시 보관은 구분해서 읽어야 합니다.
자체 애플리케이션에서 남기는 로그, 대화 기록, 백업까지 자동 삭제된다는 의미도 아닙니다. 민감한 자료를 다룬다면 모델 서비스의 보호 조건과 별도로 앱의 저장 정책과 접근 권한을 점검해야 합니다.
작은 업무로 정확성·비용부터 비교합니다
AWS 공식 글은 OpenCode의 네이티브 amazon-bedrock provider와 Converse 연결을 활용 예시로 소개합니다. 기존 Bedrock 지원 도구에서 Kimi K3를 검토할 때 참고할 연결 사례입니다.
다만 이번 글에서는 실제 코딩 성능이나 비용을 실측하지 않았습니다. 컨텍스트 크기와 캐시 지원만으로 다른 모델보다 빠르거나 저렴하고 정확하다고 평가할 수는 없습니다.
도입할 때는 같은 코드나 참고 자료를 반복해서 사용하는 작은 작업부터 시작하는 편이 좋습니다. 결과의 정확성, 캐시 적중 여부, 실제 청구액, 요청 처리 지역을 함께 점검하면 업무에 맞는지 판단하기 수월합니다.
이번 제공으로 긴 자료를 반복해서 다루는 업무의 모델 선택지가 늘었습니다. 100만 토큰이라는 입력 규모와 프롬프트 캐싱의 재사용 조건을 함께 봐야 활용 가치를 가늠할 수 있습니다.
한 줄 요약: Kimi K3의 아마존 Bedrock 제공이 시작됐으며 도입 판단의 핵심은 100만 토큰 자체보다 반복 입력의 캐시 적중, 실제 비용, 데이터 처리 지역입니다.
참고 출처
2026년 9월 18일 AWS 공식 발표 기준입니다. 모델 성능·비용을 직접 측정한 리뷰가 아닙니다.
