KV 캐시(Key-Value Cache)란? LLM이 앞선 토큰 계산을 다시 쓰는 방법
KV 캐시는 LLM이 앞서 처리한 토큰의 어텐션 Key와 Value를 저장해 다음 토큰 생성 때 다시 쓰는 추론용 메모리입니다. 생성 속도와 메모리의 관계, 프롬프트 캐싱·시맨틱 캐시와 차이를 쉽게 설명합니다.
KV 캐시는 LLM이 앞서 처리한 토큰의 어텐션 Key와 Value를 저장해 다음 토큰 생성 때 다시 쓰는 추론용 메모리입니다. 생성 속도와 메모리의 관계, 프롬프트 캐싱·시맨틱 캐시와 차이를 쉽게 설명합니다.
NVIDIA는 장문맥 추론에서 어텐션 병목을 줄이기 위한 그룹 크기, 헤드 차원, KV 상태, GPU 병렬화 4가지 공동설계 원칙을 공개했습니다. AI 에이전트 추론 속도와 처리량을 높이는 핵심을 정리합니다.