Gemini 영상 분석
긴 영상을 전부 읽지 않고 필요한 순간만 찾습니다
Gemini 에이전틱 영상 이해는 질문에 필요한 영상 구간을 능동적으로 탐색해 토큰과 비용을 줄이고 정확도를 높이는 신규 분석 기능입니다.
이 글에서 다룰 내용
작동 원리, 지원 모델, 긴 영상 활용 범위, Gemini API 적용 방법, 벤치마크 해석 주의점
Gemini 에이전틱 영상 이해란 무엇일까요?
구글이 공개한 Gemini 에이전틱 영상 이해는 AI가 영상 전체를 정해진 방식으로 훑는 대신, 질문에 답하는 데 필요한 장면을 스스로 찾아보는 기능입니다. 사람이 긴 영상을 볼 때 처음부터 끝까지 모든 장면을 똑같이 집중해서 보지 않고, 목차와 자막을 확인한 뒤 중요한 구간을 다시 재생하는 것과 비슷합니다.
이 글에서 다룰 내용
기존 AI 영상 분석 방식의 한계, 영상 토큰 절감 원리, Gemini 3.7 Flash의 성능 변화, 긴 영상 분석 활용 사례, Gemini API 적용 시 확인할 점
기존 방식에서는 보통 영상을 초당 일정한 프레임 수로 나눠 처리합니다. 기본값이 1FPS라면 한 시간짜리 영상에서 수천 장의 프레임과 오디오, 자막 정보를 모델에 전달해야 하므로 영상이 길어질수록 토큰과 비용이 빠르게 늘어납니다.
반면 에이전틱 방식은 먼저 사용자의 질문을 해석합니다. 이후 영상의 시각 프레임과 오디오, 자막을 탐색하면서 무엇을 볼지, 어느 구간을 다시 볼지, 어떤 속도로 확인할지를 능동적으로 결정합니다.
토큰을 최대 88% 줄이는 핵심 원리
영상 토큰 절감의 핵심은 단순 압축이 아니라 선택적 탐색과 재분석입니다. 모델은 처음부터 모든 장면을 높은 밀도로 처리하지 않고, 질문과 관련성이 높은 시점부터 찾아갑니다.
예를 들어 90분짜리 강연에서 “발표자가 세 번째로 소개한 제품의 가격은 얼마인가요?”라고 물었다고 가정해 보겠습니다. 기존 방식은 강연 전체를 일정한 프레임 속도로 읽어야 하지만, 에이전틱 방식은 자막과 장면 흐름을 이용해 제품 소개 구간을 찾은 다음 그 주변만 자세히 살펴봅니다.
빠른 동작이나 짧은 화면 전환이 의심되는 구간에서는 프레임 수를 늘려 다시 확인할 수도 있습니다. 반대로 변화가 거의 없는 장면은 빠르게 건너뛰기 때문에 불필요한 입력 토큰이 줄어듭니다.
구글이 공개한 벤치마크에서 Gemini 3.7 Flash는 에이전틱 처리를 활성화했을 때 토큰 사용량을 최대 88% 줄였습니다. 분석 비용은 최대 66% 감소했고, 정확도는 최대 7% 향상됐습니다.
여기서 중요한 표현은 ‘최대’입니다. 실제 절감 폭은 영상 길이와 장면 변화, 질문의 복잡성, 필요한 세부 수준에 따라 달라질 수 있습니다.
Gemini 3.7 Flash가 긴 영상에 유리한 이유
Gemini 3.7 Flash는 지원 모델 가운데 분석 품질과 비용 효율의 균형이 가장 좋은 모델로 소개됐습니다. 특히 10분짜리 사용법 영상부터 90분 강의, 여러 시간에 걸친 녹화물까지 긴 영상 분석에서 효과가 두드러집니다.
긴 영상은 모든 프레임을 동일하게 처리하면 토큰이 크게 늘고, 토큰을 줄이기 위해 샘플링 간격을 넓히면 중요한 순간을 놓칠 수 있습니다. Gemini 에이전틱 영상 이해는 필요한 구간을 더 높은 프레임 밀도로 재검토해 이 두 문제를 함께 줄이는 방식입니다.
활용 범위도 단순 요약에 그치지 않습니다. 찰나의 화면 전환 찾기, 영상 속 이상 행동 감지, 반복 동작 횟수 계산, 특정 인물이나 물체가 등장한 시점 검색 등에 사용할 수 있습니다.
공식 발표가 예로 든 90분 강의 같은 긴 영상에서는 특정 개념이 설명된 시점을 찾는 검색형 분석을 설계할 수 있습니다. 빠른 동작이 있는 구간은 높은 FPS로 다시 검사하고, 반복 동작이나 물체 수를 세는 작업에도 활용할 수 있다고 구글은 설명합니다.
Google AI Studio와 Gemini API에서 사용하는 방법
이 기능은 Google AI Studio와 Gemini API를 통해 사용할 수 있습니다. 직접 업로드한 동영상뿐 아니라 유튜브 영상도 분석할 수 있으며, Gemini Enterprise Agent Platform에서도 지원됩니다.
Gemini API 요청에서 영상의 처리 방식을
agentic
으로 지정하면 에이전틱 분석을 활성화할 수 있습니다. 별도의 기능 이용료가 추가되는 구조는 아니며, 사용한 토큰에 따라 일반 Gemini API 요금이 적용됩니다.
지원 모델은 Gemini 3.7 Flash를 비롯해 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite입니다. 높은 정확도가 중요하다면 Gemini 3.7 Flash를 우선 검토하고, 대량 처리에서는 모델별 품질과 비용을 실제 영상으로 비교하는 편이 좋습니다.
또한 모든 작업에 에이전틱 처리가 필요한 것은 아닙니다. 짧은 영상의 전체 요약처럼 처음부터 끝까지 고르게 살펴봐야 하는 작업이라면 기존 처리와 차이가 작을 수 있으므로, 질문 유형과 영상 길이에 맞춰 선택해야 합니다.
영상 분석의 기준이 ‘전체 시청’에서 ‘목적형 탐색’으로
이번 변화의 의미는 단순히 모델이 영상을 더 빠르게 읽는 데 있지 않습니다. AI가 사용자의 목적을 이해하고, 필요한 장면을 찾고, 부족하면 다시 확인하는 능동적인 영상 탐색 과정을 갖췄다는 점이 핵심입니다.
특히 긴 영상 분석 서비스를 운영한다면 토큰 비용을 줄이면서도 세밀한 장면을 놓치지 않을 가능성이 커졌습니다. 다만 최대 88%라는 수치를 모든 영상에 동일하게 적용되는 고정 절감률로 받아들이기보다는, 실제 데이터로 정확도와 처리 비용을 함께 검증하는 것이 안전합니다.
한 줄 요약: Gemini 에이전틱 영상 이해는 질문에 필요한 장면만 능동적으로 찾아보는 방식으로 영상 토큰 절감과 분석 정확도를 동시에 개선한 기능입니다.
