본문으로 건너뛰기

Gemini 에이전틱 비디오 이해 — 토큰 88% 절감의 조건

Google이 9월 1일 Gemini API에 '에이전틱' 비디오 처리 모드를 넣었습니다. 1초 1프레임 대신 필요한 구간만 골라 읽어 긴 영상에서 토큰 최대 88%, 비용 최대 66%를 줄인다는 주장의 조건을 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
여러 대의 모니터가 벽면을 채운 방송국 주조정실
사진: Rfins · CC BY-SA 3.0

핵심 답변

Google은 2026년 9월 1일 Gemini 3.7 Flash·3.6 Flash·3.5 Flash-Lite에 에이전틱 비디오 이해를 출시했습니다. 모델이 초당 1프레임을 통째로 읽는 대신 프롬프트에 필요한 구간만 골라 프레임·오디오·자막을 불러오는 방식으로, Google은 장편 영상에서 토큰 최대 88%, 비용 최대 66% 절감과 정확도 최대 7% 향상을 주장하며 API에서 processing 값을 agentic으로 두면 켜집니다.

TL;DR세 줄 요약

  • 정적 모드는 1 FPS 프레임을 컨텍스트에 바로 넣고, 에이전틱 모드는 타임라인을 탐색하며 필요한 부분만 로드합니다.
  • 탐색 추론은 생각 토큰, 불러온 프레임·오디오·자막은 도구 사용 토큰으로 집계되며 별도 기능 요금은 없습니다.
  • 88%·66%·7%는 서로 다른 벤치마크에서 나온 수치이고, 순차 탐색의 지연 시간 비교는 공개되지 않았습니다.
  • Gemini API(AI Studio·Gemini Enterprise)에서 바로 쓸 수 있고, Gemini 앱과 Ask YouTube에는 순차 적용 예정입니다.

핵심 사실

출시일
2026-09-01Gemini API 릴리스 노트
지원 모델
3.7 Flash · 3.6 Flash · 3.5 Flash-Lite문서에는 3.8 Flash도 추가됨
토큰 절감
최대 88%장편 영상, 정적 모드 대비 (Google 주장)
비용 절감
최대 66%Google 주장
정확도
최대 +7%장편 영상
영상 길이
최대 3시간API 문서

무슨 일인가요

Google은 9월 1일 Gemini에 "에이전틱 비디오 이해"를 출시했습니다. 공식 글은 이 기능이 "모델의 핵심 추론을 네이티브 비디오 도구와 짝지어, 목표 구간을 동적으로 검색·훑기·검사한다"고 설명합니다. 공식 대상은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite이고, 같은 날 릴리스 노트에는 "장편 콘텐츠에서 정적 처리 대비 최대 88% 적은 토큰"이라는 문구가 올라왔습니다. 공식 API 문서는 9월 2일 나온 3.8 Flash도 지원 목록에 올려 두었습니다. 공식

Google이 내세우는 수치는 세 가지입니다. 토큰 최대 88% 절감, 비용 최대 66% 절감, 정확도 최대 7% 향상입니다. 공식 제공 경로는 Google AI Studio와 Gemini Enterprise의 Gemini API이며, Gemini 앱에는 Flash·Flash-Lite 모델 사용자에게 순차 적용되고, YouTube의 "Ask YouTube"에는 몇 달 안에 들어갈 예정입니다. 공식 별도 기능 요금은 없고 표준 토큰 단가가 그대로 적용됩니다. 공식

어떻게 동작하나요

정적 모드와 에이전틱 모드
  1. 프롬프트 입력

    예: '세 가지 핵심 주장은?'

  2. 타임라인 탐색

    자막·프레임·오디오를 필요할 때 요청

  3. 구간 로드

    도구 사용 토큰으로 집계

  4. 추론·답변

    탐색 추론은 생각 토큰

API 문서에 따르면 정적 모드는 "고정 속도(1 FPS)로 프레임을 추출"해 즉시 컨텍스트에 넣고, 에이전틱 모드는 "비디오 타임라인을 동적으로 탐색하며 필요한 내용만 로드"합니다. 공식 탐색에 쓰는 추론은 생각 토큰(total_thought_tokens), 불러온 프레임·오디오·자막은 도구 사용 토큰(total_tool_use_tokens)으로 따로 집계되므로 사용량 메타데이터에서 두 항목을 확인할 수 있습니다. 공식 켜는 방법은 비디오 입력 객체에 한 줄을 추가하는 것입니다.

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input=[
        {"type": "video", "uri": video_file.uri,
         "mime_type": video_file.mime_type, "processing": "agentic"},
        {"type": "text", "text": "세 가지 핵심 주장은 무엇인가요?"},
    ],
)

문서는 최대 3시간 길이 영상에서 동작하고, YouTube 영상은 정적 모드와 같은 제한을 따르며, "장편 영상이나 특정 순간을 겨냥한 질의"에 에이전틱 모드를 권한다고 적었습니다. 공식 공식 글이 든 활용 사례는 1초 미만 단위의 순간 검색, 장편 영상에서 바늘 찾기, 높은 프레임 속도가 필요한 이상 탐지, 시간에 따른 물체·동작 세기입니다. 공식

LED 비디오월과 스튜디오 카메라가 놓인 텔레비전 스튜디오
강의·회의·방송처럼 긴 영상일수록 필요한 구간만 골라 읽는 이득이 커집니다. 사진은 한 텔레비전 스튜디오의 LED 비디오월입니다.· 사진: LEDEXPERT · CC BY-SA 4.0

숫자의 조건

1H-VideoQA 입력 토큰 수 (보도 기준)
0125,000250,000375,000500,000정적 모드 (1 FPS)에이전틱 모드397,60047,700
1H-VideoQA 입력 토큰 수 (보도 기준)
항목토큰
정적 모드 (1 FPS)397,600
에이전틱 모드47,700

출처: PPC Land, Google 자료 인용 (2026-09-01)

PPC Land가 Google 자료를 인용해 정리한 바로는, 88%는 1H-VideoQA에서 39만 7,600토큰이 4만 7,700토큰으로 준 결과이고, 7%는 Minerva 벤치마크 정확도가 73.7%에서 79.0%로 오른 값입니다. 보도 같은 기사는 88%와 66%가 서로 다른 벤치마크에서 나왔는데 Google이 이를 잇는 비용표를 내지 않았고, 순차 탐색 루프와 고정 프레임 방식의 지연 시간 비교도 없다고 지적했습니다. 보도 초기 사용 기업 Ponder는 "우리의 재현율을 유지하면서 입력 토큰을 약 3.5배 적게 썼다"고 밝혔습니다. 보도

무엇을 보면 되나요

  • 긴 영상을 다루는 팀: 강의·회의·방송 아카이브처럼 한 시간이 넘는 영상에서 특정 장면을 찾는 작업이라면 바로 켜 볼 만합니다. 정적 모드로는 1 FPS 프레임이 컨텍스트를 채워 버립니다.
  • 짧은 클립 요약: 영상 전체를 훑어야 하는 작업은 절감 폭이 작을 수 있습니다. 두 모드로 같은 요청을 보내 생각 토큰과 도구 사용 토큰 합계를 비교하세요. 추정
  • 지연 시간이 중요한 서비스: 탐색이 순차적이라 응답 시간은 늘 수 있습니다. 공식 비교치가 없으니 직접 재야 합니다. 추정

자주 묻는 질문

어떻게 켜나요?
Gemini API의 비디오 입력 객체에 processing 값을 agentic 으로 지정하면 됩니다. 업로드한 파일과 YouTube URL 모두 지원하고, 별도 기능 요금 없이 표준 토큰 단가가 적용됩니다.
짧은 영상에도 이득인가요?
문서는 장편 영상이나 특정 순간을 찾는 질의에 에이전틱 모드를 권합니다. 짧은 클립을 전체적으로 요약하는 작업은 정적 모드가 더 단순하고 예측 가능할 수 있으니, 두 모드의 토큰 사용량을 직접 비교해 보는 것이 좋습니다.
88%는 어떤 조건의 수치인가요?
보도에 따르면 1H-VideoQA에서 39만 7,600토큰이 4만 7,700토큰으로 줄어든 결과이고, 정확도 7%는 Minerva 벤치마크(73.7%에서 79.0%)에서 나온 값입니다. 비용 66% 절감은 또 다른 기준이라 세 숫자를 한 작업의 결과로 읽으면 안 됩니다.

출처 · 4

  1. 1Introducing agentic video understanding with Gemini (Google 공식 블로그)공식 발표blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
  2. 2Video understanding — Gemini API 문서 (Google AI for Developers)공식 발표ai.google.dev/gemini-api/docs/video-understanding
  3. 3Gemini API 릴리스 노트 (Google AI for Developers)공식 발표ai.google.dev/gemini-api/docs/changelog
  4. 4Google cuts Gemini video analysis tokens by up to 88% in agentic mode (PPC Land)보도ppc.land/google-cuts-gemini-video-analysis-tokens-by-up-to-88-in-agentic-mode/

이 글의 마크다운 원문: /posts/gemini-agentic-video-understanding/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

활용·도구· 2

GPT-6 Astra, Copilot 정식 제공 — API 제어 3종

9월 4일 GitHub Copilot에 GPT-6 Astra가 정식 제공됐습니다. 대상 플랜·10개 표면·과금 조건과, 9월 3일 Responses API에 더해진 비동기 툴 호출·중간 조향·추론 강도 변경을 정리했습니다.

  • #OpenAI
  • #GPT-6
  • #GitHub Copilot
활용·도구· 2

Funes — 코딩 에이전트 기억, 인수인계보다 8배 싸다

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

  • #코딩 에이전트
  • #오픈소스
  • #Hugging Face
모델· 2

Lyria 3.5 공개 — 최대 3분 노래, 곡당 $0.08

Google이 9월 3일 Gemini API에 Lyria 3.5를 공개 프리뷰로 올리고 9월 4일 Gemini 앱에 넣었습니다. 길이·보컬·가격·제한을 정리했습니다.

  • #Google DeepMind
  • #Gemini
  • #모델 출시