# Gemini 에이전틱 비디오 이해 — 토큰 88% 절감의 조건

> Google이 9월 1일 Gemini API에 '에이전틱' 비디오 처리 모드를 넣었습니다. 1초 1프레임 대신 필요한 구간만 골라 읽어 긴 영상에서 토큰 최대 88%, 비용 최대 66%를 줄인다는 주장의 조건을 정리했습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/gemini-agentic-video-understanding/)
- 발행: 2026-09-02
- 카테고리: 활용·도구 · 태그: Gemini, 비디오 이해, API, 토큰 비용, 활용

## 핵심 답변

Google은 2026년 9월 1일 Gemini 3.7 Flash·3.6 Flash·3.5 Flash-Lite에 에이전틱 비디오 이해를 출시했습니다. 모델이 초당 1프레임을 통째로 읽는 대신 프롬프트에 필요한 구간만 골라 프레임·오디오·자막을 불러오는 방식으로, Google은 장편 영상에서 토큰 최대 88%, 비용 최대 66% 절감과 정확도 최대 7% 향상을 주장하며 API에서 processing 값을 agentic으로 두면 켜집니다.

## 요약

- 정적 모드는 1 FPS 프레임을 컨텍스트에 바로 넣고, 에이전틱 모드는 타임라인을 탐색하며 필요한 부분만 로드합니다.
- 탐색 추론은 생각 토큰, 불러온 프레임·오디오·자막은 도구 사용 토큰으로 집계되며 별도 기능 요금은 없습니다.
- 88%·66%·7%는 서로 다른 벤치마크에서 나온 수치이고, 순차 탐색의 지연 시간 비교는 공개되지 않았습니다.
- Gemini API(AI Studio·Gemini Enterprise)에서 바로 쓸 수 있고, Gemini 앱과 Ask YouTube에는 순차 적용 예정입니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 출시일 | 2026-09-01 (Gemini API 릴리스 노트) |
| 지원 모델 | 3.7 Flash · 3.6 Flash · 3.5 Flash-Lite (문서에는 3.8 Flash도 추가됨) |
| 토큰 절감 | 최대 88% (장편 영상, 정적 모드 대비 (Google 주장)) |
| 비용 절감 | 최대 66% (Google 주장) |
| 정확도 | 최대 +7% (장편 영상) |
| 영상 길이 | 최대 3시간 (API 문서) |


## 무슨 일인가요

Google은 9월 1일 Gemini에 "에이전틱 비디오 이해"를 출시했습니다. 공식 글은 이 기능이 "모델의 핵심 추론을 네이티브 비디오 도구와 짝지어, 목표 구간을 동적으로 검색·훑기·검사한다"고 설명합니다.  대상은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite이고, 같은 날 릴리스 노트에는 "장편 콘텐츠에서 정적 처리 대비 최대 88% 적은 토큰"이라는 문구가 올라왔습니다.  API 문서는 9월 2일 나온 3.8 Flash도 지원 목록에 올려 두었습니다. 

Google이 내세우는 수치는 세 가지입니다. 토큰 최대 88% 절감, 비용 최대 66% 절감, 정확도 최대 7% 향상입니다.  제공 경로는 Google AI Studio와 Gemini Enterprise의 Gemini API이며, Gemini 앱에는 Flash·Flash-Lite 모델 사용자에게 순차 적용되고, YouTube의 "Ask YouTube"에는 몇 달 안에 들어갈 예정입니다.  별도 기능 요금은 없고 표준 토큰 단가가 그대로 적용됩니다. 

## 어떻게 동작하나요



API 문서에 따르면 정적 모드는 "고정 속도(1 FPS)로 프레임을 추출"해 즉시 컨텍스트에 넣고, 에이전틱 모드는 "비디오 타임라인을 동적으로 탐색하며 필요한 내용만 로드"합니다.  탐색에 쓰는 추론은 생각 토큰(`total_thought_tokens`), 불러온 프레임·오디오·자막은 도구 사용 토큰(`total_tool_use_tokens`)으로 따로 집계되므로 사용량 메타데이터에서 두 항목을 확인할 수 있습니다.  켜는 방법은 비디오 입력 객체에 한 줄을 추가하는 것입니다.

```python
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input=[
        {"type": "video", "uri": video_file.uri,
         "mime_type": video_file.mime_type, "processing": "agentic"},
        {"type": "text", "text": "세 가지 핵심 주장은 무엇인가요?"},
    ],
)
```

문서는 최대 3시간 길이 영상에서 동작하고, YouTube 영상은 정적 모드와 같은 제한을 따르며, "장편 영상이나 특정 순간을 겨냥한 질의"에 에이전틱 모드를 권한다고 적었습니다.  공식 글이 든 활용 사례는 1초 미만 단위의 순간 검색, 장편 영상에서 바늘 찾기, 높은 프레임 속도가 필요한 이상 탐지, 시간에 따른 물체·동작 세기입니다. 



## 숫자의 조건



PPC Land가 Google 자료를 인용해 정리한 바로는, 88%는 1H-VideoQA에서 39만 7,600토큰이 4만 7,700토큰으로 준 결과이고, 7%는 Minerva 벤치마크 정확도가 73.7%에서 79.0%로 오른 값입니다.  같은 기사는 88%와 66%가 서로 다른 벤치마크에서 나왔는데 Google이 이를 잇는 비용표를 내지 않았고, 순차 탐색 루프와 고정 프레임 방식의 지연 시간 비교도 없다고 지적했습니다.  초기 사용 기업 Ponder는 "우리의 재현율을 유지하면서 입력 토큰을 약 3.5배 적게 썼다"고 밝혔습니다. 

## 무엇을 보면 되나요

- **긴 영상을 다루는 팀**: 강의·회의·방송 아카이브처럼 한 시간이 넘는 영상에서 특정 장면을 찾는 작업이라면 바로 켜 볼 만합니다. 정적 모드로는 1 FPS 프레임이 컨텍스트를 채워 버립니다.
- **짧은 클립 요약**: 영상 전체를 훑어야 하는 작업은 절감 폭이 작을 수 있습니다. 두 모드로 같은 요청을 보내 생각 토큰과 도구 사용 토큰 합계를 비교하세요. 
- **지연 시간이 중요한 서비스**: 탐색이 순차적이라 응답 시간은 늘 수 있습니다. 공식 비교치가 없으니 직접 재야 합니다. 


"모든 프레임을 넣는다"에서 "필요한 프레임만 찾아 넣는다"로의 전환은 RAG가 문서에 했던 일을 영상에 옮긴 것에 가깝습니다. 토큰이 줄어드는 것은 분명하지만, 그 대신 모델이 어디를 봤는지가 결과의 품질을 좌우하게 됩니다. 도입할 때는 절감률보다 "놓친 장면이 있었는가"를 검증하는 평가 세트를 먼저 만드는 편이 순서라고 봅니다. 



## 자주 묻는 질문

**Q. 어떻게 켜나요?**

Gemini API의 비디오 입력 객체에 processing 값을 agentic 으로 지정하면 됩니다. 업로드한 파일과 YouTube URL 모두 지원하고, 별도 기능 요금 없이 표준 토큰 단가가 적용됩니다.

**Q. 짧은 영상에도 이득인가요?**

문서는 장편 영상이나 특정 순간을 찾는 질의에 에이전틱 모드를 권합니다. 짧은 클립을 전체적으로 요약하는 작업은 정적 모드가 더 단순하고 예측 가능할 수 있으니, 두 모드의 토큰 사용량을 직접 비교해 보는 것이 좋습니다.

**Q. 88%는 어떤 조건의 수치인가요?**

보도에 따르면 1H-VideoQA에서 39만 7,600토큰이 4만 7,700토큰으로 줄어든 결과이고, 정확도 7%는 Minerva 벤치마크(73.7%에서 79.0%)에서 나온 값입니다. 비용 66% 절감은 또 다른 기준이라 세 숫자를 한 작업의 결과로 읽으면 안 됩니다.

## 출처

1. [Introducing agentic video understanding with Gemini (Google 공식 블로그)](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/) (official)
2. [Video understanding — Gemini API 문서 (Google AI for Developers)](https://ai.google.dev/gemini-api/docs/video-understanding) (official)
3. [Gemini API 릴리스 노트 (Google AI for Developers)](https://ai.google.dev/gemini-api/docs/changelog) (official)
4. [Google cuts Gemini video analysis tokens by up to 88% in agentic mode (PPC Land)](https://ppc.land/google-cuts-gemini-video-analysis-tokens-by-up-to-88-in-agentic-mode/) (report)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._