본문으로 건너뛰기

Vals 보고서 — 에이전트 작업 전력, 모델 따라 최대 75배

벤치마크 기관 Vals AI가 9월 3일 오픈 웨이트 모델 16종의 에이전트 작업 전력·탄소·물 사용량을 추정한 보고서를 냈습니다. 같은 벤치마크를 완주하는 데 드는 전력이 모델에 따라 수십 배 차이 났다는 내용입니다.

AI피셜 편집부· 3분 읽기원문 보기 ↗
파란 조명이 켜진 데이터센터의 서버 랙 열
사진: BalticServers.com · CC BY-SA 3.0

핵심 답변

Vals AI는 2026년 9월 3일 금융·코딩·의료·법률 분야 2,157개 에이전트 과제(Vals Index)를 오픈 웨이트 모델 16종으로 돌렸을 때의 전력·탄소·물 사용량을 EcoLogits로 추정한 보고서를 냈습니다. 전체 완주 전력은 Ling 3.0 Flash 23.8kWh부터 Qwen 3.8 Max 1.8MWh까지 약 75배 차이가 났고, 토큰 가격이나 토큰 수가 환경 비용을 잘 예측하지 못한다고 결론지었습니다.

TL;DR세 줄 요약

  • Vals Index 2,157개 과제를 완주하는 데 드는 전력은 Ling 3.0 Flash 23.8kWh, DeepSeek V4 Flash 139.7kWh, Kimi K3 1.7MWh, Qwen 3.8 Max 1.8MWh로 추정됐습니다.
  • 10회 대화 기준 DeepSeek V4 Flash는 10.5Wh·5.7gCO₂e·46mL, Kimi K3는 169.5Wh·92.4gCO₂e·733mL로 약 16배 차이입니다.
  • Kimi K3는 토큰을 GLM 5.2의 절반만 쓰고도 과제당 환경 비용이 3배였고, DeepSeek V4 Pro는 토큰당 가격이 Kimi K3의 1/15인데 환경 비용은 비슷했습니다.
  • 추정은 H100·16비트·vLLM 가정의 EcoLogits 계산이며 폐쇄형 모델은 제외됐습니다. Bloomberg는 이를 '에이전트 작업이 단순 질의의 약 1만 배'로 요약했지만 보고서 본문에 그 배수는 없습니다.

핵심 사실

발표일
2026-09-03Vals AI 블로그
과제 수
2,157개금융·코딩·의료·법률, Vals Index
모델 수
오픈 웨이트 16종Bloomberg 보도 기준 14종이 중국 모델
완주 전력 최소
23.8kWhLing 3.0 Flash 2607
완주 전력 최대
1.8MWhQwen 3.8 Max
가정
NVIDIA H100 · 16비트 · vLLMEcoLogits 추정

무슨 일인가요

독립 벤치마크 기관 Vals AI는 2026년 9월 3일 오픈 웨이트 모델들이 긴 에이전트 과제를 수행할 때의 전력·탄소·물 사용량을 추정한 보고서를 냈습니다. 저자는 Olivia Fowler, Omar Almatov, Daniel Fein입니다. 데이터 데이터는 금융·코딩·의료·법률 분야의 장기·다회차 에이전트 과제 2,157개로 구성된 Vals Index에서 측정한 토큰 사용량이며, 여기에 오픈소스 라이브러리 EcoLogits를 적용해 모델 파라미터 수와 함께 환경 비용을 계산했습니다. 데이터 배포 가정은 NVIDIA H100, 16비트 가중치, vLLM 서빙입니다. 데이터

증기가 피어오르는 발전소 냉각탑 두 기
보고서가 추정한 항목에는 전력과 탄소뿐 아니라 냉각에 쓰이는 물도 들어갑니다. 사진은 발전소의 습식 냉각탑입니다.· 사진: Jakec · CC BY-SA 3.0

대상은 Kimi K3, DeepSeek V4 Flash, GLM-5.2, MiniMax M2.7, Mistral Medium 3.5, Inkling Small, MiMo V2.5 등 오픈 웨이트 16종이며, 폐쇄형 모델은 구조 정보가 없어 제외됐습니다. 데이터 AI Weekly가 전한 Bloomberg 보도에 따르면 16종 중 14종이 중국 모델입니다. 보도

숫자로 보면

같은 2,157개 과제를 완주하는 데 드는 전력 추정치는 모델에 따라 크게 달랐습니다. 데이터

Vals Index 2,157개 과제 완주 전력 추정 (kWh)
0.0kWh500.0kWh1,000kWh1,500kWh2,000kWhLing 3.0 FlashMiniMax M2.7Mistral Medium 3.5DeepSeek V4 FlashKimi K3Qwen 3.8 Max23.8kWh34.8kWh47.0kWh139.7kWh1,700kWh1,800kWh
Vals Index 2,157개 과제 완주 전력 추정 (kWh)
항목전력
Ling 3.0 Flash23.8kWh
MiniMax M2.734.8kWh
Mistral Medium 3.547.0kWh
DeepSeek V4 Flash139.7kWh
Kimi K31,700kWh
Qwen 3.8 Max1,800kWh

출처: Vals AI, 2026-09-03 (EcoLogits 추정)

최소인 Ling 3.0 Flash(23.8kWh)와 최대인 Qwen 3.8 Max(1.8MWh)의 차이는 약 75배로, 이 배수는 보고서의 두 수치로 계산한 값입니다. 추정 보고서는 Kimi K3의 완주 비용을 탄소는 "샌프란시스코에서 마이애미까지 비행", 물은 "소방차 물탱크 하나"에 비유했습니다. 데이터

일상 규모로 내려오면 10회 대화 기준 수치가 있습니다. 데이터

모델전력탄소
DeepSeek V4 Flash10.5 Wh5.7 gCO₂e46 mL
GLM-5.250.4 Wh27.4 gCO₂e218 mL
Kimi K3169.5 Wh92.4 gCO₂e733 mL

미국의 일일 AI 챗봇 사용자 6,600만 명이 각각 DeepSeek V4 Flash로 대화 한 번을 한다면 합계는 약 690MWh, 탄소 375톤, 물 300만 리터라고 보고서는 추산했습니다. 데이터

가격과 토큰 수는 왜 믿을 수 없나요

보고서의 핵심 주장은 "토큰 가격은 에너지 사용의 불완전한 대리 지표"라는 것입니다. 데이터 Kimi K3는 GLM 5.2보다 토큰을 절반만 쓰고도 과제당 환경 비용이 약 3배였고, DeepSeek V4 Pro는 토큰당 가격이 Kimi K3의 1/15인데 환경 비용은 비슷했습니다. 데이터 에이전트 과제에서는 값싼 모델이 오히려 토큰 효율이 낮아 자원 수요와 과제당 비용을 함께 끌어올릴 수 있다는 설명입니다. 데이터

Bloomberg는 이 보고서를 "웹앱 만들기 같은 긴 '사고' 과제가 단발 질문의 약 1만 배 환경 영향을 갖는다"고 요약했고, Vals의 Omar Almatov는 "더 이상 단발 질문이 아니기 때문에 발자국이 급격히 커진다"고 말했다고 AI Weekly가 전했습니다. 보도 다만 이 글에서 직접 읽은 보고서 본문에는 그 배수가 명시돼 있지 않았습니다. 데이터

자주 묻는 질문

왜 토큰 수가 적은 모델이 환경 비용은 더 큰가요?
EcoLogits 추정은 토큰 수에 모델 파라미터 수를 곱해 계산합니다. 보고서는 Kimi K3가 GLM 5.2보다 토큰을 절반만 쓰고도 과제당 환경 비용이 3배였다고 했는데, 큰 모델일수록 토큰 하나를 만드는 데 더 많은 연산이 들기 때문입니다.
실제 측정값인가요?
아닙니다. 보고서는 Vals가 측정한 토큰 사용량에 오픈소스 라이브러리 EcoLogits를 적용한 '최선의 추정치'라고 밝혔습니다. 양자화, 하드웨어 구성, 데이터센터 효율, 전력원에 따라 실제 값은 달라지며, 폐쇄형 모델은 구조 정보가 없어 제외됐습니다.
'1만 배'라는 숫자는 어디서 나왔나요?
AI Weekly가 전한 Bloomberg 기사 제목과 본문의 표현입니다. 이 글에서 직접 확인한 Vals 보고서 본문에는 단순 질의 대비 배수가 명시돼 있지 않아, 보도 수준의 주장으로 표기했습니다.

출처 · 2

  1. 1Vals Environmental Impacts Report (Vals AI)데이터www.vals.ai/blogs/vals-environmental-impacts-report
  2. 2Vals AI: Agentic Tasks Rack Up 10,000x the Environmental Footprint (AI Weekly, Bloomberg 인용)보도aiweekly.co/alerts/vals-ai-agentic-tasks-rack-up-10000x-the-environmental-footprint-of-simple-llm

이 글의 마크다운 원문: /posts/vals-agentic-environmental-footprint/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

업계 동향· 2

MCP 도구 70만 개 중 직업 과업과 맞는 건 2.6%

Cohere Labs가 9월 3일 공개한 ATE 데이터셋은 공개 MCP 서버 123,069곳의 도구 약 70만 개를 O*NET 직업 과업에 대조했습니다. 어느 직업에 에이전트가 쌓이고 있는지 수치로 정리했습니다.

  • #에이전트
  • #MCP
  • #노동시장
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
오픈소스· 2

Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

  • #오픈소스
  • #검색 에이전트
  • #Qwen