무슨 일인가요
독립 벤치마크 기관 Vals AI는 2026년 9월 3일 오픈 웨이트 모델들이 긴 에이전트 과제를 수행할 때의 전력·탄소·물 사용량을 추정한 보고서를 냈습니다. 저자는 Olivia Fowler, Omar Almatov, Daniel Fein입니다. 데이터 데이터는 금융·코딩·의료·법률 분야의 장기·다회차 에이전트 과제 2,157개로 구성된 Vals Index에서 측정한 토큰 사용량이며, 여기에 오픈소스 라이브러리 EcoLogits를 적용해 모델 파라미터 수와 함께 환경 비용을 계산했습니다. 데이터 배포 가정은 NVIDIA H100, 16비트 가중치, vLLM 서빙입니다. 데이터

대상은 Kimi K3, DeepSeek V4 Flash, GLM-5.2, MiniMax M2.7, Mistral Medium 3.5, Inkling Small, MiMo V2.5 등 오픈 웨이트 16종이며, 폐쇄형 모델은 구조 정보가 없어 제외됐습니다. 데이터 AI Weekly가 전한 Bloomberg 보도에 따르면 16종 중 14종이 중국 모델입니다. 보도
숫자로 보면
같은 2,157개 과제를 완주하는 데 드는 전력 추정치는 모델에 따라 크게 달랐습니다. 데이터
| 항목 | 전력 |
|---|---|
| Ling 3.0 Flash | 23.8kWh |
| MiniMax M2.7 | 34.8kWh |
| Mistral Medium 3.5 | 47.0kWh |
| DeepSeek V4 Flash | 139.7kWh |
| Kimi K3 | 1,700kWh |
| Qwen 3.8 Max | 1,800kWh |
출처: Vals AI, 2026-09-03 (EcoLogits 추정)
최소인 Ling 3.0 Flash(23.8kWh)와 최대인 Qwen 3.8 Max(1.8MWh)의 차이는 약 75배로, 이 배수는 보고서의 두 수치로 계산한 값입니다. 추정 보고서는 Kimi K3의 완주 비용을 탄소는 "샌프란시스코에서 마이애미까지 비행", 물은 "소방차 물탱크 하나"에 비유했습니다. 데이터
일상 규모로 내려오면 10회 대화 기준 수치가 있습니다. 데이터
| 모델 | 전력 | 탄소 | 물 |
|---|---|---|---|
| DeepSeek V4 Flash | 10.5 Wh | 5.7 gCO₂e | 46 mL |
| GLM-5.2 | 50.4 Wh | 27.4 gCO₂e | 218 mL |
| Kimi K3 | 169.5 Wh | 92.4 gCO₂e | 733 mL |
미국의 일일 AI 챗봇 사용자 6,600만 명이 각각 DeepSeek V4 Flash로 대화 한 번을 한다면 합계는 약 690MWh, 탄소 375톤, 물 300만 리터라고 보고서는 추산했습니다. 데이터
가격과 토큰 수는 왜 믿을 수 없나요
보고서의 핵심 주장은 "토큰 가격은 에너지 사용의 불완전한 대리 지표"라는 것입니다. 데이터 Kimi K3는 GLM 5.2보다 토큰을 절반만 쓰고도 과제당 환경 비용이 약 3배였고, DeepSeek V4 Pro는 토큰당 가격이 Kimi K3의 1/15인데 환경 비용은 비슷했습니다. 데이터 에이전트 과제에서는 값싼 모델이 오히려 토큰 효율이 낮아 자원 수요와 과제당 비용을 함께 끌어올릴 수 있다는 설명입니다. 데이터
Bloomberg는 이 보고서를 "웹앱 만들기 같은 긴 '사고' 과제가 단발 질문의 약 1만 배 환경 영향을 갖는다"고 요약했고, Vals의 Omar Almatov는 "더 이상 단발 질문이 아니기 때문에 발자국이 급격히 커진다"고 말했다고 AI Weekly가 전했습니다. 보도 다만 이 글에서 직접 읽은 보고서 본문에는 그 배수가 명시돼 있지 않았습니다. 데이터



