무슨 일인가요
2026년 8월 31일, Google Research의 Ayush Jain과 Rajat Sen은 시계열 파운데이션 모델 TimesFM-3를 공개했습니다. 공식 모델은 3억 3,000만 파라미터로, 실제와 합성 시계열을 합쳐 1조 개가 넘는 시점 데이터로 사전학습했습니다. 공식 GitHub와 Hugging Face에서 바로 받을 수 있고, BigQuery 통합은 몇 주 안에 나올 예정입니다. 공식
핵심은 "제로샷 다변량"입니다. 이전 TimesFM은 하나의 시계열을 보고 다음 값을 맞히는 단변량 모델이었지만, TimesFM-3는 여러 목표 변수, 과거에만 알려진 공변량, 그리고 미래 값까지 알려진 동적 공변량(예: 예정된 프로모션, 휴일)을 과제별 튜닝 없이 한 번에 넣을 수 있습니다. 공식 예측은 Contiguous Patch Masking이라는 방식으로 반복 생성 대신 한 번의 순전파에 끝나며, 10 백분위부터 90 백분위까지 9개 분위수를 함께 내놓아 확률 예측이 가능합니다. 공식

TIMESFM-3 핵심
시계열 예측에 '공변량 포함 제로샷'이 들어왔습니다
여러 목표 변수 + 과거 공변량 + 과거·미래 동적 공변량을 기본 지원
Contiguous Patch Masking으로 한 번의 순전파에 예측 완료
9개 분위수(10~90 백분위) 출력으로 확률 예측
Gift-Eval·FEV-Bench·TIME 세 벤치마크에서 사전학습 모델 중 1위 주장
출처: Google Research 블로그 (2026-08-31)
성능은 어떻게 주장하나요
Google은 Gift-Eval, FEV-Bench, TIME 세 벤치마크에서 "점 예측과 확률 예측 지표 모두에서 사전학습 파운데이션 모델 중 최상위"라고 밝혔고, 비교 대상으로 Chronos-2, Toto 2.0 계열, 자사 이전 모델 TimesFM-2.5를 들었습니다. 공식 GitHub README는 FEV-Bench가 100개 과제, TIME이 98개 평가 과제로 구성되며 세 벤치마크 모두 파운데이션 모델 가운데 종합 1위라고 적고 있습니다. 공식 다만 공식 블로그 본문에는 순위만 있고 구체적인 점수표는 실려 있지 않아, 이 글에서는 수치를 인용하지 않습니다.
| 항목 | 이전 버전 | TimesFM-3 | 근거 |
|---|---|---|---|
| 입력 구조 | 단변량 | 다변량 + 공변량 | Google Research 블로그 |
| 예측 방식 | 반복 생성 | 한 번의 순전파 (Contiguous Patch Masking) | Google Research 블로그 |
| 컨텍스트 길이 | 2048 | 최대 16k | GitHub README |
| 확률 출력 | — | 9개 분위수 (10~90 백분위) | Google Research 블로그 |
| 아키텍처 | — | 20층, 차원 1280, 어텐션 헤드 16, Variate Attention | Hugging Face 모델 카드 |
Hugging Face 모델 카드는 아키텍처를 "Variate Attention과 CPM Iterative RevIN을 갖춘 Stacked Mixing Transformer"로 설명하며, 컨텍스트 패치 길이 32, 예측 패치 길이 64를 명시합니다. 공식 학습 데이터에는 GiftEvalPretrain 데이터셋, Wikipedia 페이지뷰, Google Trends 질의, 합성 증강 데이터가 포함됩니다. 공식
라이선스가 관건입니다
가장 먼저 확인할 것은 라이선스입니다. 소스 코드는 Apache-2.0이지만, TimesFM 3.0 사전학습 가중치는 별도의 TimesFM 비상업 라이선스 v1.0으로 배포되며 README는 "기본 사전학습 가중치의 상업 또는 프로덕션 사용은 허용되지 않는다"고 명시합니다. 공식 Hugging Face 모델 카드도 같은 라이선스를 표기하고, 아직 어떤 추론 제공자도 이 모델을 배포하지 않았다고 적혀 있습니다. 공식 설치는 pip install timesfm[torch], Apple Silicon에서는 timesfm[mlx]이며, PyTorch 쪽 API 이름은 TimesFM3Evaluator와 ModelConfig, 배치 예측은 predict_batch입니다. 공식
Google이 든 적용 분야는 소매, 금융, 관측성(observability), 제조, 의료, 자연과학입니다. 공식 상업 이용을 원하는 팀이라면 가중치를 직접 받는 대신 몇 주 안에 나올 BigQuery 통합 같은 Google 제품 경로를 기다리는 편이 안전합니다. 추정
그래서 무엇을 보면 되나요
공변량이 있는 문제부터 시험
프로모션·휴일·가격처럼 미래 값을 아는 변수가 있는 수요 예측이 이 모델의 설계 목적에 가장 가깝습니다. 단변량 문제라면 2.5 대비 이점이 작을 수 있습니다.
자기 데이터로 Chronos-2와 비교
공식 블로그의 1위 주장은 공개 벤치마크 기준입니다. 도메인 데이터에서 Chronos-2, Toto 2.0과 직접 비교해 보는 것이 맞습니다.
프로덕션 전에 라이선스 검토
가중치 라이선스가 비상업이므로, 사내 파일럿과 실제 서비스 투입은 법무 확인 없이는 구분해야 합니다.



