谷歌 TimesFM-3 开源:不训练也能同时预测多条指标

谷歌 TimesFM-3 开源:不训练也能同时预测多条指标

一家零售公司想预测下个月的冰淇淋销量。传统做法是把过去几年的销量数据喂给一个模型,让它算出下个月的数字。但现实里,销量从来不只是销量的函数——下周有促销活动、气温要升高、隔壁新开了家店、旁边柜台的饮料在打折,这些都会影响结果。

8 月 31 日,Google Research 发布的时间序列基础模型 TimesFM-3,正是冲着这个问题来的。它有 3.3 亿参数,在超过 1 万亿个时间点上完成预训练,关键是:原生支持多变量预测,而且零样本、不用微调

从「一次预测一条」到「一次预测一片」

在 TimesFM-3 之前,TimesFM 系列(包括 2.5)主要做的是单变量预测——用一条序列自己的历史去预测它自己的未来。这在生产环境里有个明显的短板:真实业务中几乎所有指标都是互相牵连的。

TimesFM-3 的变化在于,它可以把多条相关的目标序列放在一起联合预测,同时还能吃进三类输入:多个目标序列、仅历史可见的协变量(比如历史客流)、以及已知未来值的协变量(比如已经排好的促销日历、已经发布的天气预报)。

第三类是这次最有价值的突破。Google 举的例子很直观:预测冰淇淋销量时,你可以同时输入历史销量、客流数据、未来天气预报和促销排期。模型会学到「过去搞促销时销量会涨」这个关系,并据此提前预判——官方示例中,模型提前算出了促销日约 20% 的销量上冲,而这个信号是单变量模型完全看不到的。Google 也说明,这只是一个用来解释机制的例子,不是某家企业的真实业绩。

技术上做了什么改动

TimesFM-3 保留了前代的 decoder-only Transformer 骨架,但改动集中在三处。

第一是双注意力交替机制。时间被切成 32 步为一个 patch,每个序列单独归一化(避免量级大的序列压过量级小的),token 排成一个 2D 网格。然后交替跑两种注意力:因果时间注意力让 token 只沿时间轴向后看,保证预测的因果性、不泄露未来目标值;全变量注意力让 token 在同一时间步上横向看其他所有序列,模型由此学到「A 产品线促销会影响 B 产品线销量」这类跨序列关系。

第二是连续补丁掩码(Contiguous Patch Masking)与非自回归解码。前代是分块依次解码的,延迟高且误差会逐步累积;TimesFM-3 改为一次性掩码整个未来预测区间,一次前向传播就把整段预测填满。官方称这降低了延迟、减少了长周期预测中的误差累积。

第三是概率化输出。它不是只给一个预测值,而是在每个时间步输出 9 个分位数,等于给出一段可能区间。对需要做风险评估的备货、排班、现金流规划来说,这个比单点预测有用得多。发布配置下最多支持 32 条变量

模型规模上,Hugging Face 上的 checkpoint 约 1.32 GB,采用 20 层 Transformer 架构。

榜单成绩:三个基准都是第一

Google 在 GIFT-Eval、FEV-Bench、TIME 三个公开基准上做了评估,称 TimesFM-3 在预训练基础模型中,点预测和概率预测两项都排第一。对比对象包括 Chronos-2 和 Toto 2.0 系列,以及自家的 TimesFM-2.5。

官方还提到一个有意思的结论:即便被强制退回单变量模式,TimesFM-3 的表现依然能打平或超过竞品;而一旦打开跨序列信息和协变量,表现会进一步提升。

需要提醒的是,这些是 Google 自己公布的排名结果,发布内容里给出的是排名图而非完整原始分数表,也没有独立的第三方评测。判断它好不好用,最终还是要看你自己的数据。

⚠️ 最大的坑:权重是「非商业许可」

这是本文最该被记住的一段。TimesFM-3 的代码仓库是 Apache-2.0 许可,但预训练权重使用的是单独的 TimesFM 非商业许可 v1.0,仅限非商业、非生产用途

也就是说,你可以下载下来做实验、做评估、做技术验证,但不能直接拿这个公开 checkpoint 去做商业服务或跑在生产环境里

那企业用户怎么办?Google 表示 BigQuery 集成将在数周内到来,届时多变量预测会通过 AI.FORECAST 这个 SQL 命令提供——就像此前 univariate 的 TimesFM-2.5 一样,让不懂机器学习的分析师也能直接调用。这条路可能会成为商业使用的主要入口,具体条款和可用性以 Google 后续公布为准。

上手思路:三步验证它值不值得用

第一步,准备一组互相关联的序列。别只拿一条销量数据测,那样测不出它的优势。至少准备目标序列(比如各 SKU 的日销量)、历史协变量(客流、价格)、已知未来协变量(促销排期、节假日日历)。

第二步,先跑零样本,不做任何微调。这是基础模型的核心卖点——直接把数据喂进去看结果,拿它跟你现在的基线模型(哪怕只是一个移动平均或者 XGBoost)比一比误差。

第三步,重点看两件事:一是概率输出的校准程度(它给的 90% 区间里,实际落进去的比例是不是接近 90%);二是在有促销、有节假日这类「已知未来事件」的时间点上,它的预测是不是明显比单变量模型准。

Google 自己给的建议也很实在:在下一次规划周期之前,先拿真实数据做一轮基准测试,别只看榜单排名就下结论。

对普通人意味着什么

如果你不做数据分析,这个模型离你并不远。需求预测、排班计划、仓储容量、现金流预估——这些是每个公司里最常见的量化工作,过去往往需要一个数据科学团队为每个指标单独建模、反复重训。一个 3.3 亿参数、不需要微调的模型,意味着这套能力可以嵌进零售商的计划工具或者财务团队的表格流程里,而不必先组建一个机器学习工程团队。

但要清醒:它现在是「可以测试,不可以商用」的状态。对个人学习、技术评估、原型验证来说,现在就能下载开跑;对企业生产部署,还得等 BigQuery 那条路走通,或者等许可条款出现变化。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。