Google Research 在 2026 年 8 月 31 日介绍 TimesFM-3。它的主要变化是原生多变量预测:预测一件商品时,可以同时利用相关商品的历史变化、其他辅助数据,以及在预测时已经知道的未来安排。促销日历终于不必只放在运营人员脑中,也可以成为模型输入的一部分。官方发布说明
当前公开的 3.0 预训练权重使用非商业、非生产许可,不能因为代码可下载就直接用于店铺补货或付费客户交付。理解模型和准备数据,与获得实际生产使用授权,需要分别处理。
新增的“原生多变量”,改变了什么?
单变量预测主要沿着一条序列的历史往后估计。多变量则可以联合处理几条相关序列,并利用额外信息。TimesFM-3支持多个预测目标、仅有历史值的辅助变量,以及未来值已知的动态辅助变量;零样本意味着不必先为每个新任务专门微调,不意味着无需历史记录。
版本差异也要说准确。TimesFM-2.5 已通过 XReg 提供辅助变量支持,因此不能写成“以前完全不能考虑促销”。3.0 的更新在于原生处理相关序列与辅助变量,具体能力和使用方式应按对应版本核对。项目仓库
对运营人员,最直接的理解是:预测不再只问“这件商品以前卖多少”,还可以问“它与哪些商品一起变化”“当时有什么条件”“接下来哪些安排已经确定”。
相关商品不一定一起上涨
假设一家店销售咖啡机、咖啡豆和滤纸。咖啡机销量增加,后续可能带动耗材需求;但滤纸是否相关,还取决于设备类型。有些机型并不使用同一种滤纸,把所有商品简单归为“咖啡用品”,未必提供有效信息。
替代品又是另一种关系。甲款咖啡机做促销,可能分走乙款的销量;两条曲线并不一定同涨同跌。多变量方法有机会利用这种关系,但前提是历史数据中存在可学习的信息,并且商品定义、统计频率和时间范围能够对齐。
这也解释了为什么不必把全店所有商品都塞进一次评估。先选有合理关联的一组,写下关联依据,再看加入后是否改善预测。商品名称相似、同属一个大类,不足以证明它们应该一起建模。
还要留意销量与需求的差别。如果某款连续缺货,记录中的零销量不等于客户没有需求。若没有库存或停售说明,模型看到的只是数值下降。先标明这些日期,有助于解释后来的预测偏差;不能指望模型自动知道仓库发生了什么。
促销输入的关键,是预测那一刻是否已经知道
继续这个自拟咖啡商品场景。团队在 6 月底研究 7 月销量,已经确定 7 月中旬有三天促销。活动日期可以作为未来已知信息;7 月实际成交和实际访问量仍未知,必须留到事后验证。
| 数据 | 在预测起点能知道的部分 | 在研究中承担的作用 |
|---|---|---|
| 咖啡机及相关商品销量 | 截止起点的历史记录 | 共同预测目标或相关历史信息 |
| 网站访问量 | 已发生日期的访问 | 历史辅助信息 |
| 促销安排 | 起点前已确认的未来日期和条件 | 未来已知辅助信息 |
| 后来调整的活动方案 | 起点时尚未确定 | 不能倒填为当时已知 |
| 未来实际销量 | 尚未发生 | 后续检查预测的结果 |
回测时最容易混入的,是后来完善过的活动表。现在看,一整个月的促销安排非常完整;回到当时,其中一些活动也许还没有决定。应保留“何时确定”的记录,才能重建真实可用的信息。
促销也不适合只记一个模糊的“有活动”。折扣、持续天数、适用商品和渠道发生变化时,历史上的活动未必能够直接类比。先把数据含义写清,再决定哪些条件能作为输入,才有办法解释模型为何在活动日给出不同结果。
怎样看出新增信息是否有帮助?
在符合许可的研究范围内,可以设计三组比较:简单基线、只看目标历史的预测,以及加入相关商品和已知活动的预测。基线可以是沿用上一周同一天的数值,作用是让复杂方法有一个清楚的对照。
**比较条件固定:**预测起点、未来长度与结果口径一致。先看普通日、活动日、缺货日,再看误差方向;下面用四天算例把这种读法展开。
如果加入促销后预测上涨,也不能直接断言“促销创造了这些新增销量”。预测利用的是历史关联;要识别促销净增量,还要处理季节、渠道投放、价格和替代商品等影响。一个能预测活动日销量的模型,并不自动完成促销因果评估。
有关评估设计,也可以结合AI任务测试怎样反映真实质量理解。
误差对照要能看出“好在哪里”
以下是教学算例,不是TimesFM-3运行成绩。假设四天实际销量为10、10、20、20,后两天有在预测起点前已确认的促销;简单基线四天均预测10,加入活动信息的候选预测为11、11、18、18。
| 观察范围 | 简单基线平均绝对误差 | 候选预测平均绝对误差 |
|---|---|---|
| 前两天普通日 | 0件 | 1件 |
| 后两天活动日 | 10件 | 2件 |
| 四天合计 | 5件 | 1.5件 |
候选的整体误差更小,但普通日略差,不能只写“全面提升”。活动日仍每天少估2件,也值得保留误差方向。用这张表检查真实回测时,就知道需要同时查看整体、活动日和普通日,而不只是抄一个平均分。
四天当然不足以证明稳定改善。真正评估应在多段未用于当前预测的窗口重复同样比较,记录每段预测起点、已知活动版本和商品范围。如果只有某一次活动改善,就继续查是否恰好遇到相似历史;如果换商品组后失效,则不能把单组效果外推到全店。这个算例的用途是解释验收读法,不是给模型背书。
不只看一个预测数字,还要看不确定性
TimesFM-3 可以提供分位数预测。它们用于表达不同位置的预测值,而不是告诉你未来必然落在某个单点。官方模型卡
用纯解释性的假设数值来看:某天 P10 为 80、P50 为 110、P90 为 150。它与只说“预测 110 件”的信息量不同,至少提示结果存在较宽的不确定范围。这组数值不是本文运行模型所得。
但标着 P10 到 P90,也不保证你的商品实际有 80% 的结果落在这个区间。需要在未用于当前预测的历史窗口检查覆盖情况:实际值是否经常跑出区间,促销日是否特别容易低估,区间是否宽到难以提供判断。分位数名称不能替代校准检查。
对于历史很短、新上市或刚改款的商品,不确定性尤其值得单独看。旧型号的关系未必原样延续,新促销方式也可能超出历史范围。把这些情况标出来,比只报告一个全店平均分更接近运营问题。
下载前,看清代码与权重的用途
当前仓库说明,代码使用 Apache-2.0,2.5及更早版本权重仍为 Apache-2.0;3.0 预训练权重另采用 TimesFM Non-Commercial License v1.0。公开权重的非商业、非生产限制应以相应许可原文为准,不能由仓库总体标识推断全部资产都可商用。3.0权重许可
因此,准备正式店铺或客户项目时,应先确认所用版本、权重与服务的授权是否匹配。改用另一个有适合授权的版本或服务,也要重新核对能力、输入方式和效果,不能只替换名称。
即使暂时不运行模型,数据准备仍有价值:统一销量口径和日期频率,记录缺货与停售,保存促销确定时间,再选一个明确商品组。TimesFM-3 这次更新提供了更完整的多变量能力;能否把它用成可靠预测,仍取决于这些业务信息是否被准确表达和检验。
常见问题
零样本是否意味着不用历史销量?
不是。它指不必为每个新任务专门微调模型,预测仍需要可用的历史序列及适当输入。
可以把下个月实际访问量放进回测吗?
如果在预测起点尚不知道,就不能当作未来已知信息。否则评估使用了实际预测时没有的数据,结果容易过于乐观。
模型预测促销日上涨,能证明促销有效吗?
不能直接证明净增效果。预测中的关联与促销因果不同,后者还要处理其他同步变化及替代效应。
3.0公开权重能直接给店铺补货使用吗?
当前公开权重限制非商业、非生产用途。正式业务需要先取得匹配的授权或选择合适服务,并核对相应条款和能力。