你让一个熟知今天新闻的人回到 2008 年判断股价。即使他保证只看当年的报道,脑中仍可能藏着后来发生的事。语言模型做历史预测也有这个麻烦:训练时读过未来文本,再回头分析旧新闻,结果可能看似精准,其实已经偷看了答案。
Songrun He 等人的论文尝试把这条时间线管严。他们训练了 ChronoBERT 和 ChronoGPT,并从 1999 年到 2024 年逐年保存模型。每个年份的版本,只能学习截至当时已经公开的文本。这样,研究者回测 2008 年的策略时,就能调用知识停留在 2008 年的模型,而不是让今天的模型假装忘掉未来。
这项工作针对的是前视偏差(look-ahead bias)——回测误用了当时尚未公开的信息,让策略表现虚高。相近的问题叫训练泄漏(training leakage):本应留给检验的信息已经混入训练材料,测试自然不再真正独立。本文的结果均来自论文自身;现有材料没有外部复现或第三方评测。
给模型做一排“年份切片”
办法听起来简单:按发布日期过滤文本。但真正的难点是,早期可用资料少,严格控制时间后,模型可能变得很笨。论文因此同时处理两件事:降低训练成本,并从有限历史材料中筛选更多样、质量更高的文本。
基础语料包含 70 亿个 token——token 是模型处理文字时切分出的基本单位——来源包括历史网页、新闻档案和科学出版物,均被整理为 2000 年以前发布。此后,作者再用 2000 至 2024 年间共 650 亿个 token 的带时间戳文本逐年增量训练,最终形成 1999 至 2024 年的模型序列。
ChronoBERT 有 1.49 亿参数。它采用“遮住一个词再猜回来”的训练方式,首个版本累计训练了 4600 亿个 token,相当于把有限语料反复学习 70 多轮。ChronoGPT 有 15.52 亿参数,采用“根据前文预测下一个词”的方式;首个版本训练约 710 亿个 token、约 10 轮。两者代表两种不同用途:前者更适合分类和文本表示,后者更接近生成式模型。
这种设计的关键,不是要求一个大模型临时假装自己生活在过去,而是真正让每个版本没有机会接触未来。论文也对另一种做法保持警惕:在提示词里遮掉日期或实体,可能同时破坏有用信息,而且未必能清除模型已经记住的未来知识。
不看未来,语言能力会掉多少?
作者先用通用语言任务检查模型是否“守时但失语”。GLUE 是一组考察语法、语义相似度和自然语言推断的分类测试。最早的 ChronoBERT 在训练约 3500 亿个 token 后,GLUE 表现超过原始 BERT;最终得分稳定在约 85,低于 ModernBERT 的 88。论文认为,反复使用受时间限制的语料后,继续训练的收益已经趋于平坦。
在论文给出的综合比较中,两个 ChronoBERT 版本的 GLUE 得分为 84.71 和 85.54,高于 BERT 的 84.52、StoriesLM 的 79.36和 FinBERT 的 76.41,但仍低于拥有约 80.3 亿参数的 Llama 3.1,其得分为 86.31。ChronoBERT 只有 Llama 3.1 不到五十分之一的参数规模。
ChronoGPT 则接受 HellaSwag 测试:模型要从四个选项里找出一段情境最合理的结尾。它在约 30 亿个训练 token 后超过 GPT-2;训练至 400 亿个 token 后得分约 37%,仍低于参数量相近的 GPT-2 XL 的 48%。换句话说,时间约束并非没有代价,但论文的结果表明,这个代价没有大到让模型失去实用的语言能力。
怎么检查它真的没偷看?
只按文本日期过滤还不够。旧纸本经过 OCR——把扫描图像识别成文字——以后,日期可能标错,未来信息仍可能混进来。作者因此设计了一项直观检查:让不同年份的模型补全美国总统姓名。
理想状态下,模型应该知道知识截止日前已经就任的总统,却猜不中截止日后首次当选的人。ChronoBERT 对截止日前问题答对 68 次,共 78 次;ChronoGPT 答对 77 次。对于截止日后的首次任期,两组模型都没有正确预测未来总统。
不过,这项检查也显示了测试本身的边界:一个模型即使偶然猜中未来答案,也未必真的见过未来资料。论文提到,部分模型猜中了 Donald Trump 在 2025 年开始的非连续第二任期,这可能只是偏向选择近期或历史上醒目的总统。时间一致性不能靠一道问答题盖章,它更像一组需要持续核对的证据。
放进金融回测,差距反而不大
真正的检验是次日股票收益预测。作者使用 Dow Jones Newswire 数据,覆盖 2007 年 1 月至 2023 年 7 月;2007 年用于建立最初的预测模型,正式资产定价测试从 2008 年 1 月开始。新闻带有精确到微秒的展示时间,作者把每家公司从前一日下午 4 点到当日下午 4 点的标题合并,再交给不同语言模型转换成 embedding——也就是把文字压成可供统计模型使用的一组数字。
随后,他们把这些数字与下一交易日收益相连,用带 ridge penalty 的 Fama–MacBeth 回归做实时样本外预测。通俗地说,回归模型只根据过去月份学到的关系,估计明天哪些股票更可能上涨。股票每天按预测值分成十组,策略买入最高组、卖空最低组,再用 Sharpe ratio 衡量风险调整后的收益。
论文报告,ChronoBERT 和 ChronoGPT 形成的投资组合,Sharpe ratio 与规模大得多的 Llama 3.1 相当;相较 StoriesLM 和 FinBERT,收益改善在经济意义和统计意义上都较显著。作者据此认为,在这项“用新闻预测次日收益”的特定实验里,前视偏差相对有限。
这里有个重要细节:最终投资表现不只取决于语言模型。即使时间受限的模型对语言理解稍弱,上层回归也可能学会适应它输出的特征。因此,相近的 Sharpe ratio 说明整套预测流程可以追上 Llama,却不能单独证明两个语言模型拥有同等理解力,更不能证明所有金融任务都没有前视偏差。
为什么这比又一个榜单分数重要
历史回测的基本要求,是让每一次决策只使用当时可得的信息。传统金融数据尚可按发布日期整理;语言模型却把大量文本知识压进参数,很难逐条追查它究竟知道什么。ChronoBERT 和 ChronoGPT 的价值,在于把“模型当时能知道什么”变成可控制的实验条件。
这也改变了比较方式。研究者不必只问哪个模型预测更准,还可以比较同一套方法在不同知识截止日下表现如何。如果现代模型的优势在严格守时后消失,就要怀疑漂亮结果是否来自未来知识;如果仍然成立,历史回测才更可信。
局限与未知
- 目前证据来自作者论文这一处信源,现有材料未说明是否已经过同行评审,也没有外部复现。
- 发布日期可能因 OCR 或元数据错误而失真。总统补全测试提供了佐证,但不能穷尽所有潜在泄漏。
- “前视偏差相对有限”只适用于本文的新闻驱动次日收益实验。论文没有因此证明其他金融预测或社会科学任务同样安全。
论文于 2025 年 2 月 28 日提交 arXiv v1,并在同年 7 月 6 日更新至 v3。它最值得记住的并不是某个更高的分数,而是一条朴素规则:如果研究问题发生在过去,语言模型也必须站回过去再回答。