Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 1 约 6 分钟

新闻因子不能只数词频

同一批39万篇新闻里,句向量比数词频更懂语境,但离证明能稳定赚钱还很远。

你看到两条新闻,都写着“就业”。一条说裁员和需求放缓,另一条说招聘与业务扩张。只数词频,它们很可能被归到一起;读完整句话,意思却几乎相反。这篇论文要问的就是:如果模型不只统计新闻用了哪些词,而是理解这些词放在一起表达什么,能不能提炼出更清楚的市场主题,并进一步构造更有效的系统性风险因子?

所谓系统性风险因子,是能同时影响许多资产收益的共同风险来源,而不是某家公司的偶发消息。Kevin Foley、Jonathan Hartadi、Shivesh Prakash 和 Swapnil Vatsal 用同一批 394,661 篇金融新闻、同一套后续资产定价流程,对比传统的 LDA 主题模型和句向量方案。结果有方向性,但还不是定论:句向量分支的主题一致性和组合 Sharpe 观测值都更高,现有检验却不足以证明它稳定优于 LDA。

从“出现什么词”到“这句话什么意思”

LDA——Latent Dirichlet Allocation,一种经典主题模型——把每篇文章看成若干主题的混合,再用经常共同出现的词描述主题。它结构清楚,但基本把文章当成一袋词:词序和局部语境不直接进入模型。

论文拿来比较的是 frozen sentence transformer,也就是参数保持不变的句子编码器。它把一段话的整体含义压缩成一组数字,即句向量。意思接近、措辞不同的段落,在这个数字空间里也可能靠得很近。研究者再用 k-means clustering——按距离把相似向量分组的聚类方法——把新闻段落聚成 60 个主题。

“冻结”很重要。编码器没有用后来的股票收益继续训练,因此文本层不会直接偷看它随后要解释的结果。两条路线也都不预先获得主题名称:LDA按概率最高的词描述主题;句向量路线先聚类,再用 class-based TF-IDF 为各组挑出代表词。后者可以理解为寻找“在这个主题中常见、在其他主题中没那么泛滥”的词。

数据来自 FNSPID,覆盖 2015 年至 2023 年。研究保留有有效日期、股票代码和正文的文章,剔除短于 500 字符、只有摘要或重复的记录。最终词表含 15,000 个词和词组。两种模型读取同一批文章、生成同样数量的主题,随后进入相同的新闻冲击、股票暴露、Sparse IPCA 因子和投资组合流程。

Sparse IPCA 是一种条件因子模型:它不只从收益中找共同波动,还用股票对新闻主题冲击的暴露来估计载荷,并通过稀疏约束筛掉部分信息。说白了,文本主题不能只“看起来像回事”,还要经过资产组合检验,看看它是否对应共同的收益变化。

语境更连贯,收益证据却没那么硬

文本层首先用 NPMI 衡量主题一致性。NPMI 看一个主题的代表词是否经常在同一文档中共同出现;数值越高,词表通常越连贯,但它不等于主题在经济上更正确,也不代表能够预测收益。

在基准比较中,LDA 的平均 NPMI 为 0.2875,冻结句向量分支为 0.3469,高出 0.0594。后者在 41 个月的样本外金融评估中得到 0.3059 的 Sharpe,论文报告其相对 LDA 的观测差为 0.3869。Sharpe 是收益相对波动的指标,常用来描述承担一单位波动换来了多少收益。

但关键词是“观测”。作者明确表示,现有检验不能建立 sentence transformer 相对 LDA 的超额表现。NPMI 本身也未必符合人的主题判断,而 41 个月的评估窗口较短,且研究者是在查看结果后选择探索性设定。这里看到的是值得继续检验的信号,不是已经坐实的胜负。

论文还尝试了两项扩展。第一项是 spherical clustering,即在单位球面上按向量夹角聚类,使算法与余弦相似度的几何结构更一致。第二项是 multi-horizon exposures,用 20、60 和 120 个交易日的半衰期衡量股票与新闻冲击的联动,让近期与较持久的暴露同时进入模型。结合球面聚类、稀疏主题词排序和多期限暴露后,模型的平均 NPMI 达到 0.4691,observed excess-return Sharpe 为 1.0334。

这个 1.03 不能写成基准句向量模型的成绩,更不能直接当作可复现的实盘业绩。它来自进一步探索后的 combined model,收益口径也从基准设置的总收益换成了超额收益。论文将这些扩展与受控的 LDA—句向量比较分开报告,正是为了避免把不同改动揉成一个结论。

真正值得看的是这条检验链

这项工作的意义,不是宣布 Transformer 已经打败词频模型,而是把“更懂语境”接到了资产定价的末端。新闻主题先变成每日关注度,再计算相对过去五天平均值的变化;研究随后估计股票对这些叙事冲击的协方差暴露,从中提炼潜在的共同风险因子,最后才构造组合。

比如,石油供应受到更多关注时,石油生产商和航空公司的反应可能不同。模型寻找的不是一个与“石油”主题一一对应的因子,而是许多新闻暴露共同形成的潜在风险组合。这也解释了为什么主题词更整齐只算第一关:真正的问题是,这些语境差异能否稳定穿过整条链路,落到共同收益波动上。

局限与未知

  • 比较并非只替换算法。LDA读取清洗后的完整文章;句向量模型最多读取开头三个段落,而且编码器会把较长段落截到大约前 110 个词。两者看到的文本量不同,主题词排序方法也不同,因此结果可能混入“读取位置”和“展示主题方式”的影响。
  • 所谓样本外只适用于金融模型阶段。词表和主题使用了完整新闻样本,预训练编码器见过的文本时期也与评估期重叠。它可能带入新闻发布当时尚不可得的信息,形成前视偏差。
  • 全部结果来自同一篇论文,尚无独立信源交叉验证。作者自己的结论也很克制:上下文技术可能有助于构建系统性风险因子,但需要严格限定各日期实际可得的信息,并在更广泛的数据集上重新检验。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 量化板块