资产一多、历史数据又短,判断哪些股票会一起跌,就像只看几天路况却要画完整交通图:两两关系太多,协方差矩阵——汇总资产自身波动及共同涨跌的表格——很难估准。这篇论文换了一个问题:不预测组合究竟会波动多少,而是先给系统性风险划出上界。
作者把每家公司新闻转成 Qwen3-Embedding-8B 的语言模型表征,再比较各公司新闻“语义分布”的距离。这里用的是 Wasserstein-2 距离,可理解为把一堆语义点搬成另一堆时所需的最小平均成本。公司信息越不同,在论文设定的信息—风险映射成立时,其潜在风险就越难完全同步,于是能从“所有资产完全同涨同跌”的最坏情形中扣掉一部分风险。
最巧的一点是:当公司特有的偏差设为零时,信息映射的尺度只改变风险上界能收紧多少,不改变最终的标准化配置;配置仅由新闻表征形成的几何关系决定,也无需跨资产收益协方差。作者在 2018—2022 年的 52 家公司样本中做了样本内评估,但原文所给百分位数字缺失;这些结果也只是描述性排名,并非样本外预测。