Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
NEWS 2 信源 约 4 分钟

AI数据洪流,正在污染量化信号

AI让数据产品激增,也让重复、错误和来源不明的信息更容易混进量化信号。

IMAGE — Hedgeweek

你买来三份“不同”的行业数据,模型也从中找到了一个漂亮规律。后来才发现,它们都由同一批网页材料生成,只是分别交给大语言模型改写、分类和包装。模型以为三条线索互相印证,其实只是同一句话被说了三遍。这正是基金眼下担心的问题:AI让数据更容易生产,却没有让数据更容易相信。

现有材料主要来自 Hedgeweek 对 Business Insider 报道及 Neudata 研究的转述,另有 GlobalTrading 对行业讨论的简短报道。它们足以说明风险正在受到关注,但尚不能证明量化信号已被大规模污染,更不能证明投资回报因此普遍受损。

数据多了,独立信息未必多

量化投资依靠数据寻找可重复的规律。除了财报和交易行情,许多基金还购买“另类数据”——例如消费行为、企业活动和网页流量,希望从尚未充分反映在价格里的信息中提取交易信号。

据 Hedgeweek 转述的 Neudata 研究,购买外部数据集的投资者中,约三分之一表示过去两年收到的数据质量有所下降;部分市场参与者把下降部分归因于AI使用增加。不过,报道没有披露样本量、调查对象构成、地区或问卷方法,因此这个比例不能外推到整个行业。

问题不只是某个数字写错。AI降低了采集、处理和包装信息的门槛,也推动更多供应商进入市场。一名购买外部数据的股票投资者告诉 Business Insider,一些新供应商似乎大量依赖大语言模型处理信息。AggKnowledge 联合创始人 Daniel Entrup 则称,有的数据商直接用AI生产待售数据集,或以采用AI为由削减、调配负责维护数据质量的人员。这些都是单一报道中的受访者观察,尚不是行业普查结论。

信号为什么会被“污染”?

数据污染,是错误、重复、合成内容或未来信息混入研究样本。生成式AI尤其放大了两个麻烦。

第一是重复。多个产品可能看似来自不同供应商,底层却循环引用同一批材料。基金若无法确认来源,就可能把重复信息当成多重证据。第二是不可追溯。数据溯源记录一条信息从哪里来、何时生成,又经过哪些清洗和改写。供应商如果讲不清加工过程,基金就难以判断数据是否可靠,也难以确认取得和使用方式是否满足隐私及监管要求。

这还会加重过拟合——模型把历史样本中的偶然噪声当成稳定规律。更多低质量或高度重复的数据,不一定能稀释噪声,反而可能让回测结果显得更有把握。一旦信号在实盘中失常,团队需要倒查的可能不是几个异常值,而是整条供应链。

一个旧案例能说明“数据多”为什么不能替代验证。据 Smithsonian Magazine 和 Science,Google Flu Trends 曾用搜索词追踪流感,但在2012—2013年流感季高峰时,估计一度接近 CDC 数据的两倍;从2011年8月至2013年9月的108周里,它有100周高估疫情。媒体报道会反过来刺激搜索,Google 调整产品也会改变数据怎样产生。输入数据的生成机制一变,原本有效的关系就可能失灵。

真正稀缺的是验证能力

技术预算和内部数据科学能力较强的对冲基金,可能更愿意购买原始数据,再用自己的系统处理,而不是依赖供应商的专有AI模型。这样既便于检查加工过程,也能保留“原始信息如何变成交易信号”这一核心环节的控制权。

Neudata 研究主管 Daryl Smith 用一句话概括这种态度:基金更愿意把AI放进工作流程,而不是直接把产生 alpha 的任务交给它。这里的 alpha,指策略相对市场获得的超额收益。这句话更像受访者对行业心态的概括,不能视作所有基金的统一选择,但它点出了部署瓶颈:AI可以加快处理,可信度仍要靠溯源、人工监督和独立验证建立。

局限与未知

  • 现有材料没有给出错误数据导致具体交易损失、回报下降或错误交易的案例,也没有测量“污染”程度。
  • “约三分之一”的调查缺少样本与方法信息;AI与数据质量下降之间目前只是部分参与者的归因,不是因果识别。
  • 不同供应商使用什么模型、人工复核到什么程度,以及购买原始数据是否确实改善结果,材料均未披露。

供稿材料 SOURCES — 2

← 返回 2026-09-19 · 量化板块