Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.016 — 2026-07-20
PAPER H 30 约 1 分钟

预训练数据投毒进入宣传战时代

攻击者借公开评论批量投放内容,或能绕过直接篡改数据源,把隐蔽行为带进基础模型。

想给未来的 AI“塞私货”,未必需要攻破 Wikipedia 或训练服务器。攻击者可以像经营宣传账号一样,在大量网站的公开评论区投放文字,等待网页爬虫把它们收进预训练语料——模型最初用来学习语言的大规模材料。论文把这种路径称为计算宣传:传播对象不再只是人,也包括收集训练数据的爬虫。

真正的难点是,投放成功不等于进入训练。作者提出 HalfLife,把过程拆成三关:网页能否留言、爬虫能否提取留言、内容能否通过清洗与质量筛选。论文估算,公开评论经由 Common Crawl 进入最终语料的概率约为 0.15%;比例虽小,但作者称,其影响的文档数仍可能超过 Dolma 3 中整个 Wikipedia 部分——后者占 0.067%。相比之下,程序化广告被判断为不太可能走完这条链路。

这项工作的提醒很直接:预训练数据投毒——故意把错误关联或隐藏行为混入模型早期学习材料——正在从“篡改知名数据源”转向利用整个开放网络。上述比例来自作者的 HalfLife 估算,而非对真实模型训练数据的直接观察。


供稿材料 SOURCES — 1

← 返回 2026-07-20 · 学术板块