Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
NEWS 约 5 分钟

美国模型也会继承中国审查?

两项研究发现部分商业模型对受限政治言论存在偏差,但“继承中国审查”仍是过强结论。

美国模型也会继承中国审查?

你用中文问 AI 如何评价一个国家的领导人,再把同一个问题换成英文,得到的语气可能不一样:一种更正面,另一种更直接。差别来自哪里?模型读过的新闻、后续安全训练,还是当地法律?2026 年 5 月 13 日发表于 Nature 的研究把问题追到了训练资料,但答案并不是简单的“美国模型继承了中国审查”。更准确地说,两项独立研究共同发现,部分商业大语言模型(LLM——从海量文本中学习如何预测和生成语言的模型)的回答,呈现出与限制政治言论环境一致的偏差;至于偏差如何形成,证据仍有边界。

宣传材料怎样进入模型?

训练语料可以理解为模型上学时读过的书报和网页。哪些来源被收录、出现多少次,会影响模型学到的统计倾向。不过,模型最后说什么,还会受到后续微调和安全规则约束。因此,仅凭一段回答,不能倒推出它具体读过什么。

Nature 论文《State media control influences large language models》用六项研究串起了一条证据链。研究者首先发现,中国国家编排和筛选的媒体内容出现在 LLM 训练数据中。随后,他们对一个开放权重模型追加这类媒体材料的预训练——也就是让研究者能够检查和继续训练的模型,再集中“补读”一批材料。补训后,模型回答有关中国政治机构和领导人的问题时,态度变得更正面。

这一步很关键。它不只是在商业模型外面观察相关性,而是在可控制的模型上改变训练资料,再检查回答是否随之变化。结果支持一种具体机制:国家协调媒体进入训练资料,确实可能推动模型形成相应的政治倾向。

研究还审计了商业模型。面对相同的中国政治问题,模型用中文回答时,比用英文回答更正面。这把训练资料机制与现实产品中的语言差异联系起来,但没有直接证明某个闭源商业模型正是因为读了中国国家媒体才出现这种差异。闭源模型的训练数据、微调过程和平台护栏通常无法由外部审计完整拆开。

“更正面”不等于“拒绝批评”

另一项研究从不同角度检查政治表达。Oversight Board 测试了 Anthropic、DeepSeek、Google、Meta、OpenAI 和 xAI 六家提供商的 10 个商业模型,共生成并分类 13,524 条回答。

Oversight Board 报告,模型面对限制言论司法辖区的政治批评请求时,平均拒答率为 34%;面对言论较自由的司法辖区时为 14%。拒答,就是模型选择不直接响应请求,通常由训练或安全机制塑造。报告用“超过两倍”概括总体差距,数字本身成立,却容易遮住模型之间的巨大差异。

Gemini 3 Flash 和 Grok 4 Fast 对这类政治批评材料的拒答率都是 0%。GPT-5.2 在言论较自由和受限制环境中的拒答率分别为 23% 和 24%,几乎没有方向性差别。换句话说,总体均值主要由部分模型强烈驱动,不能写成“所有美国模型都会回避批评威权政府”。

这项研究由 Oversight Board 发布,并委托 Duco Advisors 独立审查。原 Reddit 帖称“Meta reported on this”并不准确:材料明确指出 Meta 没有参与该研究。

真正值得追问的是数据治理

两项研究测量的并非同一件事。Nature 论文关注回答对政治机构和领导人的评价是否更正面,并用追加预训练实验验证训练资料可能造成的影响;Oversight Board 比较的是模型是否拒绝生成政治批评。更正面、拒绝批评和审查彼此相关,却不能直接画等号。

它们共同提出的问题,是数据治理——围绕资料来源、许可、质量、偏差和可追溯性建立管理规则。如果开发者无法说明训练资料来自哪里、哪些来源被大量重复,公众就很难判断模型的政治倾向是数据留下的痕迹,还是后续安全规则作出的选择。对于越来越多人用来获取信息的工具,这不仅是模型安全问题,也关系到公众知情权。

局限与未知

  • 商业模型审计只能确认回答偏差与受限言论环境存在关联,无法区分训练数据、对齐、安全护栏、当地法律政策或其他因素各自贡献了多少。
  • 两项研究使用的模型、问题设计和衡量指标不同,不能把结果合并成“美国模型继承了中国审查制度”的直接证据。
  • Nature 的追加预训练实验说明这种影响机制可以发生,却不能据此确认某个具体闭源模型已经通过同一路径形成偏差。

因此,更稳妥的标题答案是:部分美国公司开发或提供的模型,确实出现了与受限政治言论环境一致的回答偏差;但“继承中国审查”仍是一个尚未被证明的强因果判断。


供稿材料 SOURCES — 1

← 返回 2026-08-17 · 开源板块