同一个问题,换成中文问 AI,答案可能就变了。据 Associated Press 报道,一项发表于《Nature》的研究发现,ChatGPT、Claude 和 Gemini 等美国模型在部分涉华问题上,会因提问语言不同而给出不同回答。这值得警惕:大型语言模型从海量网络文本中学习表达,也可能把其中的政治禁忌、删改痕迹和官方措辞一并学走。
一个直观例子是:研究者用英文询问 ChatGPT“中国是否民主”,模型回答中国通常不被视为民主国家;改用中文询问,口径却变成“取决于如何定义民主”。这种跨语言评测——用不同语言提出含义相同的问题,再比较回答——能揭出英文测试看不到的偏差。研究者没有发现政府故意影响模型输出的证据;问题更可能指向共同盲区:受审查或宣传影响的非英语语料如何进入训练,以及现有评测为何没有及时发现。WSJ 报道称,研究人员认为相关公司尚未采取多少修正措施。