Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
NEWS 约 1 分钟

Agent搜索模型会不会识破假信源

EchoNet搭出真假混杂的合成网页,测试九个开放模型会不会被伪信源带偏。

IMAGE — r/LocalLLaMA 日榜

你让 AI 自己上网查答案,它看到十篇口径一致的网页,会不会把“人多势众”误当成可靠?EchoNet 搭了一个可控的合成网页环境,塞入置顶假页面、批量复制的假说法,以及被虚假多数包围的真实主要来源,再让九个开放权重模型搜索并作答。这测的是“认知仲裁”——模型该相信原有知识,还是相信刚搜到的材料。

据作者 RevealIndividual7567 在 Reddit 披露,每个模型接受了 50 至 100 次测试。在“模型原本答对、读过有说服力的假页面后却改错”这一项中,DeepSeek V4 Flash 的受骗率为 15.8%;GLM 5.2、Qwen3.8 Flash 和 Qwen3.8 27B 则一次也没被带偏。综合衡量抵抗假信息与接受真实更新的 EAS 分数中,GLM 5.2 得到 1.000。作者也提醒,样本量有限,多个模型的误差区间重叠,不能把接近的结果硬排成名次。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 开源板块