Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
PAPER 约 1 分钟

换套评测,世界模型成绩从头再算

同一模型只换目标设置,成功率就从84%跌到8%,评测规则足以改写结论。

给同一个学生换一套考题,名次可能完全不同;世界模型也一样。Joyjeet Singh 独立复现 LeWorldModel 后发现,这个用内部数字压缩环境、再预测动作后变化的“潜在世界模型”,成绩很大程度取决于评测协议——任务起点、目标位置、步数上限和成功判定等计分规则。

最关键的一组实验里,复现者使用作者公开的同一检查点、同一规划器和完全相同的 50 个回合,只改变目标如何构造,成功率便从 84.0% 降到 8.0%。公开材料本身还给出两套不一致的设置:论文附录所述方案测得 14.0%,代码仓库配置则测得 84.0%;只有后者接近原论文约 87% 的报告值。复现团队修正四项未写入配置文件的处理约定后,自训模型达到 94.0%,但与作者检查点的差异在这一样本量下尚未确立。

这项工作没有否定 LeWorldModel,而是提醒我们:单一环境里的高成功率,未必只反映模型能力,也可能反映“题目怎么出”。结论仅覆盖 TwoRoom 环境、18.03M 参数配置,并且所有结果都来自单一种子。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 学术板块