Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.052 — 2026-08-25
NEWS 约 4 分钟

150美元,炼出15亿参数世界模型

个人开发者用约150美元训练15.7亿参数世界模型,失败重来后终于让按键真正影响画面。

IMAGE — r/LocalLLaMA 日榜

你按下游戏里的右方向键,画面看起来仍在动,角色却几乎不听指挥。视频生成得再漂亮,也只是会播放的动画,不是一个能互动的世界。个人开发者 OtherRaisin3426 展示的这次实验,正是从这种失败出发:先放弃一个“好看但不听话”的方案,再从零训练出一个能根据动作预测后续画面的 15.7 亿参数世界模型。

这项工作值得看,不只因为模型规模,还因为作者声称整个训练只花了约 150 美元。它提供了一个少见的个人实践样本。不过,参数、成本和效果指标都来自作者在 Reddit 的单一信源,尚无独立验证;其中成本在“约 150 美元”和“低于 150 美元”之间也有表述差异。

第一次失败:画面会动,按键没用

世界模型(World Model)可以理解为一个学习“环境接下来会怎样变化”的模型。在这个项目里,它接收当前游戏画面和玩家按键,再预测后续视频帧。重点不只是生成下一幕,而是让下一幕服从玩家的动作。

作者第一次采用 Genie 的架构思路。Genie 是 Google DeepMind 提出的生成式交互环境研究路线,可以从视频中学习可操作的虚拟世界。其早期工作会自动发现潜在动作。作者的实现把动作无监督地归纳为 8 个代码,也就是不直接告诉模型每次真实按了什么键,让它自己从视频里猜出动作类别。

结果是,生成视频观感不错,控制却很弱。作者称,一次按键带来的效果“基本为零”。这暴露了一个关键区别:模型可以学会什么样的画面变化看起来自然,却不一定学会“按下这个键,角色就该这样移动”。作者随后放弃这套实现,转向 Dreamer 4。

换条路:先知道真实动作

Dreamer 是一系列在模型内部预测和决策的方法。核心思路是先学会环境如何变化,再在这个内部世界里推演未来。作者从零训练了一个基于 Dreamer 4 的 1.57B,也就是 15.7 亿参数模型。

真正重要的变化还在数据。作者没有从网上抓取游戏视频,而是用 Procgen 自行生成全部训练画面,共计 960 万帧,并保留每一帧对应的真实动作。这样一来,训练和检查都更直接:模型不能只制造看似合理的运动,还要对具体按键作出相应变化。

这像教人开车时,不只给他看道路录像,还把每一刻方向盘和踏板的操作一并记录下来。画面告诉模型“发生了什么”,动作记录则告诉它“为什么这样变化”。

几个数字说明了什么?

作者报告,Tokenizer 达到 40.41 PSNR。Tokenizer 在这里负责把画面转换成模型更容易处理的表示;PSNR 衡量重建图像与原图的像素差异,通常数值越高,说明重建越接近原图。作者同时提到 Genie 论文报告了 35.7,但两者是否使用相同数据集、分辨率和评测流程并不清楚,因此不能据此直接断言该模型优于 Genie。

端到端 FVD 为 32.19。FVD 常用于衡量生成视频与真实视频在整体分布上的差距,但作者没有披露评测集、样本量和计算配置,这个数字更适合视为项目自身的记录,不能直接拿来做跨项目排名。

作者还称,模型大约生成 144 帧后开始失稳。这至少说明它还不能无限稳定地向前推演;而“失稳”的具体判定标准并未给出。

为什么值得关注?

这次实验最有价值的地方,是把失败原因和改动方向连在了一起。第一次尝试证明,“视频好看”不能代替“动作有效”;第二次则通过保留真实动作,让控制能力变得可检查。对于想低成本复现前沿架构的个人开发者,这比单独展示一段漂亮视频更有参考价值。

约 150 美元训练一个 15.7 亿参数世界模型,也确实提示:至少在 Procgen 这一特定游戏环境里,个人实验者可能已经能触及过去显得昂贵的研究方向。但作者进一步宣称“150 美元就够了”“不再需要前沿实验室”,证据还远远不足。一个 CoinRun 项目不能证明同样的预算适用于更多环境或更复杂任务。

局限与未知

  • 成本没有硬件型号、训练时长、云服务折扣、失败实验和数据生成费用的核算明细,“约 150 美元”暂时无法复核。
  • 40.41 PSNR、32.19 FVD 和约 144 帧后的失稳均缺少完整评测条件,也没有独立信源交叉验证。
  • 当前材料只展示了 Procgen/CoinRun 场景,不能据此外推到世界模型训练的一般成本与能力边界。

供稿材料 SOURCES — 1

← 返回 2026-08-25 · 开源板块