Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER HF 8 约 1 分钟

野生游戏视频变成世界模型燃料

G2WEngine先清除玩家视频里的界面,为世界模型打开更易扩张的数据来源。

玩家录下的游戏视频很多,但血条、地图和字幕会一直盖在画面上。对视频世界模型——从连续画面学习场景如何变化的模型——来说,这些界面不是游戏世界的一部分,却可能被误学成环境运动或特定游戏的规律。G2WEngine想做的,就是把海量但杂乱的公开视频先“洗干净”,再用于训练。

它先用统一分类体系定位各类界面元素,再移除它们并补回被遮住的场景。团队还从真实视频提取界面素材,合成了9.6万组成对视频,让处理前后的画面有精确对应;真实测试集则含303款游戏的1079段视频。其GameCleaner模型不要求人工提供遮罩,而是自行识别界面并完成视频修补。

最值得注意的是一项受控实验:作者在同一批5442段视频上分别训练带界面和无界面版本,后者的综合VideoReward高6.83%,其中运动质量高18.8%。这说明清界面不只是让画面好看,也可能减少错误训练信号。不过实验没有加入动作条件,因此尚未证明公开视频能取代记录“按键—反馈”的完整交互轨迹。


供稿材料 SOURCES — 1

← 返回 2026-08-27 · 学术板块