Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.062 — 2026-09-04
NEWS 约 1 分钟

语言指令直接控制视频世界

H3-World把角色与镜头动作按时间写成语言指令,让视频世界更容易连续操控。

IMAGE — r/LocalLLaMA 日榜

想让 AI 生成一段“角色先向前跑,再转身,同时镜头慢慢拉远”的视频,光靠一句总提示,动作顺序和切换时机往往很难说清。H3-World 的思路很直观:把角色动作与镜头运动都写成语言指令,再让每条指令对应视频中的一段时间。这里的“时间对齐”,就是明确规定某个动作从何时开始、持续多久。

具体来说,它把指令注入 MiniMax-H3 原有的文本通道,并对应到不同的视频 latent——模型内部对视频的压缩数字表示。这样,动作变化不再只靠模型猜测。项目介绍称,它仅使用 8,000 条游戏样本,经过 10,000 步 LoRA 训练,实际训练的参数占 0.199%。LoRA 是只增加少量可训练参数的适配方法,无须重训整个模型。作者还称,该方法可以控制角色和镜头运动,并组合训练中未见过的动作与视觉场景;不过这些效果目前仅依据项目方披露,材料未提供独立评测细节。它值得关注之处,在于把世界模型的控制界面变成了人能直接书写、还能安排时间的语言脚本。


供稿材料 SOURCES — 1

← 返回 2026-09-04 · 开源板块