Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.055 — 2026-08-28
NEWS 约 4 分钟

Gemini Omni更新:多模态更可控

Gemini Omni 1.1 Flash增加长上下文、首尾帧控制和低成本预览,视频生成更接近可反复调整的制作工具。

IMAGE — Google DeepMind Blog

你想让 AI 续写一段人物走进房间的视频,结果门的位置变了,衣服也换了。想多试几个版本,又要反复等待高画质渲染。生成视频要进入真正的制作流程,难点已经不只是“能不能生成”,而是能否按要求稳定修改。Google DeepMind 发布的 Gemini Omni 1.1 Flash,正试图补上这层控制能力。

Omni 是多模态模型——同一个模型可以处理文字、图像、音频和视频等不同信息。此次更新通过 Gemini API 提供;API 是供其他软件调用模型的标准接口,开发者可以借此把视频能力嵌入创作、剪辑或媒体产品。Google AI Studio 则是测试提示词和 API 行为的原型工具。

本文信息全部来自 Google DeepMind 官方博客,尚无论文、统一评测或第三方测试支撑。涉及效果的表述均是官方说法。

续写视频时,多看前面几秒

过去的模型续写视频时,只参考原片最后 1 秒。Omni 1.1 Flash 可以分析此前最多 10 秒的视频上下文,再从结尾继续生成。直观地说,它不再只看故事的“最后一句”,而是先回顾一小段上下文。

视频可以每次延长 10 秒,多次扩展后的累计总长度最高为 40 秒。这里的 40 秒不是单次生成时长。Google 称,更长的上下文可以改善视觉一致性和叙事遵循度,也就是更容易保留人物、场景和故事走向。但官方没有公布评测方法、基准结果或失败率,因此还不能判断改善有多稳定。

Omni 1.1 Flash 还允许开发者加入最长 3 秒的参考视频。参考片段可以提供动作和视觉上下文,例如让指定角色模仿参考视频中的舞蹈。它与场景扩展解决的是相近问题:减少模型凭空猜测,让输入条件更具体。

给镜头钉住起点和终点

更直接的变化是首尾帧控制。开发者可以指定一个镜头的第一帧和最后一帧,模型负责生成两个关键帧之间的连续视频。

关键帧可以理解为制作人员预先钉住的两个画面节点。过去只写文字提示,模型对镜头最终落在哪里有较大自由;现在,开发者可以同时规定“从这里开始”和“到这里结束”。官方列举的用途包括环绕镜头、推进变焦和循环片段。

这属于生成控制——让开发者约束镜头、动作或输出条件,而不是靠反复抽取结果碰运气。不过,“能生成连续视频”只是功能描述,并不意味着每次都能无缝转场,也不保证主体始终稳定一致。

先做便宜草稿,再输出成片

Omni 1.1 Flash 支持生成 360p 低分辨率预览。按 Google 公布的系统吞吐量口径,它相比标准的 720p 生成最高快 60%,成本约为后者的三分之一。这适合快速试镜头、改故事板或检查提示词;确认方向后,再输出 1080p 或 4K 版本。

这套流程的意义不在于低清画面本身,而在于降低试错成本。专业制作通常不会一次定稿。预览越快、越便宜,开发者越容易把生成视频做成可反复调整的工具,而不是等待一次结果的演示。

但“最高快 60%”不能理解为所有任务都会提速 60%。官方没有披露硬件、负载、延迟统计口径和画质差异,“三分之一成本”也缺少具体价格与计费条件。

为什么值得关注

生成式多媒体工具的竞争焦点,正在从“能生成”转向速度、可控性,以及能否稳定嵌入专业产品。Omni 1.1 Flash 的几项更新恰好对应制作流程中的三个实际问题:续写时记住更多前文,用首尾帧约束镜头路径,以低清预览加快迭代。

Google 称该模型已可通过 Google AI Studio 中的 Gemini API 用于专业生产场景,并正在其开发者生态中推出。真正需要检验的,不是示例视频是否顺滑,而是这些控制在不同素材、复杂动作和多轮修改中是否仍然可靠。

局限与未知

  • 所有效果论断目前只有 Google DeepMind 一个信源,缺少第三方复现和横向比较。
  • 官方没有披露一致性、提示遵循度和失败率的量化评测,所谓“更可控”仍主要是功能层面的判断。
  • 360p 的速度与成本数据缺少完整测试条件,也没有说明预览与高分辨率成片之间的结果差异。

供稿材料 SOURCES — 1

← 返回 2026-08-28 · 科技板块