生成一段短视频对 AI 来说并不难,但要让多个镜头在视觉上保持连贯、看起来像是出自同一支视频,则是一个困难得多的问题。为此,谷歌推出了最新的生成式视频模型 Gemini Omni 1.1 Flash,旨在为创作者和开发者提供更高的控制权,让他们能够更精准地掌控从首帧到末帧的所有细节。
此次升级最大的亮点,在于模型对现有视频上下文的记忆能力。当你要求模型继续生成某个场景时,Omni 1.1 能够参考长达 10 秒的前序画面,而不是仅仅依赖最后一秒的画面。这将有助于模型更好地保持角色外观、环境背景以及场景整体走向的一致性,而不是仅仅靠“猜测”来生成后续内容。
谷歌还为创作者提供了更充裕的空间来延续场景。现在,视频可以以 10 秒为单位进行延展,总时长最高可达 40 秒。虽然与传统视频相比这并不算长,但对于AI生成的片段来说,这已经足够构建出具备完整“起承转合”(开头、高潮与结尾)的叙事结构。
创作者现在可以分别指定一个镜头的首帧和尾帧,Gemini 会自动生成连接这两帧所需的所有过渡画面。这一功能非常适合制作环绕主体的镜头运动、在不同构图之间实现平滑缩放,或者生成无缝循环的短视频。
此外,模型还支持视频参考功能:你可以向 Gemini 提供最多 3 秒的现有视频素材作为额外的视觉参考,据谷歌介绍,这有助于在生成的不同场景中保持角色外观等关键元素的一致性。
并非每次测试都需要拉满画质,Omni 1.1 的一项实用更新正是基于这一痛点。开发者现在可以生成 360p 的预览视频,据称其生成速度比常规的 720p 输出快 60%,而成本仅为其三分之一。
这使得创作者在投入大量时间和资金制作最终成品前,能够快速测试创意、微调提示词并迭代多个版本。当你对预览效果满意后,Omni 1.1 可以生成 1080p 视频,或将成片直接放大至 4K 分辨率。
目前,开发者已通过 Google AI Studio 中的 Gemini API 获得了 Omni 1.1 Flash 的访问权限,企业用户则可通过谷歌的企业级 Agent Platform 进行调用。即使你不打算开发应用,也能轻松体验这些新功能。
Omni 1.1 正在面向 AI Plus、Pro 和 Ultra 订阅用户在全球范围内的 Google Flow 中逐步上线。同时,场景延展功能也将直接登陆 Gemini App,让普通用户也能轻松尝试这一模型最引人注目的新能力。