谷歌上了 Gemini Omni 1.1 Flash,走 Gemini API 和 Google AI Studio,面向开发者。视频生成这块给了几个挺具体的东西。
场景扩展到 40 秒。做法是参考此前的 10 秒画面,按 10 秒为单位往后接,累计最多 40 秒。注意这个机制——不是一次性生成 40 秒,是分段续写,每段都拿前一段当上下文。
首尾关键帧指定。给定开头和结尾两张图,让模型补中间。这是做转场和产品演示最实用的一个能力。
360p 草稿模式。先出低清预览,满意了再渲高清。
1080p 和 4K 输出。
这四条里,草稿模式的实际价值可能最大,虽然它听上去最不性感。AI 视频生成现在最劝退的地方是试错成本——一次生成几十秒钟等待加真金白银,出来发现动作不对,重来。有了 360p 草稿,构图和运镜可以在便宜档位上反复调,定稿了再上 4K。这是把工作流从”抽卡”改回”有草图有终稿”的正常创作流程。
40 秒这个数字也值得念叨一句。AI 视频的时长一直卡在 5 到 10 秒,原因是长了之后角色一致性会崩。分段续写加参考前段画面,是目前工程上最务实的解法——不指望模型一口气想明白 40 秒,而是让它每次只想 10 秒,但每次都看着上一段。代价是误差会累积,第四段和第一段的一致性大概率不如第二段。
放在竞争格局里看,谷歌这次给的是”可控性”而不是”效果”。首尾帧、草稿、分段扩展,全是工程侧的东西,没有一条是在吹画质。这个取向和它现在全力做 Flash 系列是一路的:不跟你比谁生成的画面更炸,比谁在真实项目里更好用、更便宜。
挂在 Flash 这个名字下面,价格大概率也是它的卖点之一。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Gemini Omni 1.1 Flash 视频能接到 40 秒,但最有用的是 360p 草稿