谷歌把 Gemini Omni 1.1 Flash 转成正式可用,这一版的升级重点落在视频生成上:支持以 10 秒为单位续接,最长能延到 40 秒。
真正的改动不是那个 40 秒,是续接时的参考范围。以前的做法是只看已有片段的最后一帧来推下一段,新版本改成分析最后 10 秒。这一条决定了转场自不自然。
只看末帧的问题,做过 AI 视频的人都遇上过:末帧是一张静止画面,它记录了物体在哪儿,但没记录物体往哪儿动、动多快。于是续接的那一刻运动矢量会重置,人走着走着突然改了步频,镜头推着推着突然停住,接缝在哪儿一眼就能看出来。改成看 10 秒之后,模型至少能把速度和方向的连续性接上。
40 秒这个长度也值得说一句。当前主流视频模型的单次生成大多在 5 到 10 秒区间,做完整叙事只能靠拼。40 秒基本够放下一个完整的短镜头段落,或者一条广告片的主体部分,这对实际生产流程的意义比多几百像素分辨率大得多。
不过 10 秒一续的模式还是会积累误差。每次续接都是在上一段的输出上再做一次生成,人物长相、服装细节、光线色温这些会一段段地漂。四段之后角色还是不是同一个人,得看具体片子。这也是为什么各家在拼长度的同时都在提”一致性”——真正卡住商用的是后者。
Flash 这个后缀说明它走的是快和便宜那一档。同一代里通常还有能力更强的版本,Flash 的定位是让高频调用的场景用得起。对做电商素材、社媒短视频、批量口播的团队来说,能不能大规模跑起来往往比单条质量更关键,这个档位反而更实用。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
Gemini Omni 1.1 Flash 转正,视频能续到 40 秒了