用 Gemini Omni 1.1 Flash 续镜测试后发现,视频 AI 终于不再是抽卡游戏了

PromptCube 高级 23小时前 330 浏览 7 点赞 约 2 分钟

最近深度体验了 Gemini Omni 1.1 Flash 的视频能力,最让我兴奋的不是它能生成什么,而是它在尝试打破“生成”与“编辑”之间那道深不见底的墙。

用 Gemini Omni 1.1 Flash 续镜测试后发现,视频 AI 终于不再是抽卡游戏了

在之前的视频 AI 工作流中,我们基本处于一种“抽卡”状态:输入一段 Prompt,然后祈祷 AI 能随机给出一个满意的镜头。最痛苦的是,如果画面整体不错,但某个动作细节不对,或者时长差了 1 秒,你几乎无法在原视频基础上进行精准微调,只能通过修改词条重新生成,然后面对一个完全不同的新镜头。

这次 Gemini 1.1 Flash 最激进的逻辑是把续镜、首尾帧补全和超分全部集成在了对话流里。这意味着你不需要在复杂的编辑面板里拉时间轴,直接在对话框里用指令就能对已生成的视频进行“续写”或“修正”。

我重点测试了它的续镜分析机制。目前 Gemini 1.1 Flash 支持分析前 10 秒的视频内容并向后延伸。在实际操作中,这种机制在维持场景一致性上的表现,远比纯靠 Prompt 引导要稳得多。举个例子,我生成了一个角色在咖啡馆喝水的镜头,如果我想让这个角色随后放下杯子起身离开,只要发送续镜指令,场景里的灯光色调、桌上的杂物以及人物的衣服颜色都能维持在相当稳定的状态。而如果用传统的 Prompt 方式,你得在下一段指令里费劲地把环境细节全部描述一遍,而且 AI 依然可能把咖啡杯的颜色给改了。

不过,这种分析能力依然有物理上限。虽然目前最高可以累计生成 40 秒的视频,但由于单段分析的窗口上限依然是 10 秒,随着视频长度的增加,画面的细节崩坏不可避免。我在测试中发现,当视频累积到 20-30 秒之后,背景中的小物件开始出现形变,人物的服装细节也会出现微小偏差。这意味着,如果你想拍一个完整的短故事,目前依然不能指望 AI 一次性跑通,必须由人类来把控分镜,将长故事拆解成多个 10 秒以内的片段进行拼接。

另外,这次的定价策略其实给出了一个非常明确的效率指南。目前的阶梯定价从 360p 的 0.03 美元/秒一直延伸到 4K 的 0.30 美元/秒。这 10 倍的价格差其实在暗示用户:不要在第一步就追求高画质。

目前最高效的链路应该是“低清打样 → 确定运动 → 4K 超分”。先用 360p 的低成本版本快速迭代,确认镜头的运镜方向和动作幅度是否符合预期,最后再针对满意的片段执行 4K 超分指令。如果一开始就直接跑 4K,不仅成本高,而且一旦动作不满意,修改的成本(时间与金钱)将是巨大的。

总的来说,把剪辑能力塞进对话框,让视频生成从“随机抽奖”变成了“可控编辑”。虽然 40 秒的累计上限和 10 秒的分析窗口依然是瓶颈,但这种通过对话流直接控制首尾帧和续镜的逻辑,确实让视频创作的门槛降低了不少。

GoogleVeo4K超分
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。

全部回复 (0)

还没有回复,来发第一条吧!

发表回复

支持 Markdown 格式