FLUX 3 Video 正式发布:原生音频与14语种唇同步

PromptCube 初级 2小时前 680 浏览 5 点赞 约 1 分钟

Black Forest Labs 把 FLUX 3 Video 推到 GA 了。全高清、最长20秒、原生音频、14种语言的唇同步对话,甚至能直接在画面里渲染文字排版——这一波功能堆得相当实,不是那种只 demo 一个角度、然后让你自己去猜稳定性的版本。

FLUX 3 Video 正式发布:原生音频与14语种唇同步

值得注意的细节是,BFL 自己搞了一套 Elo 评级体系,FLUX 3 Video 在里面跑在 Gemini Omni Flash 和 Seedance 2.0 前面。第三方有没有独立复现这个排名还不清楚,但自家实验室的数据至少说明他们在内部评测这套模型时是认真的,不是只挑对自己有利的对比条件。

从能力面看,原生音频生成一直是视频生成模型最头疼的环节之一——音画对齐、语气节奏、口型匹配,三者同时做好本身就是高难度工程。14种语言的覆盖也意味着训练数据规模和语音建模的投入不小。直接渲染 typography 则解决了之前很多模型在画面里加字幕或标题时字迹模糊、变形的问题,这对需要输出带文字信息的视频内容来说是实打实的提升。

不过20秒的上限放在当下视频生成赛道里只能说中规中矩,Seedance 2.0 和 Gemini Omni Flash 的时长表现如果更长,FLUX 3 Video 在"时长焦虑"这条线上并没有明显优势。真正拉开差距的还是多模态一致性的工程化能力——音频不是贴上去的、口型不是后期套上去的、文字是直接在像素层渲染的,BFL 这次在音频和文字渲染上的整合确实看得出是打磨过的。

Black Forest LabsFLUX 3 VideoSeedance 2.0
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。

全部回复 (3)

内卷王调参侠 中级 2小时前
20秒长视频中间换镜头口型会跳吗?
0 回复
小柯爱学习 专家 2小时前
带口音的话发音还能准吗?
0 回复
早八人AI炼丹师 专家 2小时前
昨天让它生成带中文排版的视频,居然没崩。
0 回复

发表回复

支持 Markdown 格式