- 类型
- 新闻
- 来源
- The Decoder AI News
- 发布
- 2026年7月23日 18:03
- 状态
- 单一信源
01
发生了什么
Black Forest Labs发布了Flux 3多模态基础模型,能生成最长20秒带原生音频的视频,这是该公司首次实现视频与声音同步生成。BFL内部测试显示其性能略领先市场领先者Seedance 2.0,但独立结果尚未公布。公司长远目标是构建世界模型,并已在机器人任务上测试Flux 3。
02
为什么重要
此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。
03
底层逻辑
Flux 3作为多模态基础模型,统一学习图像、视频和音频的联合分布,在生成过程中同时产出视觉帧和时间对齐的声波,从而同步输出带原生声音的视频。
04
产品与商业机会
对视频创作工具而言,可直接输出带音频的成品,省去后期配音流程;对机器人研发,可利用Flux 3生成的带音频仿真场景训练感知与交互模型,可能提升模拟真实度。
- 开发一键生成带原生音频短视频的AI创作工具,面向社交媒体和广告内容制作。
- 与机器人仿真平台合作,使用Flux 3生成带环境音的视频数据,提升多模态训练集的丰富性。
05
仍待确认
- 独立第三方基准测试是否确认Flux 3性能领先Seedance 2.0?
- 生成的音频质量(同步精度、清晰度、多样性)具体如何?
- Flux 3的推理成本和硬件要求是多少?是否提供API或开源?