【FLUX 3发布:当视频生成开始长出“物理大脑”】Black Forest Labs发布了原生多模态大模型FLUX 3,核心突破在于将图像、视频和音频放在同一个Transformer架构下联合训练。它不再是把画面和声音拼凑在一起,而是试图建立一个统一的“世界模型”:让模型理解撞击必须伴随声响,运动必须符合质量。除了支持20秒带音效的视频生成和更强的图像理解,官方还预告了面向开发者开放“开放权重”版本FLUX 3 Dev。这件事的底层逻辑在于AI竞争维度的降维打击。过去我们把视频生成看作视觉游戏,但FLUX 3把它变成了物理模拟——通过音频和视频的互补,模型在学习现实世界的因果律。虽然目前社区对演示视频中的跳剪和“世界模型”的定义仍有争议,且开放权重版本通常会经过蒸馏导致微调难度增加,但FLUX 3证明了:未来的顶尖模型必须像人类一样,通过多感官协同来理解物理常识。对于国内开发者来说,这不仅是多了一个好用的工具,更是提供了一个将视觉生成转化为机器人动作预测(Physical AI)的技术范式。 bfl.ai/blog/flux-3


