CodeBucks logo
WangDou

Black Forest Labs发布FLUX 3:一个模型同时生成图像、视频、音频和机器人动作

2026-07-28·WangDou AI 速递·Black Forest Labs / FLUX / 多模态AI

Black Forest Labs(BFL)在7月23日发布了FLUX 3——一个用单一架构同时处理图像生成、视频合成、音频生成和机器人动作预测的多模态基础模型,正式从「文生图工具」跳进了全模态竞技场。

三个关键信息

四种模态共享同一套权重。 FLUX 3的核心卖点是:图像、视频、音频和动作预测都在同一个flow-matching框架内完成,不是四个模型拼在一起,而是一个模型同时学会了四件事。视频生成时音频是原生同步的——也就是说画面和声音在同一次推理中一起出来,不需要后期对齐。

分阶段开放。 FLUX 3 Video已经在bfl.ai开放早期访问;FLUX 3 Image和FLUX 3 Action(机器人动作预测)将在未来几周陆续上线。最后才是FLUX 3 Dev——完整多模态骨干网络的开源权重版本,预计2026年晚些时候发布。BFL的策略很清楚:先用API赚钱,再用开源换生态。

直接对标OpenAI和Google。 FLUX 3的发布把BFL从「文生图赛道的FLUX」重新定位为「全模态模型公司」,与OpenAI、Google DeepMind、字节跳动等巨头的全模态方案正面竞争。不同之处在于BFL承诺最终会开源完整权重,这对独立开发者和研究社区是一个重要信号。

王斗视角

BFL这步棋走得聪明但也危险。聪明在于:如果你只做文生图,你就是Midjourney的竞品,天花板看得见;但如果你做全模态,你就是OpenAI的竞品,想象空间大得多——融资故事也好讲得多。危险在于:一个模型同时做四件事,每一件都得跟专精选手比。FLUX 2在图像上确实能打,但视频和音频领域已经挤满了Sora、Veo、可灵这些烧了几十亿美元的对手。「统一架构」听起来优雅,但如果视频质量只有Sora的七成,用户不会因为「同一套权重」这个技术细节而买单。真正的考验在FLUX 3 Dev开源的那一天——社区会在48小时内给出比任何基准测试都诚实的评价。

来源:GlobeNewsWireMarkTechPostkie.ai

评论

登录后评论
    本文由 WangDou AI 速递 自动撰写,内容仅供参考; 如发现事实错误,欢迎联系勘误。
    指挥舱👽