Black Forest Labs 发布 FLUX 3:首款视频生成模型,同步输出音频与画面
周四,Black Forest Labs 发布了 FLUX 3。这是该公司旗舰模型首次支持视频生成,而不再仅仅局限于静态图像。这家以 FLUX 系列图像生成器闻名的德国 AI 实验室,将图像、视频和音频数据同时纳入一个共享系统进行训练。
这被称为多模态:一个模型同时学习多种信息类型,而非将多个独立工具简单拼凑在一起。
视频生成能力成为亮点
视频功能是本次升级的核心亮点。FLUX 3 可生成最长 20 秒的视频片段,并在生成画面的同时同步输出音频——包括对话、音效和环境噪声。在早期评估中,人类评审员在 77% 的对比测试中更偏好 FLUX 3 的输出,胜过 Runway Gen-4.5;在与 Luma Ray 3.2 的对比中,这一比例更是达到 93%。此外,FLUX 3 的表现略优于 Gemini Omni 和 Seedance,在 52% 的评估中胜出。
当然,这并非固定评分标准,而是偏好测试:评审员只需观看两段视频,选出看起来和听起来更逼真的一段,BFL 则统计 FLUX 3 的获胜次数。
静态图像能力依然出色
除此之外,该模型在静态图像方面也延续了其优良传统。BFL 展示了一些样图,FLUX 3 似乎非常全能,能够生成超越写实风格的各种不同类型图像。
BFL 将这款模型定位为超越内容生成工具的存在。“一个只学习图像的模型,只能生成图像,”联合创始人兼 CEO Robin Rombach 表示。该公司的核心理念是:学习预测视频,也意味着学习其背后的物理规律——重量、接触、时间——这正是机器在物理世界中移动所需的要素。
“FLUX-mimic”:将视频预测转化为机器人动作
这一理念的落地产品名为 FLUX-mimic。它与苏黎世的 mimic robotics 公司合作,将 FLUX 3 的视频预测引擎与一个轻量级“解码器”相结合——这是一个小型附加组件,能够将模型内部对物体运动的理解转化为实际的机器人动作。汽车制造商奥迪已经在测试其执行诸如安装柔性车门密封条等任务,这些工作传统自动化设备难以胜任。
“奥迪正是我们为 FLUX-mimic 所打造的那类制造合作伙伴,”mimic 联合创始人 Stephan-Daniel Gravert 表示。奥迪的 Christoph Schneider 则称,这些机器人现在能够“解决复杂的软体操控任务”,这是旧机器无法做到的。BFL 表示,整套系统的响应时间约为 101 毫秒,接近人类的视觉反射速度。
FLUX 的崛起并非偶然
FLUX 的崛起并非凭空而来。Black Forest Labs 成立于 2024 年 8 月,创始团队是曾在 Stability AI 参与构建原始 Stable Diffusion 模型的资深研究员。公司推出的 Flux 模型在性能上超越了 MidJourney,并碾压了 Stability AI 自身表现平平的 Stable Diffusion 3。
开源的 Flux Dev 和 Schnell 模型一举夺得“最佳开源图像生成器”称号,而 AI 艺术家们原本期待 Stability AI 的后续作品 Stable Diffusion 3.5 能重新夺回这一位置。但事实并未如愿。FLUX 1.1 Pro 随后在 2024 年 10 月登顶 Artificial Analysis 图像竞技场。不过,该版本并非开源。
BFL 于 2025 年 11 月发布了 FLUX.2,但反响不如前作。原版 Flux 所持有的开源王冠一直持续到 2025 年底,被阿里巴巴的 Z-Image Turbo 取代——后者在低端消费级显卡上实现了同等质量。当时一位 CivitAI 用户评价道:“这才是 SD3 本该有的样子。”
FLUX 3:BFL 的回归之作,尚未完全开源
FLUX 3 是 BFL 的回归之作,但尚未完全开源。目前,视频和动作功能通过 API 和部分合作伙伴(包括 mimic robotics)提供早期访问,图像生成功能将在“未来几周内”推出。BFL 计划仅发布用于本地部署的开源权重版本(Dev 版),但该版本要到 2026 年下半年才会推出。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种