导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

Black Forest Labs 发布 FLUX 3:从静态图像到视频生成,AI 模型赋能机器人操控

据外媒报道,Black Forest Labs 于周四正式发布 FLUX 3,这是该公司旗舰模型首次从静态图像生成转向视频生成。这家以 FLUX 系列图像生成器闻名的德国AI实验室,在一个共享系统中同时利用图像、视频和音频数据训练新系统,实现了多模态能力——即一个模型同时学习多种类型信息,而非将独立工具简单拼接。

视频功能是本次升级的核心亮点。FLUX 3 可生成最长20秒的视频片段,并同步生成与画面匹配的音频,包括对话、音效和环境噪音。在早期评估中,人类评审员在77%的对比测试中更偏好 FLUX 3 的输出效果,优于 Runway Gen-4.5;在93%的测试中优于 Luma Ray 3.2;同时以52%的微弱优势胜过 Gemini Omni 和 Seedance。当然,这属于偏好测试而非固定评分标准:评审员仅需观看两段视频并选择更逼真的一段,BFL 统计 FLUX 3 的胜率。

Black Forest Labs 发布 FLUX 3:从静态图像到视频生成,AI 模型赋能机器人操控

此外,该模型在静态图像生成方面同样表现出色,延续了其前代优势。BFL 分享的样张显示,FLUX 3 具备高度多样性,能够生成超越照片级真实感的多种风格。

BFL 将这一进展视为超越内容创作工具的突破。联合创始人兼CEO Robin Rombach 表示:“只学习图像的模型只能生成图像。”公司押注,学习预测视频的过程也意味着学习其背后的物理规律——重量、接触、时序——这正是机器在物理世界中运动所需的核心能力。这一押注名为 FLUX-mimic。该技术由 BFL 与苏黎世的 mimic robotics 公司合作开发,以 FLUX 3 的视频预测引擎为基础,添加了一个轻量级“解码器”,将模型内部对物体运动的理解转化为真实的机器人动作。

汽车制造商奥迪已开始测试将其用于安装柔性车门密封条等任务,而传统自动化设备难以处理此类工作。mimic 联合创始人 Stephan-Daniel Gravert 表示:“奥迪正是我们构建 FLUX-mimic 时所期望的制造合作伙伴。”奥迪的 Christoph Schneider 称,机器人现在能够“解决复杂的软体操控任务”,这是老一代机器无法触及的。BFL 表示,完整系统反应时间约为101毫秒,接近人类视觉反射速度。

Black Forest Labs 发布 FLUX 3:从静态图像到视频生成,AI 模型赋能机器人操控

FLUX 的崛起并非偶然。Black Forest Labs 成立于2024年8月,由曾在 Stability AI 参与构建原始 Stable Diffusion 模型的研究人员创立。其推出的 Flux 模型在性能上超越了 MidJourney 和 Stability 自家的 Stable Diffusion 3。开源的 Flux Dev 和 Schnell 模型一度夺得“最佳开源图像生成器”称号,而 Stability AI 的后续产品 Stable Diffusion 3.5 未能夺回这一地位。2024年10月,FLUX 1.1 Pro 在 Artificial Analysis 图像领域排名中登顶(但非开源)。2025年11月发布的 FLUX.2 则反响平平。开源王冠一直由原始 Flux 持有,直到2025年底被阿里巴巴的 Z-Image Turbo 在低端消费级显卡上以同等质量超越。当时一位 CivitAI 用户评论道:“这就是 SD3 本该达到的水平。”

FLUX 3 是 BFL 的回归之作,但尚未完全开源。目前视频和 Action 功能通过 API 及选定合作伙伴(包括 mimic robotics)提供早期访问,图像生成功能将在“未来几周内”推出。BFL 计划仅发布用于本地使用的开源权重版本 Dev,预计要到2026年下半年。