
视频生成模型开始伸手操作真实物体。Black Forest Labs 7月23日开放FLUX 3早期访问:同一套多模态骨干同时学习图像、视频、音频和动作预测,既能生成最长20秒的原生音画视频,也被合作方mimic改造成工业机器人模型。在一项柔性部件装盘测试中,FLUX-mimic报告95%完成率,整机反应时间为101毫秒。它展示的不是又一个视频特效工具,而是一条从“预测下一帧”走向“预测下一步动作”的技术路线。
第一,四类能力共用骨干。FLUX 3从一开始就联合训练图像、视频和音频,并把机器人状态与动作作为另一种现实表征接入。
第二,视频与动作共享“物理常识”。模型为了生成可信运动,必须学习接触、重量、因果与时间变化,这些表示又能服务机器人控制。
第三,现在仍是早期访问。视频能力已开放申请,图像版将在随后数周进入早期访问,开放权重的FLUX 3 Dev和动作能力仍按阶段推出。
传统视觉语言动作模型往往先从静态图像和文字获得语义,再依赖昂贵的机器人轨迹数据学习物理行为。FLUX 3选择相反入口:先用大规模视频学习物体如何移动、碰撞和变形,再让一个轻量动作解码器读取视频骨干内部的未来状态表示,直接输出机器人动作块。推理时不必真的渲染完整视频,只需完成一次骨干前向计算。
这套架构建立在Self-Flow方法上,目标是让生成质量与可供下游任务读取的表示同时改善。BFL称,FLUX 3训练使用数千万小时通用视频,以及数十万小时人类和机器人操作视频。其训练计算中超过95%用于视频预测;720p视频里的音频令牌占比不足0.5%,动作同样是低维状态,因此团队认为最昂贵的“理解现实如何变化”可以被多种任务复用。
加入动作模态并非毫无代价。BFL披露,在一次大规模训练中,文本转视频和图像转视频的人类评分最初下降最多10%,经过3500个训练步骤后恢复到原有水平,同时保留动作预测能力。这是厂商内部结果,但至少说明多模态统一不是简单拼接接口,而需要重新对齐模型内部表示。
mimic在真实机器人上测试柔性部件装盘任务,预览版FLUX-mimic无需单任务微调或后训练取得95%完成率;对照中,按同类数据适配的pi0.5为55%,针对该任务大量后训练的Flow Matching基线为70%。完成率按多步骤任务整体正确完成次数计算。合作团队还称已围绕100多个真实工厂用例采集高质量数据,覆盖零件分拣、电子控制单元插入、装配以及密封件和线缆操作。
部署侧,模型在单张RTX 5090上本地运行,骨干从输入到世界表示低于80毫秒;加上动作解码、传感器通信和执行调度后,整套机器人系统反应时间为101毫秒。mimic称其正在与Audi测试和部署真实生产任务,并展示汽车门装配案例。不过这些数字来自开发者与合作方,没有独立复测;95%也只代表特定软体装盘测试,不能等同于任意工位的通用成功率。
对内容创作者,FLUX 3 Video支持文本转视频、图像转视频、视频延展、关键帧过渡、多语言对话和原生音频,单次最长20秒。BFL公布的早期偏好评测显示,它相对多款竞品的胜率从52%到93%不等,但测试框架仍在开发,样本、提示词和评审细节未完整公开。数分钟内容依赖多个短片链式组合,也不能理解成模型一次生成长片。
对机器人企业,这条路线的价值在于减少每个新工位所需的专用演示数据。mimic此前报告视频动作模型的样本效率最高可达传统视觉语言动作模型的10倍,FLUX-mimic则把更强的视频骨干带进工厂。但目前动作能力只面向选定研究和商业伙伴,FLUX 3的参数规模、训练成本、API价格、开放权重时间和许可条款都未给出,外部团队还无法完整复现。
ATYUN编辑判断:FLUX 3最值得关注的不是某一项视频胜率,而是它把内容生成与机器人控制放到了同一条技术主线上:模型先学会预测世界,再把这种预测解码为画面、声音或动作。如果开放权重和技术细节兑现,开发者可能获得一套可同时服务创作与物理AI的底座;在此之前,95%、101毫秒和Audi案例应被视为有现实场景支撑的早期证据,而不是通用机器人已经解决的结论。
