
世界模型正在从数据中心走到机器人身边。NVIDIA 7月20日开放4B参数的Cosmos 3 Edge,把场景理解、未来状态预测和动作生成放进同一套边缘模型。官方称,针对DROID机械臂后训练的版本能以640×360观察画面为输入,每次推理生成32步动作,并按15Hz控制频率执行。关键变化不是模型又会生成一段视频,而是视觉预测开始直接连接机器动作。
理解与行动共用表示。模型既能回答画面中发生了什么,也能预测动作会带来什么视觉后果,再给出控制序列。
规模降到4B参数。相较16B的Nano和64B的Super,Edge瞄准Jetson、工作站GPU与现场设备,降低部署门槛。
权重与代码已经开放。模型、DROID策略版本和后训练脚本可下载,许可覆盖商业与非商业使用,但仍须遵守具体条款。
Cosmos 3采用Mixture-of-Transformers架构:自回归塔处理视觉与文本,用于理解、推理和规划;扩散塔处理图像、视频与动作,用逐步去噪生成未来画面和控制结果。两座塔保留各自的归一化与前馈层,同时共享多模态注意力,让语言、像素、时间和动作落到一套关联表示中。
这使模型具备三种相互连接的能力。正向动力学接收当前画面与动作,预测接下来会看到什么;逆向动力学从状态变化反推动作;策略模式则根据指令和观察同时输出动作块与预期视觉结果。对机器人开发者而言,视频不再只是演示素材,而可以成为检查“执行后世界是否符合预期”的中间层。
官方页面给出的“每次32步动作”和“15Hz控制”容易被误读。更准确的理解是,模型一次规划一段动作序列,控制器随后按约每秒15个节拍执行,而不是模型每秒完成15次全流程推理。动作分块能把较慢的高层判断与较快的底层控制解耦,减少机械臂在每个小动作前等待大模型的时间,但也会放大长动作块在环境突变时的误差风险。
性能结论同样需要边界。NVIDIA称Edge在同级4B模型中位列VANTAGE-Bench视觉分析第一,并在机器人策略学习上达到领先水平;这些数据来自厂商公布的测试体系。模型卡同时披露,生成与策略基准使用单GPU、批量为1,不同Jetson和数据中心GPU还采用不同分辨率与配置,不能把某个平台的数字直接外推到所有机器人。
Cosmos 3 Edge支持文本、图像、视频和动作输入,可输出文本、图像、视频与动作,Reasoner最长支持256K上下文;但Edge当前只支持256p和480p生成,不支持视频到视频转换。官方测试仅覆盖Linux与BF16,硬件限定在NVIDIA Ampere、Hopper和Blackwell生态,其他精度尚未正式支持。生成路径还依赖受控访问的安全护栏组件,部分后训练配方仍标注为即将提供。
工程接入并非只有研究脚本。官方给出了PyTorch、vLLM和vLLM-Omni路径,可把理解或生成能力封装为兼容常见API形式的服务;同时发布DROID策略检查点与适配脚本。需要注意的是,模型目前没有托管推理提供商,首次部署还要自行准备权重、GPU环境、安全护栏和本体数据,开放并不等于开箱即用。
对机器人公司,这个发布最现实的价值是缩短“数据中心模型验证—现场设备部署”之间的距离:团队可以先用开放检查点做视觉推理,再针对自有机械臂、相机和动作空间后训练策略。对边缘硬件厂商,它也把模型、运行时与设备绑定成更完整的开发栈。代价是迁移到非NVIDIA硬件、不同本体或安全敏感场景时,仍要承担适配、时延测试与失效保护成本。
ATYUN编辑判断:Cosmos 3 Edge真正重要的不是把世界模型缩到4B,而是把“理解—预测—行动”压进一条可下载、可后训练的边缘链路。它让物理AI从生成逼真的未来画面,向控制真实设备迈进一步;但开放检查点不是通用机器人能力的完成证明。接下来更值得观察的是第三方能否在不同本体、遮挡、扰动和长时间任务中复现稳定收益,以及动作分块在突发变化下能否及时纠错。
