85.21%登顶音视频推理,智元把“听看说动”放进同一模型

2026年07月29日 由 ATYUN编辑部 发表 746 0
工程师在实验室中与具备音视频感知和动作能力的通用机器人交互
人机音视频交互实验室的原创示意场景

机器人听见一句话、看见说话者,再决定何时回应、面向谁以及做什么动作,过去常由多个模块接力完成。智元机器人7月28日发布WITA-Omni Preview,试图把这条链路压进共享模型状态与时间线。它在第三方Daily-Omni音视频推理榜单取得85.21%平均准确率,领先同榜闭源模型,但这项成绩衡量的是多项选择题理解能力,还不能直接等同于机器人真实任务成功率。

三点看懂:榜首成绩背后究竟测了什么

85.21%来自音视频联合理解。Daily-Omni包含684段日常场景视频和1197道多项选择题,覆盖声画对齐、事件顺序、上下文理解、比较、推断与推理六类任务,随机猜测基线为25%。

“听看说动”被放进同一框架。Thinker负责跨模态理解与决策,Talker生成语音,Actor同步生成动作和表情,三者共享状态与时间线,而不是只把对话模型外挂到机器人上。

模型仍处在闭源预览阶段。官方没有公布参数量、权重、API、授权方式、推理硬件和端到端延迟,榜单也没有覆盖真实机器人执行、碰撞安全与长时间稳定性。

从模块接力到共享时间线,机器人先学会“该不该回应”

传统人机交互栈通常把视觉、语音识别、对话生成和运动控制拆开:摄像头先识别人,麦克风再转写语音,语言模型生成回答,最后由动作模块匹配手势。每次交接都会丢失一部分时间关系,例如谁先开口、说话时指向了什么、机器人是否应等待另一人把话说完。真实多人环境中,这类时序判断往往比“回答内容正确”更难。

WITA-Omni的Thinker把文本、图像、音频和音视频输入映射到共享表示,并完成高层交互决策;Talker根据内部状态实时生成语音;Actor通过专用动作与表情头输出身体响应。关键不只是同时生成三种结果,而是模型在准备回应时仍持续接收环境输入,因此理论上可以根据新声音、人物移动或轮次变化调整等待、说话对象和动作节奏。

训练同样围绕交互时序展开。智元披露,持续训练使用了数千万小时规模的多模态数据,并另建数千小时以人为中心的交互数据,保留音频、视频、语言、身体动作与面部表情之间的时间关系。随后通过监督微调、在线策略蒸馏和强化学习三阶段训练,使用GRPO优化回答是否准确、何时回应、目标人物选择以及是否应继续等待。

八项指标六项第一或并列第一,但榜单边界必须看清

第三方榜单给出的八项分数分别为:声画对齐86.13、比较89.31、上下文理解81.87、事件顺序84.64、推断85.06、推理85.71、30秒视频83.62、60秒视频87.09。WITA-Omni在声画对齐、比较、事件顺序、30秒和60秒子集排名第一,并在推断项并列第一;平均分比第二名Qwen3.5-Omni-Plus的84.68高0.53个百分点。

0.53个百分点说明竞争已经很接近,也提醒读者不要把一次榜首写成全面领先。Qwen3.5-Omni-Plus因请求尺寸和内容过滤,只返回1175道有效答案,榜单按各子集有效响应计算分母;不同闭源模型的采样参数、服务版本与拒答机制也可能影响结果。Daily-Omni主要是日常视频上的多项选择题,它能检验声音与画面是否真正结合,却不测动作是否平滑、抓取是否成功,更不测机器人在开放环境中的安全决策。

具身交互的价值不在会聊天,而在连续协调感知与动作

对服务机器人、导览机器人和协作机器人而言,能否识别“谁在对我说话”、理解声音对应的现场事件,并在合适时机转身、回答或保持沉默,直接决定交互是否自然。统一模型若能减少模块间延迟与规则拼接,开发团队可能用更少的场景脚本覆盖多人对话、指令中断和非语言反馈,这也是音视频时序推理比单纯语音问答更接近真实部署的原因。

不过,智元当前只表示会让WITA系列继续与机器人平台融合,没有公布公众可用时间、商业接口、端侧部署条件或真实机器人评测。数千万小时训练数据的组成、去重、授权与质量控制也未展开。开发者现阶段能验证的是第三方榜单结果和架构思路,不能据此推断它已在复杂现场稳定运行。

ATYUN编辑判断:WITA-Omni最值得关注的不是把平均分再抬高0.53个百分点,而是把“理解环境”和“表达动作”放到同一时间轴上。具身智能若要走出单人单指令演示,模型必须学会在持续变化的现场判断对象、时机和响应方式。智元给出了清晰的技术方向,也交出了一份可核验的理解榜单;下一道门槛,是用公开接口、可复现评测和真实机器人长期任务证明,这套统一状态确实比模块接力更快、更稳、更安全。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消