国际具身全模态理解权威榜单DailyOmni近日更新了最新评测结果。智元自研的具身原生全模态大模型WITA-Omni Preview,以85.21分的综合成绩强势登顶,力压Gemini 3.1 Pro Preview、Qwen3.5-Omni-Plus、Doubao Seed 2.0 Lite以及英伟达等国内外主流模型,并在八项细分指标中斩获六项第一。
DailyOmni榜单究竟考什么?
要理解85.21分背后的分量,得先看清这份榜单的考核逻辑。
在业内,它被视作检验具身智能感知能力的“试金石”。原因很直接:人形机器人一旦走进商场、展馆或地铁站,面对的就是那种“多人、开放、持续变化”的真实物理空间。在这种环境下,机器人不仅要观察环境、接收声音,还要组织语言、配合动作与表情——更关键的是,它得判断该不该回应、何时回应,以及正在和谁交互。
常规AI大模型榜单多侧重图文问答,给张图回答相关问题,偏向线上内容消费。DailyOmni则大量采用开放环境的真实音视频素材,核心考察三点:能否将画面人物与其发出的声音精准对应;能否理清事件发生的先后顺序;能否结合视听信息完成跨模态推理。
论文数据显示,DailyOmni涵盖数百段真实日常场景短视频及上千道选择题,任务覆盖音视频对齐、上下文理解、事件序列、因果推理、跨模态一致性等六大维度。
从当前公开榜单看,闭源模型中Gemini 2.5 Flash得分为73.06%,开源模型里Qwen3.5-Omni-Plus为84.68%。WITA-Omni以85.21%的成绩不仅超越了上述主流模型,更在八项细分指标中拿下六项冠军。
三层架构,打破“流水线式拼接”
长期以来,人形机器人交互系统多采用模块化拼接方案:摄像头视觉、麦克风音频、对话大模型、运动控制依次串联,形成串行流水线。
流程通常是“先看画面→转音频文字→生成回答→最后输出动作表情”。步骤割裂导致明显延迟,常出现语音说完,抬手转头才姗姗来迟的情况。在多人场景下,甚至无法锁定交互对象,适配真实环境的能力存在先天短板。
智元WITA-Omni的核心差异在于跳出“通用大模型外挂机器人动作模块”的传统路径,推出行业首个面向具身场景的Thinker–Talker–Actor三层原生端到端架构。它将肢体动作、面部表情提升至与语音、文本同等层级的一级输出,所有模态共享统一认知表征与同一时间轴,实现感知、思考、表达同步并行。
换言之,它并非简单把聊天模型“装进”机器人,而是让物理动作和表情成为与语音并列的一级输出。三层架构分工明确:
• Thinker(思考):作为多模态推理核心,把文本、图像、音频、音视频映射到统一表示空间,进行跨模态联合推理和高层交互决策;
• Talker(说):以Thinker的隐状态为条件,流式生成自然语音;
• Actor(动):由动作头与表情头组成,将机器人动作与表情生成为与语音并列的一级输出。
在此架构下,机器人能实现“边观察、边思考、边说话、边做动作”,模拟人类实时同步的沟通状态,有效解决市面上多数人形机器人交互僵硬、机械感强的问题。
具身智能落地的“临门一脚”
在业内观察者看来,智元在DailyOmni榜单上的突破,揭示了具身智能行业的下一个竞争焦点:交互智能。
过去几年,行业竞争主要集中在运动能力(跑多快、跳多高)和作业能力(负载多大、精度多高)。但当机器人真正进入商业服务、公共服务等与人高频互动的场景时,能否进行自然、流畅且符合社交礼仪的交互,成为决定其能否被市场接受的关键。
对整个具身智能产业而言,WITA-Omni的价值不止于单一榜单成绩,更在于打通了机器人“看、听、说、动、表情”全模态协同链路。它将传统分模块流水线式交互,升级为统一认知、同步输出的连续生成过程,使机器人从单纯执行指令的机械工具,转向具备在场感、自主交互意识的硅基协作伙伴。这也是人形机器人落地商用场景、创造增量生产力的核心基础。
可以预见,随着交互能力不断进化,人形机器人将不再仅是执行指令的冰冷机器,而是能理解人类意图、提供情绪价值的智能伙伴。这或许是具身智能真正融入人类社会的“临门一脚”。
目前,通用大模型厂商均在加速补齐具身短板。千问、Gemini、豆包持续迭代视频音频时序推理能力,英伟达依托硬件生态布局机器人全栈方案。未来赛道竞争将是“通用大模型横向拓展”与“机器人原生模型纵向深耕”的双线对抗。榜单跑分只是阶段性标尺,真实场景规模化落地才是最终检验标准。
采写:南都·湾财社记者 胡雯雯









