近日,具身全模态理解领域的权威榜单DailyOmni揭晓最新评测结果。智元机器人自研的具身原生全模态大模型WITA-Omni Preview以85.21分的综合成绩位居榜首。该成绩超越了来自千问、Gemini、豆包、英伟达等国内外领先的多模态模型,并在八项细分评测指标中的六项排名第一。DailyOmni是行业公认的一项权威第三方榜单,其评测重点在于检验模型的音视频时序对齐与跨模态联合推理能力。榜单评测大量采用了来自真实开放环境的音视频素材,核心考察模型融合视觉画面与环境音频信息的综合能力。具体包括精准识别声画对应关系、判断事件先后顺序以及进行跨模态语义推理,这高度贴合了人形机器人在真实物理空间中进行人机交互所需的核心感知能力。WITA-Omni之所以能取得领先成绩,关键在于其“具身原生”的设计理念。它并非将传统的大语言模型简单“植入”机器人,而是创新性地将物理动作与表情提升到与语音同等重要的地位,作为一级输出模态。模型采用一个统一的端到端架构,来驱动感知、决策与表达的全过程。具体而言,WITA-Omni在Thinker–Talker架构的基础上进行了扩展,形成了面向具身输出的Thinker–Talker–Actor新架构。在训练阶段,该模型使用了千万小时级别的多模态数据进行学习,将其原有的强大文本与视觉理解能力,进一步升级为能够“听得见、看得懂”并进行音画联合推理的全模态能力,从而为复杂的人形机器人交互任务奠定了基础。
