在国际具身智能领域,一场技术突破引发广泛关注。智元自主研发的具身原生全模态大模型WITA-Omni Preview,近日以85.21分的综合成绩登顶DailyOmni榜单,超越千问、Gemini、豆包及英伟达等国内外主流模型,在八项细分能力测试中六项夺冠。这一成果标志着我国在机器人真实物理世界交互能力上实现关键突破,为具身智能技术发展注入新动能。
DailyOmni作为全球权威的具身全模态理解评测平台,其评测标准与传统图文或短视频评测截然不同。该榜单采用大量开放环境下的真实音视频素材,重点考察模型对视觉画面与环境声音的融合理解能力,包括声画对应关系识别、事件时序推理及跨模态语义整合等核心指标。这些能力直接决定着人形机器人在复杂场景中实现自然交互的可行性,是衡量具身智能发展水平的重要标尺。
传统机器人交互系统存在显著技术瓶颈。多数设备采用感知、理解、控制分模块设计,信息传递存在时延且各模块间协同困难,导致语言、动作、表情呈现割裂状态。这种架构严重制约了机器人交互的自然性,成为制约行业发展的关键障碍。智元研发团队通过架构创新突破这一困境,将物理动作与表情提升至与语音同等重要的输出层级,构建出Thinker-Talker-Actor原生端到端模型,实现感知、决策、表达的统一驱动。
WITA-Omni的技术突破体现在交互过程的革命性重构。该模型将"理解"与"回应"整合为实时联动过程,使视觉、听觉、语言、动作、表情五种模态首次在统一时间轴上协同运作。这种设计让机器人能够同步完成环境感知、意图判断和表达输出,彻底改变了传统交互中"先看后听再反应"的割裂模式,为自然人机交互奠定技术基础。
支撑这一突破的是千万小时级的多模态训练体系。研发团队构建了全球首个面向真实交互场景的高质量全模态数据集,完整保留声音、画面、语言、动作、表情间的时序关系。通过针对性训练策略,模型不仅掌握正确应答能力,更学会在复杂场景中判断回应时机、对象及方式。这种训练方式使机器人具备类似人类的场景适应能力,为商业化落地创造可能。
作为具身智能领域首个机器人原生端到端模型,WITA-Omni的价值超越多模态支持范畴。其核心创新在于构建统一的认知状态和时间轴,实现五种模态的深度融合。相比传统模块化架构,该模型将交互过程从"多模块接力"升级为"完整过程生成",显著提升机器人的在场感、连续性和人格化表达能力。这种技术突破为工业制造、商业服务、公共服务、文旅展演等领域的智能化转型提供全新解决方案。
目前,智元正基于WITA-Omni构建交互智能底座,推动"三智一体"技术架构持续进化。通过与作业智能、运动智能的协同联动,加速"本体-数据-模型-场景"四维一体技术体系的迭代升级。这项突破不仅缩短了具身智能与人类沟通的距离,更为全球机器人产业发展开辟出新的技术路径,预示着具身智能新生产力时代的加速到来。















