当机器人置身于热闹的展厅,周围人声鼎沸,它能否精准识别出谁在呼唤自己,判断一句话是否需要回应?能否在对方停顿的间隙自然接话,被突然打断后也能流畅衔接?还能否在回答问题的同时,配合恰当的语气做出手势和表情?这些看似普通的交流细节,实则是具身智能的核心能力,也是机器人实现自然交互面临的最大挑战。
长期以来,机器人行业陷入了一个尴尬的困境:单项能力不断取得突破,但将“看、听、说、动”这些能力融合成一个连贯且像人类一样的整体,却始终差强人意。这道鸿沟的本质在于,机器人的交互能力跟不上发展步伐,感知、推理、语音、动作等模块各自为政,无法在同一个时间轴上协同工作。
近日,智元自主研发的全模态大模型WITA - Omni Preview交出了一份令人瞩目的答卷。在行业公认的具身全模态理解权威榜单DailyOmni上,它以85.21分的综合成绩登顶榜首,超越了千问、Gemini、豆包、英伟达等国内外领先模型,在八项细分指标中有六项位居第一。
此前,智元自研的世界模型Genie Envisioner - Sim 2.0已在WorldArena“世界模型感知与动作响应”赛道斩获总分第一。此次WITA - Omni又在全模态理解榜单夺冠,这两项成绩分别对应着机器人理解物理世界、模拟物理世界以及与物理世界交互的关键能力。这也让外界看到,智元在打造机器人本体的同时,正同步构建“交互 - 作业 - 运动”三位一体的自研AI版图。
DailyOmni的评测逻辑聚焦于检验真正的全模态能力。“能看图 + 能听声”的简单叠加并非全模态的难点,真正的挑战在于,当声音和画面同时涌来时,模型能否分清谁在说话、事件发生的先后顺序以及该关注哪个细节,其核心是边听边看边想的同步协同能力。该榜单大量采用真实开放环境音视频,考察声画对应关系、事件时序判断、跨模态联合推理等,检验模型在连续时间流里理解真实物理世界正在发生的事情的能力。WITA - Omni在综合评分以及音视频对齐、事件时序、综合推理等细分指标上均表现出色,在比较理解及30秒/60秒视频理解等长时序任务上也取得领先,在“声画对齐、时序判断、跨模态推理”方面建立了系统性优势。
在同台竞技的对手中,有千问、Gemini、豆包、英伟达等通用大模型厂商的商用或旗舰模型,智元作为具身智能赛道选手,在全模态理解上跑赢大模型大厂,这不仅体现了分数的胜负,更指向技术路线的选择:从机器人原生交互场景出发构建全模态能力,正展现出强大的竞争力。WITA - Omni用排名第一证明,在让机器人“自然流畅地理解并回应世界”方面,智元已走在前列,也让行业重新认识智元,其AI大模型能力已跻身与大厂同台竞技的第一梯队。
传统机器人交互采用流水线模式,先识别语音、理解语义、生成回复、合成语音,最后输出动作。这种级联架构存在诸多缺陷,多模块串行调用导致响应延迟累积,信息跨模块转换产生语义损失,语音、动作和表情独立生成,无法保持节奏与情绪同步,最终机器人虽各模块能工作,却不像一个协调的智能体。
WITA - Omni的原生架构打破了这种串行范式。它在Thinker–Talker范式基础上扩展出Actor模块,将机器人动作和表情提升为与语音并列的一级输出。Thinker是多模态推理核心,对文本、图像、音频、音视频进行跨模态联合推理和高层交互决策;Talker以Thinker的隐状态为条件,流式生成自然语音;Actor由动作头与表情头组成,驱动动作与表情。三个模块在统一时间轴上同步推进,跨流同步机制使动作能感知语速、停顿、重音和情绪变化,让机器人的手势和表情从语音生成过程中实时响应,实现边说边动、边动边表达,理解与回应同步完成。这种原生架构把“理解”和“表达”从两个步骤变为同一生成过程的不同维度,体现了具身智能公司独特的差异化竞争力。
基座模型的竞争不再局限于参数量大小,具身智能的数据难题更为棘手。公开音视频数据缺乏交互轮次、响应时机、动作和表情时序标注,用这些数据训练的模型无法学会“何时说话、何时动作”。WITA - Omni的领先得益于一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。
在中训练阶段,WITA - Omni使用千万小时级多模态数据,将强文本、视觉底座升级为全模态模型。数据配比精心设计,音视频联合数据约占四成,纯音频数据约占三成,视觉与文本数据分别约占两成和一成,聚焦声音与视觉主体对应、事件时间关系、跨模态推理等问题。公开数据不足,智元便自建大规模高质量全模态数据集,数据来自带同步语音、动作和面部表情的人 - 人及人 - 机交互视频、机器人遥操作交互传感器采集的第一人称感知与动作数据以及通过半自动数据流水线转化的监督样本,让模型直接从真实交互中学习。在千小时级高质量数据上,WITA - Omni采用SFT–OPD–RL三阶段后训练策略,提升模型的全模态理解、交互决策和多流生成能力,学会在真实场景中判断回应时机、对象等。
理解准确只是基础,交互智能的更高标准在于细节。WITA - Omni在语音交互侧表现出色,在国际权威第三方大模型评测Artificial Analysis的Speech Arena所采用的衡量语音推理的Big Bench Audio和衡量全双工对话能力的Full Duplex Bench子集(覆盖停顿处理、轮次切换、打断处理、附和处理)两个公开基准上均取得第一,超越了GPT - Realtime等闭源商用模型。全双工对话是语音交互的高难度环节,WITA - Omni在这项能力上的领先,意味着它能在真实对话节奏中自然反应,该说时说、该停时停、被打断能自然衔接、听到附和不乱节奏。这种节奏感是机器人进入家庭、工厂、服务场景时用户直接感受到的体验,WITA - Omni在语音交互侧的领先,补齐了具身智能在“自然表达”方面的关键一环。
智元围绕作业智能、交互智能、运动智能“三智一体”打造差异化竞争力。在“一体三智”架构中,运动智能是基础,作业智能提供劳动生产力,交互智能提供服务生产力。此前,智元已在WorldArena具身智能综合评测中总分第一,作业智能的GO系列基础模型、运动智能的运控基座模型均具行业领先优势。交互智能的登顶,让智元“三智一体”的完整能力版图得以展现。2026年,具身智能行业迎来开发态向部署态的关键跨越,机器人将走进产线、门店和家庭创造真实生产力,部署态的核心门槛是三个智能的协同,智元在行业率先推出的七大生产力解决方案,正是以“三智一体”的完整能力栈为底层支撑。















