智象发布具身世界模型:专门训练机器人应对各种意外

机器人电报9月7日讯,智象未来(HiDream.ai)正式推出具身世界模型HiDream-O1-Embodied。该模型基于原生全模态技术路线,旨在提升机器人在真实环境中的物理感知、动态预判和任务执行能力,并将图像、视频、3D及动作等多种模态整合至统一技术体系中。

HiDream-O1-Embodied首次参与具身智能评测平台RoboColiseum测试,在扰动适应子榜单中以0.692的平均分位居榜首。评测通过模拟背景、光照、材质、机器人初始状态、相机位置、图像质量及指令表达等变量,评估模型面对环境变化时的稳定性和泛化能力。RoboColiseum平台基于高保真仿真环境搭建,设有指令跟随、空间理解、扰动适应和通用操作四类能力榜单,共包含78个评测任务,面向高校、科研机构、模型企业及研究者开放。

为应对真实环境中的视觉干扰和指令变化,HiDream-O1-Embodied从语言理解、多视角视觉感知和容错机制三方面进行强化。语言理解上,模型覆盖不同动词、句式及表达方式的等价指令,降低对固定关键词的依赖;视觉感知上,它综合多个视角的信息,在部分输入受遮挡或偏差时仍能持续判断场景和任务。

训练环节中,HiDream-O1-Embodied主动引入光照变化、画面污损、视野遮挡等非理想条件,使模型在信息不完整或不稳定的情况下仍能完成判断和执行,这也是Robustness评测的重点考察项。数据方面,智象未来采用“真实基座+生成增强”策略扩充训练数据,例如与诺亦腾合作,以高精度真人动作捕捉数据为基础,利用模型进行百倍级数据扩增,在保持动作物理约束的前提下,可灵活调整背景、光照和物体。