小米开源Xiaomi-Robotics-U0:具身领域首个“通吃”四类任务的统一生成模型

小米今日发布Xiaomi-Robotics-U0——一个拥有380亿参数的多模态自回归具身生成基础模型,是具身领域首个”通吃”四类任务的统一生成模型,打通了机器人图片和视频数据的生成与编辑链路。

该模型覆盖四大核心能力:具身场景生成,可根据文本描述为指定机器人本体生成多视角初始场景;具身迁移,可将已有机器人轨迹迁移到新环境中,改变光照、背景、桌面材质等,同时保留原始轨迹中的机械臂位姿和场景布局;机器人交互视频生成,基于初始观测和操作指令生成后续视频,兼顾动作连贯性和物理一致性;以及通用文生图和图像编辑能力,使互联网视觉知识能够迁移到具身智能任务中。

官方表示,Xiaomi-Robotics-U0既能在保持几何一致性的前提下对已有数据做增强——换物体、换光照、换背景、加干扰,无需重新采集,也能从零生成全新场景,覆盖危险、极端、长尾等真机难以触达的环境。通过FlashAR+推理加速方案,其生成效率较原始自回归范式提升近83倍。

在WorldArena评测基准上,Xiaomi-Robotics-U0取得总分第一名(全球126个模型参评)。真机评测中,在未知光照、陌生背景等Out of Distribution场景下,使用该模型扩增数据训练的策略任务完成进度平均提升超26%。相关代码与模型权重已全量开源。