智元机器人发布GE-Act 2.0:首次系统验证原生世界-动作模型Scaling路径

机器人电报9月19日讯,智元机器人(AGIBOT)今日发布了GE-Act 2.0原生世界-动作模型(WAM)。该模型首次为原生世界-动作模型提供了系统性的可扩展预训练路径验证,并聚焦一个核心命题:随着训练数据增长,机器人模型能否像大语言模型一样持续提升并解锁新能力?GE-Act 2.0的所有模型参数(包括视觉表征、未来预测和动作预测)均从随机初始化开始,在具身操控数据上从头训练。预训练完成后,同一模型在零样本条件下进行评估,无需针对特定任务微调、额外演示或模型替换。评估覆盖了此前未见过的场景、背景、光照条件和物体实例,涵盖100个原子任务、20个技能类别和两种机器人本体。

结果显示,当训练数据从300小时扩展到30,000小时(增长100倍)时,现有技能的性能持续提升,新能力逐步涌现。在更小数据规模下无法完成的任务——包括叠毛巾、纸杯嵌套、笔帽开合和插花——在更大数据规模下变得可行。具体而言,在G1-OP测试集上,任务成功率从17.1%提升至44.1%;G2-90D的成功率从13.4%提升至31.1%,且性能在5,000到30,000小时区间未见饱和迹象。

技术架构上,GE-Act 2.0引入了控制导向自编码器(CoAE),将每帧256×384图像压缩为仅24个视觉token,仅为DINOv3 token数量的十六分之一。模型采用单步视觉规划策略,在NVIDIA GeForce RTX 5090上可在104毫秒内生成一段连续机器人动作,实现低延迟推理。此外,模型还展示了跨本体能力迁移:G1-OP占训练数据50%以上,而G2-90D不足2%,但G2-90D的成功率仍随共享数据集增长提升了17.7个百分点。

在补充评估中,微调后的GE-Act 2.0在RoboTwin未见环境测试中达到60.52%的成功率,在GenieSim指令跟随基准上得分0.770,均优于π0.5和GR00T N1.7等对比模型。