在世界人工智能大会现场,判断一台机器人“聪不聪明”,远比判断它“动不动”困难。
展馆里,人形机器人随着音乐转身、挥臂;四足机器人跨过台阶和坡道;双臂机器人抓取商品、整理零件;零售场景中的机器人在货架与操作台之间往返。围观者举起手机,机器人每完成一个动作,现场便响起一阵掌声。
但站在展台前,一个问题往往没有被说清楚:机器人究竟是自己理解任务后完成动作,还是由工作人员远程操控?是模型根据环境实时决策,还是提前编排好的动作程序?操作出现偏差后,它能否自行恢复,还是需要人工重新接管?
仅凭一段流畅的视频,外界很难找到答案。
这也是当前机器人热潮中最容易被忽略的一道分界线:会动,不等于会自主;完成了一次任务,也不等于真正学会了这项工作。
一台机器人,三种“干活”方式
机器人电报在展会上看到的机器人动作,大致可以来自三种控制方式。
第一种是预编程。工程师提前设定动作轨迹、运行顺序和触发条件,机器人按照程序重复执行。跳舞、挥手、固定路线行走等展示,很多都可以通过这种方式完成。
第二种是遥操作。工作人员通过手柄、动作捕捉设备、VR头显或主从机械臂,将人的动作映射到机器人身上。机器人看似在自主泡茶、抓取和搬运,实际上背后可能有人实时判断和操作。
第三种才是具身智能追求的自主作业:机器人通过摄像头、力传感器等感知环境,理解自然语言任务,自主拆解步骤、规划动作,并根据现场变化持续调整。
三种方式没有简单的优劣之分。预编程稳定可靠,适合结构化产线;遥操作可以完成复杂任务,也是采集机器人训练数据的重要手段;模型自主则代表更强的泛化能力,但目前仍是最困难的一条路。
WAIC现场甚至出现了非常直观的“跨城遥操作”案例。睿尔曼智能展示的机器人由北京训练中心的操作员实时控制,在上海展台完成温杯、投茶、注水和出汤。企业希望借此积累真实作业数据,再用于模型迭代。这个案例说明,遥操作不仅是过渡方案,也可以成为远程作业和数据生产的基础设施。
因此,遥操作本身不是问题。真正的问题是,企业是否清楚告诉观众:哪些动作由人控制,哪些按照程序运行,哪些真正由模型自主完成。
为什么机器人还没有迎来ChatGPT时刻
ChatGPT带来的冲击,不在于计算机第一次能够生成文字,而在于普通人不需要学习编程,只要用自然语言提出要求,就能获得相对稳定、覆盖大量任务的能力。
机器人领域的“ChatGPT时刻”,也不应只是某台机器人完成一个高难度动作。它至少意味着:用户可以用自然语言交代一项此前没有专门编程的任务,机器人能够理解环境、拆解步骤、自主执行,并在出现意外时调整方案。
目前,大多数机器人离这一目标还有明显距离。
前特斯拉中国设计中心负责人、矩阵超智创始人张海星将具身智能划分为L1至L5阶段:L1是遥控和预编程动作,L2是泡茶、零售服务等特定场景技能,L3开始可以通过语言和人类示范学习新任务,最终才是自主发现和解决问题。他判断,行业目前仍处于从L1向L2、L3过渡的阶段。
这一判断与WAIC现场的观感相近。机器人已经可以在固定展台抓取饮料、零件或生活用品,但改变货架布局、更换物体、增加干扰后,原有能力是否仍然有效,通常还需要进一步验证。
穹彻智能执行总裁秦成也认为,判断具身智能是否真正成立,关键不是Demo有多炫,而是机器人能否摆脱遥操作,在物理环境中完成感知、规划和运行的完整闭环。
机器人比大模型多了一堵“物理墙”
语言模型可以从互联网上获得海量文本、图片和代码,机器人却没有同等规模的现成数据。
机器人学习抓取一个杯子,需要记录相机画面、关节位置、末端轨迹、抓取力度和任务结果。杯子的大小、材质和位置发生变化,原有动作就可能失效。不同机器人拥有不同的自由度、传感器和控制接口,同一份数据也很难直接通用。
上海交通大学副教授李永露曾透露,其团队从约12万小时第一视角人类行为数据中筛选后,真正可用于视觉—语言—动作模型预训练的不超过5000小时。蚂蚁灵波科技首席数据科学家黄用韬则指出,遥操作数据还存在学习对象、任务分布和不同机器人本体难以对齐的问题。
在WAIC具身智能论坛上,智元机器人姚卯青将行业瓶颈概括为数据、表征和闭环三道“墙”:真实交互数据稀缺,跨任务、跨场景和跨本体的统一表征尚未成熟,真实世界试错又成本高、反馈慢。
这正是机器人与ChatGPT发展路径最大的差异。
大模型回答错误,可以重新生成;机器人抓取失败,可能摔坏物品。大模型可以在服务器上同时训练大量任务;机器人数据往往需要真实设备逐次执行。语言中的一个错误词语影响有限,物理世界中的一个错误动作却可能打断生产流程。
自主能力正在出现,但仍有条件
机器人走向自主,并非毫无进展。
Google DeepMind推出的Gemini Robotics 1.5,已经尝试让机器人在执行动作前进行任务规划,并把一个较长任务拆解成多个短步骤。其官方资料还显示,模型可以在不同机器人形态之间迁移部分能力,例如在双臂平台上学习的动作,也可能被迁移到人形机器人上。
Figure AI今年展示了Helix 02控制人形机器人完成洗碗机装卸任务。按照公司披露,机器人连续执行约4分钟,完成行走、拿取、摆放、开关柜门等61个动作,全程没有遥操作和人工干预。值得注意的是,这是企业在特定环境中的技术演示,距离开放环境下稳定复现仍需更多验证,但它已经显示出长序列自主任务的发展方向。
WAIC现场也有企业明确强调“零遥操”。擎朗智能称,其零售、咖啡、甜品和洗衣房等场景中的人形机器人由自研模型自主运行。对于这类展示,后续更值得观察的并非单次成功,而是任务成功率、连续运行时间、环境改变后的表现以及人工接管频率。
“ChatGPT时刻”不会同时降临所有机器人
对于具身智能何时迎来“ChatGPT时刻”,产业界并没有统一答案。
宇树科技创始人王兴兴今年给出的判断是两到三年;WAIC相关论坛上,与会者给出的预测大致在两年至五年之间。
但这里需要区分两种“时刻”。
一种是产业意义上的突破:机器人在工厂、仓库、零售等结构化场景中,可以通过自然语言接收任务,面对一定范围的变化自主作业,并把人工干预降到较低水平。这个阶段在未来两三年内可能率先出现。
另一种是公众想象中的通用机器人:一台机器进入陌生家庭后,能够像人一样理解环境,做饭、洗衣、整理房间、照顾老人,并自主学习新任务。由于家庭环境开放、任务繁杂,对灵巧操作和安全性的要求更高,这个目标可能需要更长时间。
因此,机器人的“ChatGPT时刻”或许不会像软件产品一样,在某一天突然到来。它更可能先在一座仓库、一个工位或一家门店中出现,再逐步扩展到更多任务。
展会需要一张“自主能力说明书”
机器人电报认为,未来观察机器人,不能只问它完成了什么动作,还应该追问动作是如何完成的。
展会现场可以更清晰地标注:演示属于遥操作、预编程还是模型自主;机器人完成任务的成功率是多少;平均多久需要人工接管;环境和物品位置是否随机变化;动作失败后能否自行恢复。
这些指标可能不如跳舞和翻跟头吸引眼球,却更能反映机器人是否真正接近“ChatGPT时刻”。
当前的机器人已经拥有越来越灵活的身体,也正在形成初步的视觉、语言和行动能力。但从“听从人的控制”走向“理解人的意图”,从“重复一次动作”走向“自主完成一类任务”,中间还有数据、模型、可靠性和成本等多道关口。
WAIC现场的热闹并非虚假,它展示了机器人产业正在快速前进。但真正值得等待的,不是下一段更流畅的表演视频,而是有一天,人们不再需要提前为机器人编排动作,也不再需要躲在屏幕后操控它。
到那时,机器人面对一句“把这里整理一下”,能够先看懂环境,再决定从哪里开始。
那或许才是机器人的ChatGPT时刻。
