过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?
针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、”AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到8K时间步,相当于5分钟的”肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。
论文链接:https://arxiv.org/abs/2607.15275
这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时”自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。
研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:”很快,即使是 100 万上下文,也不再是幻想。”
RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。
RoboTTT 主要包含三项设计:模型架构由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成;序列训练结合序列动作强制和截断反向传播算法;长上下文约束把部分时间步只作为上下文使用。
研究团队在三个长程双臂装配任务上评估了 RoboTTT。主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7。在”齿轮机器人”任务上,RoboTTT 是唯一完整完成任务的方法。
预训练上下文从 128 扩展到 8K 时间步后,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%。RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿,在电路装配任务中 10 次试验成功 6 次。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,能在线从自身错误中恢复。
研究团队指出,扩展训练上下文长度会增加训练成本,TTT 层的目标函数仍有探索空间。RoboTTT 与强化学习结合,有望进一步提升实际执行表现。
