AI框架提升机器人决策能力

原文标题:AI Framework Boosts Decision-Making in Robotics

据Mirage News于8月11日报道,机器人系统依赖于一系列相互连接的控制周期,每个周期都有其自身的时间限制和截止时间,这对整体运行至关重要。华盛顿州立大学的研究人员开发了一种人工智能框架,能够自动管理这一系列级联的截止时间,从而帮助机器人及其他信息物理系统在快速变化的环境中做出安全的决策。这项成果已在模拟环境中以及市面上销售的机器人狗UniTree Go2上成功进行了测试。这一进展可以提高部署在自动驾驶汽车、工业机器人、无人机等系统中的AI的可靠性,在这些系统中,计算资源会波动,且决策延迟可能会引发不安全的状况。该框架被称为动态时间强化学习(DTRL),是首个专为在动态时间要求下运行的信息物理系统设计的强化学习框架。该研究已被第47届IEEE实时系统研讨会(IEEE Real-Time Systems Symposium)接收,该研讨会于12月在日本横滨举行。在强化学习中,AI代理通过不断试错来“学习”提升自身的决策能力。

这种新框架并不假设每个控制决策都需要固定的计算时间,而是根据每个截止期限前的可用时间,持续调整执行的神经网络计算量。WSU Tri-Cities 工程与应用科学学院助理教授 Mengyu Liu 表示:现实世界中的机器人系统在每个控制周期中,很少有完全相同的可用计算时间。DTRL 并非强制 AI 总是做出最快或最准确的决策,而是智能地适应可用的计算时间,以平衡控制性能和安全性。现有的许多 AI 控制器将神经网络压缩成永久简化的模型,以满足最坏情况下的截止期限要求;或者维护多个在执行期间切换的独立模型。这些方法通常会牺牲控制性能,需要多得多的内存,或者导致动作不一致。相反,DTRL 将提前退出神经网络直接集成到强化学习中,这种网络一旦达到高置信度就会立即做出决策,而不是完成全部计算。

这使得单一策略——或一组决策规则——能够在多个计算深度上执行,同时在不同的时间预算下保持一致的控制。与最初为计算机视觉开发的自适应推理技术不同,DTRL 引入了强化学习特定的训练方法,从而在各个决策点保持策略的一致性。研究人员在 Unitree Go2 机器人上对 DTRL 进行了评估,测试了包括倒立摆稳定、对截止时间敏感的“到达-避开”导航以及四足运动在内的多种控制任务。无论是在仿真还是硬件实验中,与传统方法相比,DTRL 在满足截止时间、控制性能和动作一致性之间始终取得了更好的平衡。通过将自适应神经网络推理与实时系统原理相结合,该框架使 AI 控制器能够更好地利用可用的计算资源,同时维持安全关键应用所需的可预测时序行为。

来源:Mirage News | 原文链接