机器人电报9月20日讯,近日,Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学及清华大学,共同发布了面向灵巧手部交互的视触世界模型DexTouch-WM。
该模型以动作序列作为输入约束,能够同步预测未来的视频画面以及覆盖双手的精细触觉信息。为支持模型训练,团队采集了长达100小时的人类双手交互数据集,涵盖了50项日常双手操作任务。评测结果显示,通过逐步增加人类交互数据,模型在触觉接触相关指标上的提升尤为显著,其Contact-F1最高达到了0.706。
此项研究旨在解决手部灵巧操作中的核心信息缺失问题。手部操作包含大量物理接触细节,如接触压力和物体滑动状态,这些信息难以仅靠视觉捕捉。当手掌遮挡物体时,视觉信息的缺失会更为严重。现有的视触融合模型虽能部分弥补纯视觉模型的不足,但往往面临成本高或数据规模有限的局限。
DexTouch-WM通过采用低成本、大规模的人类手部交互数据,有效提升了视触世界模型的效果。该模型由三大技术模块构成:其视觉预测支路采用冻结的预训练视频编解码网络,通过迭代加噪与去噪的方式预测未来画面;其触觉预测支路则采用解剖感知的分词器与解码器,按指尖和掌心结构分区编码触觉热力图;此外,模型实现了视觉与触觉信息的多模态融合与动作约束,使其能够理解动作与物理交互之间的关联。
