机器人电报7月21日讯,小鹏近日正式发布TuringViT高效视觉编码器,面向VLM/VLA时代系统性重构视觉编码器的架构设计、数据范式与训练流程。TuringViT将全面支撑智能驾驶、智能座舱、IRON人形机器人三大业务场景。该编码器仅使用10%的训练数据,就实现了比领先的开源基线模型更强的准确性与效率权衡。
小鹏表示,TuringViT在1536×1536分辨率下的推理吞吐量达到Seed1.5-ViT的3.04倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。在IRON人形机器人的技术体系中,TuringViT充当着视觉视网膜的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。
