Bagel Labs 推出用于机器人的 WorldDiT 世界模型

原文标题:Bagel Labs launches WorldDiT world model for robotics

据TestingCatalog AI News于7月29日报道,WorldDiT 在一个共享模型中学习机器人动作和未来场景状态,同时 Bagel 报告了在 1B 参数以下取得的领先 LIBERO 成绩。Bagel Labs 发布了 WorldDiT,这是一款机器人世界模型,它可以同时学习两件事:机器人应该采取的动作,以及其前方场景接下来可能发生的变化。这两种能力使用相同的共享参数,而不是分散在单独的模型中。此次发布主要面向机器人公司中的机器人工程师、研究人员和技术负责人,并包含了发布在 Hugging Face 上的技术报告和模型权重。其背后的架构问题在机器人学习领域是一个备受关注的焦点。当前的许多系统要么只训练单独预测动作的策略,要么依赖一个非常庞大的视觉语言主干网络,将感知、语言和控制整合在单一技术栈中。WorldDiT 则以小得多的规模采取了统一路线,将预测和控制视为同一个受训系统的两个输出,因此,用于对场景演变进行建模的参数,与决定机器人如何应对该场景的参数是相同的。

WorldDiT学会了通过一个扩散主干网络并行采样机器人动作并预测未来的世界视图。这种更丰富的信号帮助它在参数量少得多的情况下,在LIBERO上取得了出色的成绩。下表展示了完整的基准比较。pic.twitter.com/ML9De2qkQL Bagel Labs提出的数字与模型规模有关。在LIBERO(一个用于语言条件机器人操作的标准仿真基准)上,该公司报告称,WorldDiT在基准分数与参数量的比值方面处于前沿水平,同时参数量远低于十亿。从这个角度来看,其主张与其说是直接霸占排行榜榜首,不如说是其背后的比例关系:在无需扩展到数十亿参数规模的情况下,取得强大的机器人仿真结果。对于在机器人本地而非云端运行推理的团队来说,这一比例至关重要,因为内存预算和嵌入式硬件的延迟都直接受模型规模的影响。Bagel Labs是一家AI研究实验室,致力于在异构和商用硬件上进行前沿扩散模型的分布式训练。其之前的发布也遵循了同样的思路。

Paris 于 2025 年 10 月发布,是一个用于图像生成的开放权重去中心化扩散模型,由独立训练的专家模型构建而成,这些模型之间没有任何梯度、参数或激活值的交换,随后在推理阶段通过一个轻量级路由器进行组合。Paris 2.0 紧随其后于 2026 年 5 月发布,并将这一架构设计引入了视频领域,该实验室报告称,与在匹配的数据和算力下训练的单体模型相比,其 Frechet Video Distance 从 561.04 降至 279.01。一篇关于异构去中心化扩散模型的相关论文已被 CVPR 2026 接收。WorldDiT 将这项工作从媒体生成领域转向了物理 AI,这是该实验室自 Paris 2.0 以来就一直暗示的方向,当时它指出,视频扩散骨干网络正越来越多地位于机器人技术使用的世界模型底层。Bagel Labs 由 Bidhan Roy 创立,公开发布其研究和模型权重,WorldDiT 技术报告也与模型同步发布。Source

来源:TestingCatalog AI News | 原文链接