国产交互式世界模型上新,文本、图片一键生成3D世界

机器人电报8月18日讯,智象未来(HiDream.ai)近日发布了原生全模态交互式世界模型HiDream-O1-World。该模型支持文本、图像与交互等多模态输入,并集成了漫游、编辑和交互三大核心功能,使用户能够一键生成时空一致、符合物理规律的可交互世界。

在第三方评测基准WBench中,HiDream-O1-World以平均分80.9的成绩登顶Navi分榜。其在物理维度获得73.3分位列第一,一致性维度得分为88.0。该模型搭载智象自研的原生全模态(UiT)架构,在关键的时空与物理一致性上实现突破:当镜头移动时,场景几何结构保持稳定,物体不会变形或消失;物体间的碰撞、遮挡与重力响应也高度符合真实世界的因果逻辑。

用户可从文本或图片出发,以第一或第三人称视角探索生成场景,并控制角色动作、天气及物体状态。智象未来计划将该模型应用于AI互动影游、具身智能仿真及3D场景生产等领域。针对交互式世界模型常见的场景漂移等问题,模型通过将3D空间信息写入Memory上下文,并结合测试时训练(TTT)在推理中持续调整,以维持长交互下的稳定性。

此外,智象未来与复旦大学联合发表的论文《DreamWorld:面向3D一致世界建模的几何驱动视频扩散》已被国际顶会ECCV 2026接收,相关研究聚焦于空间一致性。