新闻
国产交互式世界模型上新,文本、图片一键生成3D世界
1 分钟阅读
来源:zhidx.com
智东西 作者 | 杨京丽 编辑 | 李水青 智东西8月18日报道,昨天,多模态大模型公司智象未来(HiDream.ai)发布 原生全模态交互式世界模型HiDream-O1-World 。 该模型支持 文本、图像及交互 等多模态输入,具备 漫游、编辑和交互 三大功能。用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。 在第三方交互式世界模型评测基准WBench中,HiDream-O1-World以平均分80.9的成绩 登顶Navi分榜 。其中,该模型在物理(Physical)维度获得73.3分, 位列第一 ,一致性(Consistency)维度得分为88.0。 HiDream-O1搭载智象自研的原生全模态(UiT)架构,在 时空一致性与物理一致性 上,取得了关键性突破:当镜头推拉摇移时,场景空间的几何结构仍可保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。 在实际体验中,用户可以从一段文字或一张图片出发,以第一人称或第三人称视角探索生成场景,并 控制角色动作、天气及物体状态 。智象未来计划将该模型用于 AI互动影游、具身智能仿真和3D场景生产 等方向。 针对交互式世界模型容易出现的场景漂移、物体消失和物理失真等问题,该模型将 3D空间信息写入Memory上下文 ,并通过 Test-Time Training (TTT,测试时训练)在推理过程中持续调整模型,以维持长时间交互下的空间和物理一致性。 值得注意的是,围绕空间一致性,智象未来与复旦大学联合开展的研究论文《DreamWorld:面向3D一致世界