新闻
全球首个面向具身智能的视频基模,蚂蚁灵波 LingBot-Video 开源
1 分钟阅读
来源:ithome.com
IT之家 7 月 9 日消息,今天,蚂蚁灵波科技正式开源 LingBot-Video。这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的开源视频生成基础模型。 IT之家附官方详细介绍如下: 过去几年,视频生成模型在画质、流畅度和创意表达上取得了快速进步。但对于具身智能来说,一个看起来逼真、动作流畅的视频,未必能反映真实的物理规律,往往难以支撑机器人连续预测、规划和执行任务。与此同时,具身智能还要求模型具备更高的推理效率,以适应实时交互和控制闭环。 这也让视频生成开始出现两种不同的演进方向:一条通向影院,服务于内容创作;另一条通向机器人,服务于物理世界的理解、预测与交互。LingBot-Video 正是我们面向具身智能开辟视频生成新路线的重要探索 —— 围绕具身智能的核心需求,重新设计视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度等方面实现系统性提升。 架构、数据、训练三方面的系统创新 面向具身智能,LingBot-Video 从架构、数据和训练三方面进行了系统创新: 架构:DiT + MoE 设计 我们以 MoE 替代传统 Dense 架构,在扩大模型容量的同时控制单次推理成本。LingBot-Video 的 30B 总参数模型在生成时仅激活约 3B 参数,相比同等参数规模的 Dense 架构拥有约 3 倍的推理效率。这一设计使模型既能获得大规模参数带来的视觉表达能力,又更适合具身智能对高效推理的要求。 数据:数据画像引擎与 7 万小时具身数据 我们构建了数据画像引擎,在海量互联网视频的基础上,进一步引入 VLA、VLN、Ego