News

每小时烧掉三万美元

1 min read
每小时烧掉三万美元!前DeepSeek大牛罗福莉加盟小米后首度直播大模型训练 一、 沉寂半年后重回大众视野 在人工智能领域备受关注的小米迎来新动态。沉寂半年的小米 MiMo 大模型团队负责人、前 DeepSeek 研究员罗福莉,于9月17日凌晨在 X 平台发文,正式对外公开并直播了当前大模型的训练过程。此次动作标志着她再次卷入激烈的大模型技术竞争中,同时也让外界得以首次窥探小米最新一代模型的内部训练状态。 二、 MiMo-V2.6的 RL 实验与三大扩展方向 根据罗福莉分享的实时训练页面显示,目前小米旗下的最新大模型MiMo-V2.6正在进行大规模的 Agent(智能体)强化学习(RL)实验。团队在此次运行中重点推进了三个维度的技术扩展: 计算资源扩展:每步计算资源大约消耗20亿 token,包含1568个提示乘以16次 rollout,采取完全异步的运行模式。 环境和测试框架扩展:构建了多任务代理式 RL,在单次运行中同步混合多个测试框架。 评估计算扩展:引入代理式组内信用分配,配备了实际测试用例和基于量规的奖励机制。 罗福莉同时透露,团队将在未来的几周内逐步向外界开源相关的技术细节。 三、 高昂的训练成本与双版本表现 从公开的实时训练数据来看,此次大模型训练展现出极高的资金与算力消耗。训练页面中目前主要包含两个并行版本: MiMo-V2.6-Pro:累计训练时长达到1天19小时,累计耗资约89万美元,平均每小时的训练成本超过2万美元。 MiMo-V2.6-Flash:累计训练时长为1天14小时,累计耗资约39.7万美元,平均每小时的训练成本超过1万美元。 两个版本的累计训练成本目前已经突破128万美元,折算下来整体每小时的耗费超过3万美元,充分凸显出当前头部大模型在强化学习阶段对海量算力的极致诉求。 四、 团队背景与此前进展 在业务布局方面,小米高层此前曾多次公开披露 AI 领域的阶段性成果。今年3月份,小米创始人雷军曾在微博发文透露,万亿参数大模型MiMo-V2-Pro曾跻身全球大模型综合智能排行榜 Artificial Analysis 的全球第八位,在品牌排名