News
小米公开MiMo-V2
1 min read
Source: Telegram AI频道
小米公开MiMo-V2.6大模型RL训练过程 罗福莉发文确认将开源技术细节 9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文,首次公开旗下最新大模型MiMo-V2.6的强化学习(RL)训练进展,并同步上线实时训练页面,开启大模型RL阶段的全程公开直播。此举标志着小米在物理世界与通用智能(AGI)道路上的探索迈入全新突破期,相关技术细节亦计划于未来数周内逐步开源。 技术架构上,MiMo-V2.6正在开展大规模多任务智能体(Agent)RL实验。团队围绕三大维度进行全面扩展:算力层面实现单步约20亿Token(1568个Prompt×16次rollout)的完全异步并行;环境层面搭建支持单次运行混合多框架的代理式RL;评估层面则采用带测试用例与量规奖励的组内信用分配机制。 直播页面实时呈现训练进度、Token消耗与成本指标,其中MiMo-V2.6-Pro版本训练约1天19小时、耗资89万美元,MiMo-V2.6-Flash时长1天14小时、耗资39.7万美元,双版本累计训练成本已突破128万美元。 作为雷军此前从DeepSeek重磅引进的“95后”AI科学家,罗福莉曾主导达摩院多语言预训练及DeepSeek-V2研发,于去年11月正式加盟小米并执掌MiMo大模型团队。今年3月,上一代万亿参数模型Mimo-V2-Pro已登顶Artificial Analysis全球大模型综合智能榜第八位(品牌榜第五)。 本次MiMo-V2.6通过透明化直播与工程细节开源,展示了小米在RL Scaling Law(强化学习扩展定律)上的深度积累,也将推动前沿大模型训练从“黑盒试错”向“极客级过程开源”的范式演进。 via AI新闻资讯 (author: AI Base)