新闻
开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源
1 分钟阅读
来源:zhidx.com
智东西 作者 | 杨京丽 编辑 | 李水青 智东西8月20日报道,今日,蚂蚁百灵开源 Ling-3.0-tiny-base和Ling-3.0-flash-base 。除最终Base模型权重外,团队还同步开放了两款模型的 预训练和中期训练权重 ,共计 6个checkpoints 。 此前, Ling-3.0-flash于7月24日发布 ,8月7日开源; 轻量级模型Ling-3.0-tiny则于8月11日开源 。距离Tiny开源仅9天,蚂蚁百灵又进一步开放了两款模型未经后训练的Base版本。 Ling-3.0-tiny-base总参数量为7.9B、激活参数量为1.3B,适合代码领域训练、预算敏感的强化学习研究及模型行为研究等;Ling-3.0-flash-base总参数量为124B、激活参数量为5.1B,可用于代码、复杂推理、长上下文及专业领域模型的继续训练。 此次开放覆盖 预训练、中期训练和WSM合并 三个阶段,开发者可根据自身数据、任务和研究目标,选择不同的训练起点。 WSM(Warmup-Stable and Merge)是一种面向大模型预训练的学习率方案,它以多个checkpoints加权合并,代替传统的学习率衰减,使模型更适合持续预训练和动态扩展数据。 由于两款模型 采用统一训练方案 ,开发者可以先在Ling-3.0-tiny-base上 低成本验证训练策略 ,再将有效方法扩展至Ling-3.0-flash-base。 Ling-3.0-tiny-base开源地址: Hugging Face: https://huggingface.co/inclusionAI/Ling