
智东西
作者 | 杨京丽
编辑 | 李水青
智东西 8 月 20 日报道,今日,蚂蚁百灵开源Ling-3.0-tiny-base 和 Ling-3.0-flash-base。除最终 Base 模型权重外,团队还同步开放了两款模型的预训练和中期训练权重,共计6 个 checkpoints。
此前,Ling-3.0-flash 于 7 月 24 日发布,8 月 7 日开源;轻量级模型 Ling-3.0-tiny 则于 8 月 11 日开源。距离 Tiny 开源仅 9 天,蚂蚁百灵又进一步开放了两款模型未经后训练的 Base 版本。
Ling-3.0-tiny-base 总参数量为 7.9B、激活参数量为 1.3B,适合代码领域训练、预算敏感的强化学习研究及模型行为研究等;Ling-3.0-flash-base 总参数量为 124B、激活参数量为 5.1B,可用于代码、复杂推理、长上下文及专业领域模型的继续训练。
此次开放覆盖预训练、中期训练和 WSM 合并三个阶段,开发者可根据自身数据、任务和研究目标,选择不同的训练起点。
WSM(Warmup-Stable and Merge)是一种面向大模型预训练的学习率方案,它以多个 checkpoints 加权合并,代替传统的学习率衰减,使模型更适合持续预训练和动态扩展数据。
由于两款模型采用统一训练方案,开发者可以先在 Ling-3.0-tiny-base 上低成本验证训练策略,再将有效方法扩展至 Ling-3.0-flash-base。

Ling-3.0-tiny-base 开源地址:
Hugging Face:
https://huggingface.co/inclusionAI/Ling-3.0-tiny-base
https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-30T
https://huggingface.co/inclusionAI/Ling-3.0-tiny-base-midtrain
ModelScope:
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-30T
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-tiny-base-midtrain

Ling-3.0-flash-base 开源地址:
Hugging Face:
https://huggingface.co/inclusionAI/Ling-3.0-flash-base
https://huggingface.co/inclusionAI/Ling-3.0-flash-base-30T
https://huggingface.co/inclusionAI/Ling-3.0-flash-base-midtrain
ModelScope:
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-30T
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-base-midtrain
一、开放 6 个 checkpoints,可自行选择训练起点
8 月以来,Ling-3.0-flash 和 Ling-3.0-tiny 陆续开源。此后,有开发者在 Ling-3.0-tiny 的 Hugging Face 社区中提出,希望团队进一步开放 Base 模型。
他认为,Tiny 的模型规模和稀疏架构对预算有限的研究者很有吸引力,适合开展强化学习 rollout 和面向具体场景的后训练;相比已经完成后训练的模型,社区更需要一个能够继续塑造的 Base Model。

开发者希望开源 Base 模型(图源:Hugging Face)
于是,百灵今天开源 Ling-3.0-tiny-base 和 Ling-3.0-flash-base。
此次开放的 6 个 checkpoints 覆盖三个阶段:预训练 checkpoint 已完成大规模预训练,尚未进行中期训练、WSM 合并和后训练;中期训练 checkpoint 已完成中期训练,尚未进行 WSM 合并和后训练;最终 Base checkpoint 则已基于中期训练 checkpoint 完成 WSM 合并,尚未进行后训练。

本次开源的 6 个 checkpoints(图源:百灵大模型)
这些 checkpoints 可用于持续预训练、领域监督微调、偏好优化、强化学习后训练、模型蒸馏,以及长上下文和 MoE 系统研究。
Ling-3.0 系列在中期训练结束后,采用 WSM 方法,以 checkpoint 加权合并替代传统的学习率衰减。由于不再设置固定的学习率衰减阶段,模型更适合持续预训练和动态扩展数据。研究者还可以在训练结束后,离线探索不同的学习率 " 衰减曲线 "。
Ling-3.0-tiny-base 与 Ling-3.0-flash-base 采用统一的训练方案。开发者可以先在 Ling-3.0-tiny-base 上低成本验证训练策略,再将有效方法扩展到规模更大的 Ling-3.0-flash-base。
二、Tiny 主打低成本后训练,Flash 强化代码和长上下文
Ling-3.0-tiny-base 总参数量为 7.9B,激活参数 1.3B。其总参数量约为前代 Ling-2.5-mini-base 的一半,但在多数评测中取得了更高成绩,代码能力尤为突出。

Ling-3.0-tiny-base 评测对比(图源:百灵大模型)
该模型适合开展代码领域的持续预训练、监督微调和后训练,用于预算敏感的强化学习 Rollout 与后训练研究,也可以用于高校教学、模型行为研究、MoE 消融实验,还可针对具体行业和任务验证领域适配路线。
Ling-3.0-flash-base 总参数量为 124B,激活参数量为 5.1B,具备更充足的参数容量与稀疏激活设计。模型在代码、复杂推理和长上下文方向表现突出。与总参数量约为其 2 至 3 倍的部分 Base 模型相比,其整体成绩仍具竞争力。

Ling-3.0-flash-base 评测对比(图源:百灵大模型)
该模型可以作为大型代码库、专业推理和长流程 Agent 的训练底座,也适合金融、医疗、科研和工业等领域的持续预训练与后训练。
不过百灵提醒,Base Model 并非已经完成指令对齐的聊天模型,不建议未经后训练便直接将其部署为面向终端用户的聊天服务,也不建议未经额外对齐和评估便用于安全关键型应用。用于生产环境前,还需要完成针对具体任务的后训练、评估和验证。
结语:从开放模型权重,到开放训练关键节点
相比只开放完成后训练的模型,此次蚂蚁百灵进一步开放了预训练、中期训练和 WSM 合并三个阶段的 checkpoints,为开发者提供了多个可继续训练的起点。
Tiny 和 Flash 模型采用统一训练方案,也为模型训练提供了一条从小规模验证到大规模扩展的路径。未来,这些基座模型能否在代码、专业领域及强化学习研究中衍生出更多模型,将成为此次开源价值的重要检验,也期待后续有更多大模型厂商开放基座模型,为开发者提供更具可塑性的训练底座。


登录后才可以发布评论哦
打开小程序可以发布评论哦