
把一个124B参数模型用于高频智能体服务,最难的不只是“答得对”,而是长对话里能否持续跑得快、算得省。蚂蚁百灵7月24日发布Ling-3.0-flash:模型每个token仅激活5.1B参数,原生支持256K上下文,并把注意力架构、集群缓存和多智能体协同一起指向长程任务。它要证明的不是参数越大越强,而是更少激活也能完成可交付工作。
计算路径更稀疏。模型采用混合专家架构,每个token只调用部分参数,官方给出的激活规模为5.1B,而不是让124B参数全部参与一次推理。
长上下文从模型和服务两端优化。原生窗口为256K,可扩展到1M;命中集群L3缓存时,官方测试称首token延迟可比重新计算降低60%至80%以上。
当前先开放API。百灵平台与OpenRouter提供限时免费调用,活动到8月3日23时结束;模型权重承诺在免费期结束后开源,目前还不能按开放权重模型部署。
Ling-3.0-flash从预训练开始采用原生混合线性注意力架构,每六层由五层KDA线性注意力与一层MLA组成。KDA在状态更新中加入细粒度对角门控,让不同特征通道能够分别决定保留、衰减和写入信息;MLA则补充对完整上下文关系的建模。两类层交替堆叠,目标是在长文档、大型代码库和多轮工具调用中兼顾记忆效率与表达能力。
稀疏化进一步压缩单步计算。官方称专家激活比例从上一代的1/32降到1/64,最终形成124B总参数、5.1B激活参数的组合。但“激活少”不等于模型文件只有5.1B,也不代表部署显存可以直接按5.1B模型估算;完整权重、路由、缓存和并发服务仍会带来明显硬件占用。
服务层同样参与提速。百灵基于SGLang HiCache与Mooncake构建分层缓存,让长会话上下文能在不同存储层和计算节点之间复用。60%至80%以上的首token延迟降幅有明确前提:请求必须命中L3缓存,比较对象是重新计算同一段长输入,因此不能外推到所有请求或端到端任务耗时。
模型训练覆盖Coding Agent、General Agent和Deep Research Agent,官方称可交互环境超过一万个。强化学习阶段会复盘完整执行轨迹,并评估各步骤对结果的贡献,让模型从工具返回、失败反馈和自主纠错中获得更细的训练信号。这种做法把优化目标从单轮答案延伸到规划、调用、检查和修改的完整链路。
在生成可交互网页应用的MiniAppBench上,官方披露Ling-3.0-flash通过率为25.3%,参与比较的16个主流模型平均为17%。该基准要求模型根据一句需求生成可运行应用,能够检验静态页面之外的交互逻辑。不过成绩仍由发布方给出,模型配置、采样预算与失败重试都会影响结果,不能据此认定它在所有代码或通用智能体任务上领先。
Ling Multi-Agent则允许不同智能体分工检索、交叉验证和竞争筛选。官方在BrowseComp及其中文版本上观察到随协作规模增加的性能提升,但多智能体通常也会放大token消耗、调用次数和延迟。只有任务价值高于新增推理成本时,这套协同机制才真正具备生产意义。
免费期后,百灵官方标价为每百万输入token 0.40元、输出token 1.20元;低价使它适合批量检索、代码修改和办公自动化等高频任务。目前开发者可以通过官方平台或OpenRouter接入,原生256K窗口已具备实用空间,但扩展至1M的具体可用条件、吞吐上限、并发限制和稳定性仍需在真实工作负载中确认。
更关键的限制是权重尚未发布。官方只承诺免费期结束后开源,许可证、量化版本、主流推理框架适配和实际硬件需求仍待落地。架构与缓存数据主要来自厂商测试,现阶段更适合把它当作有竞争力的候选模型进行小规模验证,而不是直接替换已经稳定运行的生产系统。
ATYUN编辑判断:Ling-3.0-flash最值得关注的不是“124B”这个大数字,而是把每token激活参数、长上下文缓存和任务型训练放进同一套效率设计。它代表国产模型竞争正从榜单分数转向可持续执行成本。接下来真正决定含金量的,是权重能否如期开源、第三方能否复现智能体成绩,以及低价API在高并发长任务中是否仍保持稳定。
