只激活60亿参数,Qwen3.8提前公开Qwen4架构

2026年08月27日 由 ATYUN编辑部 发表 995 0
四层实体架构模型分别呈现稀疏注意力、门控残差、N-gram嵌入与优化模块
原创架构示意图:Qwen3.8-Flash-Next把注意力、残差、嵌入和优化作为一组系统工程重新设计。

阿里Qwen团队这次开放的不是又一个常规小版本,而是一张提前摊开的Qwen4架构草图。Qwen3.8-Flash-Next拥有1250亿参数主模型,另加510亿N-gram嵌入,但每个Token只激活约60亿参数。它试图回答一个更现实的问题:当Agent需要更长上下文、更频繁工具调用和更低单次成本时,模型还能不能继续只靠堆参数解决。

架构先开:这是Qwen4正式家族之前的实验性预览,权重与技术报告同步开放。
效率先行:团队称其训练计算量约为Qwen3.7-Plus的九分之一,同时在编码和办公任务上更强。
部署可验证:Transformers、llama.cpp、SGLang、vLLM和TokenSpeed均给出可运行路径。

四处改动,目标都是把长上下文成本拆开

第一处是GDN与Qwen Sparse Attention混合注意力。GDN负责压缩历史,QSA用轻量索引器按微块选择重要上下文,避免长序列里每个Token都进行全量匹配。第二处是门控残差,把残差流扩成四个分支,再动态控制每层读写。它追求的不是简单加宽,而是在增加表达容量时稳住深层训练。

第三处N-gram嵌入尤其值得企业部署团队留意。它用局部词组查表扩展模型容量,额外计算量较小,而且嵌入表可以卸载到主机内存,并通过异步预取与模型计算重叠。第四处则是Muon优化器的工程化调整,包括正交化精度、Muon与AdamW的分工以及融合参数拆分。四项变化分别触及计算、信息流、内存和训练稳定性,说明Qwen4的竞争点将不只在榜单分数。

“60亿激活”不等于普通服务器就能轻松运行

低激活参数直接影响单步计算量,却不等于全部权重都消失。完整权重仍达到数百GB,显存、主机内存、互联带宽和预取命中率都会决定实际吞吐。模型原生上下文为262144,官方部署示例通常要求四路张量并行;云端生产版可把上下文扩到100万,但它包含额外工具能力,与开放权重预览版并非完全相同产品。

Qwen给出的编码与办公基准表现具有参考价值,但仍属于供应商测试。企业评估不能只复制单轮问答分数,而要把自有文档、多轮工具调用、图片输入、超长会话和故障恢复放进同一套任务集。特别是N-gram嵌入依赖内存分层,若主机带宽或预取策略不匹配,理论节省可能被数据搬运抵消。

对FDE而言,开放架构比开放权重更有价值

企业现场真正稀缺的不是再下载一个模型,而是提前知道下一代模型会怎样改变基础设施。QSA意味着长上下文评测要区分被选中和被丢弃的信息;门控残差意味着量化与推理内核需要重新适配;N-gram卸载则把容量规划从GPU延伸到CPU内存与I/O。FDE可以据此提前制作硬件矩阵、回归任务和降级方案,而不是等Qwen4发布后才从头验证。

这也是此次发布最有分量的地方:Qwen把新架构先交给社区检查,并让API、终端Agent和本地部署同时可用。它缩短了研究设计到生产工具链之间的时间差,但并未消除迁移成本。编辑判断是,Qwen3.8-Flash-Next更适合被当作一套面向下一代架构的验证底座,而不是立刻替换所有线上模型。先测长任务完成率、首Token延迟、单位任务成本和内存峰值,再决定它是否进入主路由,才是企业采用的正确节奏。

部署验证还应拆成三档:短上下文看基础吞吐,长文档看QSA筛选是否遗漏关键证据,Agent任务则观察工具参数与多轮状态能否保持一致。对同一任务同时记录GPU利用率、主机内存占用、首Token延迟和总完成时间,才能判断所谓低激活究竟省在计算、显存还是整体任务成本。若只看每秒Token,很可能忽略长任务中途失败后重跑的代价。进一步说,开放预览也给芯片和推理框架厂商留下适配窗口:量化、稀疏索引、主机预取与多卡并行可以提前进入联合测试,这比等正式旗舰模型上线后再被动追赶更利于形成稳定生态。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消