开放模型的规模上限又被抬高了一截。Qwen已经放出Qwen3.8-2.4T-A95B的模型权重与配置文件,这是Qwen-Max级模型首次进入开放权重序列:总参数2.4万亿,每个词元激活950亿,原生上下文262144词元,并可扩展到约101万词元。与此前只有云端入口的旗舰版本相比,开发者现在可以下载权重,自行选择vLLM、SGLang等推理栈部署。
快速看点:第一,模型采用512个路由专家,每次选择10个并叠加1个共享专家;第二,线性注意力与全注意力交替,面向超长智能体任务;第三,推理强度可在低、中、超高三档切换;第四,开放不等于低门槛,2.4万亿参数仍需要数据中心级系统,许可证也对超大商业用户设有额外条件。

Qwen3.8-Max此前已经以托管服务形式提供,完整版本包含视觉输入、默认百万上下文、内置工具和非思考模式。此次开放的是文本后训练模型Qwen3.8-2.4T-A95B,仓库提供Transformers格式权重与配置,兼容vLLM、SGLang等框架。两者共享核心模型基础,但产品能力并不完全相同,不能把云服务的所有功能自动算到开源部署上。
参数结构解释了它为什么既大又没有在每次生成时调用全部容量。模型拥有512个路由专家,单个词元只激活10个专家,再加1个共享专家;92层网络按照三层Gated DeltaNet与一层门控全注意力的节奏重复。MoE把总容量与单步计算拆开,混合注意力则试图控制上下文增长带来的显存和计算压力。
智能体执行代码、文档研究或长周期任务时,系统提示、工具返回、检索资料、日志和中间推理会持续累积。全注意力层可以建立更完整的词元关系,却会让KV缓存随长度迅速变重;线性注意力层用有界递归状态代替不断增长的缓存。Qwen3.8把两者交替使用,目标是在保持关键全局交互的同时,把长任务的计算和内存压力控制在可部署范围内。
模型还开放reasoning_effort控制,支持低、中和超高三档,并允许保留历史推理上下文。这使服务方可以按任务调整成本:批量文档处理不必总开最高推理强度,复杂代码或多步规划则可换取更长思考。但“最长约101万词元”是可扩展上限,不代表所有框架、硬件和请求都能以相同吞吐稳定运行。
英伟达给出的首日部署结果显示,模型在由72块Blackwell Ultra GPU组成的GB300 NVL72上,以FP8精度实现单GPU每秒超过4000词元的峰值吞吐,并达到单用户每秒超过350词元。该系统拥有单一72 GPU NVLink域,互连带宽为130 TB/s。数字证明超大MoE可以被工程化服务,也同时揭示门槛:这不是一两张消费级显卡就能完整运行的模型。
官方模型卡公布了大量编码、专业工作和智能体评测。在Terminal Bench 2.1上,Qwen3.8-Max得分86.6,PaperBench为93.0;不过不同模型使用的代理框架、上下文、超时设置和评审器并不完全一致,部分项目还是内部基准。它们适合说明目标方向,不应被解读为对所有场景的统一胜负。
Qwen3.8-Max开放权重的价值,在于企业和研究者可以审查、微调并控制部署路径,也能围绕超大MoE推进分布式推理优化。它不会立刻把旗舰能力搬进个人工作站,却为云厂商、算力平台和大型机构增加了一个可自主托管的选择。模型规模越大,推理软件、互连、量化与调度的差异反而越能决定实际体验。
需要保留的边界也很清楚。其许可证不是Apache 2.0:月活超过1亿或月收入超过2000万美元的商业产品需要显著展示模型名称,达到特定收入门槛的模型即服务或AI工作助手业务还需另行取得许可。再加上官方评测尚缺广泛独立复测,现阶段更准确的判断是:Qwen把Max级权重真正交给了生态,但它能否变成稳定、经济的生产系统,仍取决于部署者的算力、工程能力与合规选择。
