7700亿参数、每次只激活490亿,腾讯混元Hy4开源

2026年08月30日 由 ATYUN编辑部 发表 315 0
模块库从大量专家模块中选择少数单元进入运行托盘,旁边展开长折页纸带
大量专家模块按需稀疏激活,并用长上下文承接复杂任务。架构示意图。

腾讯把混元旗舰模型推进到一个新的量级:Hy4 preview主干拥有7700亿参数,但每个token只激活490亿;上下文窗口扩展到100万token。8月28日,这款模型同步开放权重、FP8版本和TokenHub API,重点面向Coding、Agent、办公分析与长程复杂任务,而不是只用更大的参数表展示能力。

架构:78层MoE主干,256个路由专家中每次选择8个,并始终启用1个共享专家。
接入:权重采用Apache 2.0,官方给出vLLM、SGLang、微调与FP8部署路径。
企业接口:TokenHub支持多套主流协议,国内按量价为输入6元、输出18元/百万token。

7700亿不是一次全跑,稀疏激活才是关键

Hy4 preview主干共78层,第一层保留稠密前馈网络,其余77层改用混合专家结构。每层配置256个路由专家和1个共享专家,每个token只选择排名靠前的8个路由专家,再叠加共享专家。它的逻辑是把庞大参数容量保留下来,同时避免每一步推理都调用全部专家。

注意力部分采用Gated DSA,并用IndexCache跨层复用稀疏索引;残差路径使用四路iHC扩展层间信息流。主干之外还内置一层MTP,用于投机解码,这一层另含100亿参数、激活7亿。官方口径的7700亿只计算主干,因此模型文件页出现更大数字时,不能直接视为参数矛盾。

100万token上下文对应TokenHub的最大输入96万、最大输出6.4万。长窗口有利于多文件代码库、复杂文档和持续任务,但窗口上限不等于每次都应塞满;真实成本、延迟和检索准确性仍取决于提示组织、缓存与任务结构。

开源不只给权重,部署链路也一起放出

腾讯同时在Hugging Face、ModelScope、GitCode和CNB发布标准权重与FP8权重,采用Apache 2.0许可证。官方仓库提供vLLM和SGLang预构建镜像、OpenAI兼容调用示例、完整微调流程及AngelSlim压缩工具,默认深度思考,也可切换为直接回答模式。

部署示例采用8路张量并行,并启用MTP投机解码、稀疏注意力后端、推理解析器和工具调用解析器。这说明“开源可部署”并不等于普通工作站可轻松运行:企业需要先核算显存、并行通信、冷启动、长上下文KV缓存和故障恢复,再决定自托管FP8版本还是调用云端API。

TokenHub同时兼容三套协议,迁移成本被压低

云端模型ID为hy4-preview,支持OpenAI Chat Completions、OpenAI Responses和Anthropic Messages协议,并提供深度推理、结构化输出、Function Calling与缓存。对已有Agent框架的团队,这种兼容性意味着模型切换可以从网关和评测层开始,不必先重写整套业务调用。

国内TokenHub后付费价格为输入6元、输出18元、缓存命中0.3元/百万token。价格比Hy3更高,换来更大的模型容量与上下文。因此企业不应把Hy4默认分配给所有请求,而应通过模型路由、缓存命中率和任务级评测,把它留给长程编程、跨文件分析、工具调用和确实需要复杂推理的环节。

内部盲测略胜,但预览版边界同样明确

腾讯让163名内部专家对203项工程任务做盲测。Hy4 preview对GLM 5.3的平均分是2.99比2.92,胜率46.8%;对Kimi K3是2.99比2.94,胜率51.2%。这些数字能说明评测设计接近真实生产力任务,但样本、评审者和任务均来自厂商内部,不能代替独立基准和客户生产数据。

官方还主动列出两项已知问题:复杂任务可能思考得比必要时间更久,也可能过度验证自己的工作。公开材料没有披露任务完成率、人工介入率、P95延迟、故障率或ROI,企业上线前仍需用自己的代码库、文档和工具权限做回归评测。

编辑判断:Hy4 preview真正值得关注的不是参数再创新高,而是权重、量化、推理框架、微调和云端兼容接口同时到位。它让团队可以在“云端快速试验”和“自托管深度控制”之间选择,但预览版的可靠性与资源门槛决定了下一阶段比拼将转向任务完成成本,而不是单张排行榜。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消