
当大模型的总参数冲到2.8万亿,真正的看点不再只是规模,而是每次生成只激活896个专家中的16个。Moonshot AI推出Kimi K3,把100万token上下文、原生视觉和长程智能体能力放进同一架构,并承诺在7月27日前开放完整权重。它试图证明,超大模型也能通过极致稀疏化进入开放生态。
规模首次跨入新档位:Kimi K3总参数2.8万亿,支持最高100万token上下文,并原生处理文本与视觉信息。
稀疏度进一步提高:Stable LatentMoE每个token只激活896个专家中的16个,目标是在扩大容量时控制计算量。
开放仍有时间差:产品、Kimi Code与API已经可用,但完整权重和技术报告尚未发布,外部团队暂时无法完整复现。
Kimi K3采用混合专家架构。可以把896个路由专家理解为不同的能力分区:模型处理一个token时,不会同时运行全部专家,而是由路由器选择其中16个参与计算。这样既保留2.8万亿参数所承载的容量,又避免把所有权重都放进同一次前向计算。代价是路由、跨设备通信和负载均衡会变得更难。
架构的另一组变化是Kimi Delta Attention与Attention Residuals。前者面向长序列的注意力效率,后者不再让每一层简单累加前层表示,而是按需取回不同深度的信息。发布方称,这些结构配合训练与数据配方,使整体缩放效率相比Kimi K2提升约2.5倍。这个数字来自内部评估,仍需要技术报告与独立复测解释计算口径。
为了让超大模型更适合推理,K3从监督微调阶段就加入量化感知训练,使用MXFP4权重与MXFP8激活。它还为KDA设计了新的前缀缓存实现,计划同步贡献给vLLM社区。思路很明确:模型规模已经很难缩小,工程重点转向减少每次激活的参数、降低精度成本,并尽量复用长上下文缓存。
K3的定位不只是聊天模型,而是能够在终端、代码库和视觉反馈之间持续工作的智能体。发布方给出的内核优化测试允许模型在相同沙箱中连续运行最多24小时,处理NVIDIA H200等硬件上的四项任务。结果显示K3在这些特定条件下具备竞争力,但不同模型使用的智能体框架并不完全一致,不能直接外推为全面编码领先。
更有代表性的案例来自长任务。K3曾在一次48小时自主运行中,使用开源EDA工具为自身架构的微型模型设计并验证一颗芯片;在45纳米库上的模拟结果中,4平方毫米设计达到100MHz,解码吞吐超过8700 token/秒。另一个计算天体物理案例中,它交叉核对20多篇论文、评估300多种状态方程并生成3000多行Python代码,约两小时完成发布方估计需专家一到两周的工作。
这些案例展示了模型把文献、代码、终端和图像反馈串成闭环的潜力,但它们仍由开发团队选择和披露。真实企业环境中的代码质量、失败恢复、权限控制和成本波动,必须用更长时间的外部任务验证。尤其是持续数小时甚至数天的智能体运行,任何早期误判都会在后续步骤中被放大。
目前用户已可在Kimi、Kimi Work、Kimi Code和API中使用K3。API按百万token计费:缓存命中输入0.30美元、未命中输入3美元、输出15美元。Kimi Code文档显示,最高100万上下文只向部分订阅档位开放,较低档位为25.6万上下文;默认使用最大推理强度,切换模型或推理档位还可能导致上下文缓存重新预填充。
对企业和研究团队而言,最值得期待的是完整权重,而不是又一个托管API。权重开放后,团队才可能审查模型、进行领域微调、部署到自有环境,并验证量化和推理引擎的实际效率。不过,发布方建议用64张或更多加速器组成的超节点部署K3,这意味着它即使开放,也不会成为普通工作站可以轻松运行的模型。
K3当前仍有四条清晰边界。第一,完整权重与技术报告尚未落地;第二,许多成绩和案例来自内部评估,对比条件并不完全统一;第三,开发团队明确表示其总体体验仍落后于最强闭源模型;第四,若智能体框架未完整回传思维历史,质量可能变得不稳定,模型也可能在意图模糊时替用户做出意外决定。100万token只是容量上限,不代表模型在任何超长输入中都能稳定提取关键信息。
ATYUN编辑判断:Kimi K3最重要的信号不是“参数越大越好”,而是开放模型开始把稀疏路由、低精度训练、长上下文缓存和智能体工具链当成同一个系统问题。2.8万亿参数展示了容量上限,16个激活专家则揭示真正的工程方向:未来竞争会更多落在每次任务调用多少计算、能否稳定运行数小时,以及开放权重后是否有成熟推理生态。
接下来应重点观察7月27日前的权重是否按期发布、许可条款是否允许广泛商用、vLLM实现能否同步落地,以及外部团队能否复现长程编码和科研案例。在这些问题得到答案前,K3是一项规模惊人的技术预告,也是一套已经可通过产品和API试用的能力,但还不是已经完成验证的开放部署方案。
