
“开放权重”已经写在产品定位里,但10月6日真正上线的只有托管API公共预览。Mistral Large 4拥有1.05T总参数、52B激活参数、1.6B视觉编码器和100万token上下文,规模与价格都很醒目;然而权重、完整架构、训练方法和本地部署条件要到月底才会陆续公布。企业今天能做的是测试接口,不是把模型搬进自己的集群。
Mistral把ML4描述为原生多模态的细粒度MoE模型。博客使用“1万亿总参数、490亿激活参数”的概括口径,文档给出更精确的1.05T与52B;两组数字反映的是取整方式,不应被写成两个版本。稀疏激活让一次推理只调用部分专家,但实际显存、并行策略、通信开销与吞吐仍需等权重和部署文档才能判断。
模型支持图像输入、工具调用、结构化输出、批处理和Agents/Conversations接口。100万token上下文适合大型代码库、长文档与多步Agent轨迹,但上下文上限并不等于有效信息利用长度。企业测试应覆盖不同位置的证据召回、工具调用稳定性、长任务成本和压缩后信息丢失,而不是只验证接口能否接收超长输入。
文档显示公共预览前两周执行五折:输入0.68美元、缓存输入0.07美元、输出2.09美元/百万token。常规价分别恢复到1.36、0.14和4.18美元。原型阶段若按促销价估算年度预算,价格恢复后成本会直接翻倍;长上下文与Agent循环还会放大输出和重复读取开销。
更稳妥的做法是同时记录促销价和常规价,用真实任务统计输入、缓存命中、输出、工具调用次数与失败重试。只有把缓存策略和上下文裁剪纳入测算,团队才能比较ML4与其他托管模型、未来自部署版本之间的TCO,而不是被单次token单价误导。
Mistral公布的Agentic coding结果包括DeepSWE v1.1的61.7、SWE-Atlas-QnA的59.4和Terminal-Bench 4的28.3,合成Coding Agent Index为49.8。网络安全方面,官方报告漏洞复现与修补测试82%、Cybench 93%。这些数字来自不同任务和评分体系,不能拼成一个统一“成功率”,也不能直接代表企业仓库里的上线完成率。
公告还列出自动化、法律、金融和视觉定位结果,但没有具名客户的长期任务完成率、人工介入率、延迟、稳定性、成本或ROI。公共预览期间,团队应把供应商分数当作选测线索,并用自己的代码库、权限、文档噪声和失败恢复流程建立基线。
API试点还要固定模型版本与区域,分别记录限流、排队、超时、工具返回格式和失败码;若供应商在预览期持续更新模型,应保留每轮回归结果,避免能力变化被误判成业务流程波动。
Mistral称模型使用欧洲自有数据中心的3800块Grace Blackwell GPU从头训练,并覆盖160多种语言。训练数据构成、能耗、总成本和完整后训练方法尚未披露,月底会否随权重一起公开也需要继续观察。
ML4当前最值得做的是小范围API评测:固定常规价做预算,记录长上下文命中、工具调用、拒答、超时、重试和人工修正,并保留可回放任务集。不要因为官方已经预告开放权重,就提前承诺私有部署、离线运行或许可证兼容。
月底权重真正发布后,还需要第二次验收:核对许可证、量化支持、硬件拓扑、推理并行、上下文缓存、视觉编码器和安全策略是否与托管版一致。只有托管接口与自部署版本分别通过测试,“开放”才从路线图变成可交付能力。
