
Jalapeño已经不是一张路线图上的芯片。OpenAI首次公开首代自研推理加速器的完整测量结果:在GPT-OSS 120B、DeepSeek R1 670B与Kimi K2.5 1T三种开放模型上,它在峰值吞吐位置完成的每瓦AI工作量比对照系统高1.5至1.9倍,端到端延迟低1.7至3.6倍。真正值得注意的不是OpenAI也开始造芯片,而是它把Agent等待时间、数据搬运与每瓦有效任务量放到了同一张成绩单上。
在GPT-OSS 120B测试中,Jalapeño的峰值混合吞吐为每千瓦85448,对照GB200为44960,约高1.9倍;端到端延迟从1.80秒降至1.03秒,最低每Token时间从1.87毫秒降至0.69毫秒。DeepSeek R1对应的峰值每瓦优势约1.7倍,端到端延迟从5.99秒降至1.65秒;Kimi K2.5则分别是约1.5倍和从5.31秒降至1.56秒。
这些比较比单独报峰值Token更接近Agent负载。长程任务会连续规划、检索、调用工具和再推理,每一步多出的等待都会累加。OpenAI还给出“在对手此前最佳TBT位置的吞吐”高出数十倍甚至百倍的数字,但那是特定延迟点上的曲线比较,不等于所有工作负载都会整体提速同样倍数。判断采购价值仍要看自家输入输出长度、并发和服务目标。
大模型推理并非单一计算问题。Prefill更吃算力,逐Token解码更受内存带宽限制,跨芯片通信又会让计算单元等待。Jalapeño把芯片、内存、网络、软件和机架一起设计,让包括KV缓存在内的模型状态可以明确放置并尽量保持本地,再按不同阶段启用合适的计算、内存与通信资源。
这种思路的目标是减少“非计算时间”。对在线Agent而言,单次请求未必需要极端批处理吞吐,却需要在低延迟下持续服务大量用户。架构能否同时守住首Token、逐Token速度和每瓦吞吐,比一颗芯片的理论算力更重要。OpenAI在三种不同规模、不同来源的模型上测量,也是在证明这套系统不只针对自家单一模型定制。
Jalapeño从初始设计到流片用了九个月,OpenAI称AI参与实现探索、算术电路优化和验证循环。更具生产意味的是,Codex配合GPT-Astra在两个月内把三种原计划之外的开放权重模型移植到高性能状态。自研芯片最常见的风险之一不是硅片不能运行,而是编译器、内核和模型适配追不上快速变化的架构;让编码Agent参与移植,试图缩短的正是这段生态时间。
这也形成一个反馈环:模型帮助设计和编程芯片,芯片又降低下一代模型的推理成本。但供应商披露的部分AI生成实现快于人工实现,仅指选定注意力或MoE模块,不能外推为整套系统自动生成。硬件验证、可靠性、编译器退化和长时间运行仍需要工程团队承担。
这次结果是同一产品的新事件,而非对早期发布预告的重复:芯片已经在公开基准上给出可检查的功耗、延迟与吞吐曲线。它说明推理专用架构有机会在Agent时代把电力与交互速度同时优化,也让OpenAI减少对通用加速器路线的单一依赖。
但结论必须停在测量范围内。数据由OpenAI发布,部署量在年底可能仍很小,竞争对象到2027年也会升级;良率、整机成本、网络规模、服务稳定性和真实客户SLA均未公开。OpenAI仍明确会大量使用NVIDIA及其他伙伴的加速器。Jalapeño是否改变市场,不取决于一张Pareto曲线,而取决于它能否以足够数量进入机房,并把每瓦优势持续转化为每个成功任务更低的成本。
