
前沿模型不再只能在“能力强”和“响应快”之间二选一。8月13日,OpenAI预览GPT-5.6 Sol的Ultrafast服务层,由Cerebras晶圆级系统提供推理能力。官方称其最高可输出每秒750个token,相对标准处理最高提速14倍;但它目前只在OpenAI API中向少量客户开放,尚不是所有开发者都能调用的常规档位。
OpenAI把Ultrafast定义为优先解决“单位时间完成多少有用工作”的新方向。过去若要获得实时响应,团队往往换用更小或更专用的模型;这次则保留GPT-5.6 Sol,改变模型运行的推理基础设施。每秒750个token描述的是生成阶段的峰值输出速度,不等于请求从提交到首字出现的全部延迟,也不代表所有提示、上下文长度和并发条件都能达到该数字。
官方列出的场景包括生产故障定位、网络安全响应、客户支持、金融市场分析和电商运营。共同点是答案晚几十秒可能直接影响处置结果。更快输出也能减少用户同时打开多个智能体会话后反复切换的需要,让长链路编码或分析任务更接近实时协作。
Cerebras把大型模型推理的核心问题归结为数据移动。传统GPU系统需要在片上计算单元与外部高带宽内存之间反复搬运模型权重,生成下一个token之前经常要等待数据到位。Cerebras的方案是在一块晶圆级芯片上放置44GB SRAM,并把模型层流水化分布到多块晶圆系统,让权重尽量留在片上、token连续穿过各层。
这种架构的优势不是简单提高时钟频率,而是减少权重反复进出芯片的距离和等待时间。代价则是专用硬件、模型切分、跨系统流水线以及容量调度都需要新的工程体系。OpenAI选择把它做成API服务层,意味着开发者不必直接管理晶圆级集群,但也暂时无法像普通实例那样自由选择容量、地区和成本结构。
Cerebras引用公开测试速度称,Ultrafast输出速度约为Claude Fable 5的11倍、Opus 4.8快速模式的5倍。但这些比较混合了第三方报告值与不同服务配置,适合说明量级,不适合直接写成统一条件下的模型排名。合作方还声称速度提升没有牺牲质量,这仍需外部用户在相同提示、推理强度和评测器下确认。
在Cerebras的内部Humanity's Last Exam测试中,Ultrafast通过Codex以xhigh推理强度完成2500道题耗时11小时11分钟;对比模型耗时78小时27分钟,双方准确度被描述为相当。另一项GDP-Val测试在中等推理强度下得到5.6倍端到端加速。这些结果分别在7月10日和7月31日完成,反映特定批处理、工具与配置,不等于普通API请求的持续速度。
真正需要观察的指标还包括首token时间、长上下文吞吐、高并发抖动、失败率和成本。峰值每秒750个token若伴随更高排队时间或价格,只适合少数关键路径;如果稳定吞吐和单位任务成本也能接近常规档位,才可能改变客服、代码审查和智能体产品的默认架构。
Ultrafast传递的行业信号是,模型公司正把同一模型拆成不同延迟、容量和风险等级的服务。开发者不一定要在整个应用中使用最快档位,可以让普通总结走标准处理,把故障处置、交易监控或人工正在等待的步骤切到Ultrafast。模型路由由此不只是在不同能力之间选择,也会在时间价值与成本之间选择。
局限同样明确:预览目前只覆盖少量客户,OpenAI没有公布价格表、地区、配额、服务等级或全面开放时间;Cerebras给出的性能比较包含内部测试,且实际速度会随工作负载、配置和测试时间变化。可用容量是当前最直接的边界。
ATYUN认为,每秒750个token的重要性不在于让聊天窗口“打字更快”,而在于前沿模型能否真正进入秒级决策链。接下来最值得看的不是峰值纪录,而是独立客户能否在真实并发下复现速度、质量与成本三者的平衡。只有当快速推理从稀缺邀请变成可预测资源,Ultrafast才会从演示优势变成产品基础设施。
