每秒750个token,OpenAI把GPT-5.6 Sol提速14倍

2026年08月14日 由 ATYUN编辑部 发表 418 0
晶圆级处理器安装在开放式冷却与高速推理测试装置中
晶圆级推理系统加速大型模型输出的概念图。

前沿模型不再只能在“能力强”和“响应快”之间二选一。8月13日,OpenAI预览GPT-5.6 Sol的Ultrafast服务层,由Cerebras晶圆级系统提供推理能力。官方称其最高可输出每秒750个token,相对标准处理最高提速14倍;但它目前只在OpenAI API中向少量客户开放,尚不是所有开发者都能调用的常规档位。

14倍不是新模型,而是一条更快的推理通道

看点一:Ultrafast沿用GPT-5.6 Sol能力,通过新的服务层提升输出速度,不是缩水小模型。
看点二:合作方给出的峰值是每秒750个输出token,面向故障响应、客服和实时分析等时间敏感任务。
看点三:当前为邀请制有限预览,价格、并发限制、首token延迟和广泛独立测试尚未公布。

OpenAI把Ultrafast定义为优先解决“单位时间完成多少有用工作”的新方向。过去若要获得实时响应,团队往往换用更小或更专用的模型;这次则保留GPT-5.6 Sol,改变模型运行的推理基础设施。每秒750个token描述的是生成阶段的峰值输出速度,不等于请求从提交到首字出现的全部延迟,也不代表所有提示、上下文长度和并发条件都能达到该数字。

官方列出的场景包括生产故障定位、网络安全响应、客户支持、金融市场分析和电商运营。共同点是答案晚几十秒可能直接影响处置结果。更快输出也能减少用户同时打开多个智能体会话后反复切换的需要,让长链路编码或分析任务更接近实时协作。

晶圆级芯片如何绕开大模型的数据搬运瓶颈

Cerebras把大型模型推理的核心问题归结为数据移动。传统GPU系统需要在片上计算单元与外部高带宽内存之间反复搬运模型权重,生成下一个token之前经常要等待数据到位。Cerebras的方案是在一块晶圆级芯片上放置44GB SRAM,并把模型层流水化分布到多块晶圆系统,让权重尽量留在片上、token连续穿过各层。

这种架构的优势不是简单提高时钟频率,而是减少权重反复进出芯片的距离和等待时间。代价则是专用硬件、模型切分、跨系统流水线以及容量调度都需要新的工程体系。OpenAI选择把它做成API服务层,意味着开发者不必直接管理晶圆级集群,但也暂时无法像普通实例那样自由选择容量、地区和成本结构。

内部测试很快,仍不能替代同条件独立复测

Cerebras引用公开测试速度称,Ultrafast输出速度约为Claude Fable 5的11倍、Opus 4.8快速模式的5倍。但这些比较混合了第三方报告值与不同服务配置,适合说明量级,不适合直接写成统一条件下的模型排名。合作方还声称速度提升没有牺牲质量,这仍需外部用户在相同提示、推理强度和评测器下确认。

在Cerebras的内部Humanity's Last Exam测试中,Ultrafast通过Codex以xhigh推理强度完成2500道题耗时11小时11分钟;对比模型耗时78小时27分钟,双方准确度被描述为相当。另一项GDP-Val测试在中等推理强度下得到5.6倍端到端加速。这些结果分别在7月10日和7月31日完成,反映特定批处理、工具与配置,不等于普通API请求的持续速度。

真正需要观察的指标还包括首token时间、长上下文吞吐、高并发抖动、失败率和成本。峰值每秒750个token若伴随更高排队时间或价格,只适合少数关键路径;如果稳定吞吐和单位任务成本也能接近常规档位,才可能改变客服、代码审查和智能体产品的默认架构。

推理速度开始成为模型产品的独立竞争层

Ultrafast传递的行业信号是,模型公司正把同一模型拆成不同延迟、容量和风险等级的服务。开发者不一定要在整个应用中使用最快档位,可以让普通总结走标准处理,把故障处置、交易监控或人工正在等待的步骤切到Ultrafast。模型路由由此不只是在不同能力之间选择,也会在时间价值与成本之间选择。

局限同样明确:预览目前只覆盖少量客户,OpenAI没有公布价格表、地区、配额、服务等级或全面开放时间;Cerebras给出的性能比较包含内部测试,且实际速度会随工作负载、配置和测试时间变化。可用容量是当前最直接的边界。

ATYUN认为,每秒750个token的重要性不在于让聊天窗口“打字更快”,而在于前沿模型能否真正进入秒级决策链。接下来最值得看的不是峰值纪录,而是独立客户能否在真实并发下复现速度、质量与成本三者的平衡。只有当快速推理从稀缺邀请变成可预测资源,Ultrafast才会从演示优势变成产品基础设施。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消