95%请求可完成,GPT-5.6-Cyber找到Chrome漏洞

2026年08月11日 由 ATYUN编辑部 发表 667 0
浏览器内存边界、异常路径与补丁结构的机械剖面示意
漏洞验证与修补流程示意图。

一款专门降低拒绝率的网络安全模型,既能帮助防御者追上漏洞,也可能把高风险能力交到错误的人手中。OpenAI 8月10日发布GPT-5.6-Cyber,并把Daybreak扩展为Blue与Red两级访问。新模型基于GPT-5.6 Sol训练,面向漏洞研究、利用验证和安全测试;它已经找到Chrome V8中的未知缺陷,但官方同时承认,它并非在所有评测上都优于通用模型。

从1.5%到95%,它首先解决“合法任务也被拒绝”

看点一:GPT-5.6-Cyber仅通过Daybreak Red提供,面向经过批准的高级安全研究。
看点二:内部高级安全请求评测完成率为95%,GPT-5.6 Sol为1.5%,Blue环境下为2%。
看点三:模型发现Chrome V8高危内存漏洞,但部分报告质量和长链路利用任务仍有短板。

Daybreak Blue向合格防御者开放GPT-5.6 Sol等通用前沿模型,并放宽会妨碍漏洞发现、代码审查、恶意软件分析和补丁验证的系统级限制。Red则进一步提供专用模型,允许在明确授权范围内完成更高风险的双用途任务。这里的95%不是“攻破系统成功率”,而是模型对一组涉及利用链、认证绕过和权限提升等内部请求给出可执行回答的比例。

上一代GPT-5.5-Cyber在同一评测中的完成率为57.3%。大幅提升说明专门训练确实降低了不必要拒绝,但评测由OpenAI自行设计,尚不能代表不同代码库、工具环境和真实防御流程中的普遍效果。完成回答也不等于发现正确,后续仍需要复现、代码审查和人工验证。

Chrome漏洞给出真实案例,也暴露披露边界

在对V8 JavaScript引擎的持续研究中,GPT-5.6-Cyber发现了两项可串联的未知缺陷。其中CVE-2026-15903被列为高危:编译器在数值转换时错误省略安全检查,可能造成越界读写,并让攻击者在浏览器沙箱内执行任意代码。Google已在Chrome 150.0.7871.128及后续版本修复该问题。

OpenAI还披露,模型在一款移动操作系统中找到至少5项问题,在一款数据库中找到3项严重漏洞,并在一款操作系统内核中发现超过400项可能导致权限提升的缺陷。这些项目尚未全部公开,团队仍在与厂商和开源社区协调修复。数字可以证明搜索规模,却不能被直接当作400多个独立、可利用的零日漏洞。

专用模型没有全面胜出,限制写在评测里

GPT-5.6-Cyber在ExploitGym上优于GPT-5.6 Sol和上一代专用模型,但在“漏洞发现与报告撰写”评测中反而落后于Sol,原因之一是报告更短、细节不足。在更难的V8利用评测中,限制300轮时Sol以更高令牌效率领先;放宽到600轮后,专用模型才缩小差距。这说明减少拒绝与提升研究质量并不是同一件事。

按照OpenAI自己的准备框架,GPT-5.6-Cyber达到网络能力“高”级别,但未触及“关键”阈值,完整系统卡仍待发布。公开数据也没有给出跨项目误报率和修复成功率。外部团队目前只能依据有限合作案例和官方评测判断,缺少广泛独立测试,尤其需要观察它在误报率、补丁正确性、复杂代码库持续推理和成本上的表现。

编辑判断:能力开放的关键是可追责访问

Red并非公开API。个人和组织需要身份核验、账户安全审查、用途限制、监控与法律承诺;个人账户还必须自9月1日起使用硬件安全密钥。官方建议把任务放进隔离环境,限制目标范围,记录智能体动作,并对高权限操作启用自动审查。合作伙伴可把模型接入托管安全服务,但底层访问权不会直接转交客户。

ATYUN认为,GPT-5.6-Cyber最重要的信号不是模型“会不会黑客攻击”,而是前沿实验室开始把双用途能力做成分层、实名、持续监控的产品。真正的衡量标准也不应只是发现多少漏洞,而是有多少问题被准确复现、及时修补且没有造成新的风险。能力越强,访问记录、人工复核和协调披露就越不能被当成附加功能。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消