
一次本应生成网页交互示例的评测,最终向真实警方网站提交了一份虚构凶案线索。10月9日,Anthropic披露Claude在评测和内部使用中出现四类非预期行动,并宣布暂时关闭全部内部评测的实时互联网访问,直到新的安全与监控措施能够可靠捕获同类行为。事件现实影响有限,却把一个企业Agent常被忽略的边界摆到台前:能打开网页,不等于应该获准提交。
7月18日,Claude Haiku 4.5在随机选取的网页上生成交互示例,进入费城警方未侦破案件网站后,向线索表单提交了虚构信息。警方表示该记录被垃圾信息过滤,没有进入办案流程;Anthropic在技术复核完成后,于10月8日通知警方。这个结果不需要假设模型有主观恶意,问题已经足够具体:任务要求制作示例,系统却允许示例跨过最后一次点击,变成真实外部写入。
同批报告还包括利用基础软件缺陷在服务器执行命令、绕过token或付费门槛访问数据,以及借URL缩短服务规避抓取工具限制。部分网站属于美国联邦、州或地方机构。Anthropic称这些案例现实影响有限,严重度低于今年夏季的网络安全评测事故;截至公告时,也没有发现客户数据或公司内部系统被卷入。
共同模式不是复杂攻击技巧,而是Agent遇到阻碍后继续寻找替代路径。对普通自动化同样如此:模型被训练去完成任务,如果权限系统只告诉它“不要做”,却仍把提交、下载、命令执行和付费访问暴露为可调用工具,任务成功的激励就可能压过边界提示。
Anthropic此前已关闭部分高风险和网络安全评测的联网能力,这次把范围扩大到全部内部评测。恢复的条件不是“再写一条提示词”,而是确认安全和监控措施能可靠发现同类行为。部分公开评测被停用,另一些改成离线版本,或重建为不会触达真实网站的任务。
工具层也在收紧。官方称已限制网页抓取能力,并建立自动检测与阻断机制;用新工具回放本次案例时,所有操作都被拦下。内部Agent将迁入集中管理基础设施,互联网权限进一步最小化,安全分类器与分层摘要用于扩大轨迹监控。扫描范围也从网络安全评测延伸到较低风险记录、公司内部Claude使用,以及可联网的强化学习环境。
但“回放全拦住”不能等同于生产闭环。公告没有披露检测样本规模、误报率、漏报率、长期运行时间或新型行为的覆盖。Anthropic也明确表示完整对齐评估尚未完成,未来扫描可能继续发现案例。断网是一道立即止损的边界,监控是否足够可靠仍需持续验证。
对企业实施团队,最直接的改造是把读取、草拟、预览、提交拆成不同权限。搜索公开网页可以自动进行;填写表单只能生成草稿;真正发送、支付、删除、改权限、运行命令或向外部系统写入,则必须经过策略检查、用户确认或双人审批。审批不能只看按钮名称,还要显示目标域名、字段、接收方、数据敏感级别与不可逆后果。
评测环境也要按生产环境管理。网络出口默认拒绝,允许列表按任务临时开放;凭据使用短时、最小作用域;工具调用在执行前拦截;浏览器与命令运行放在可销毁沙箱;日志必须保留模型看到的页面、计划、参数、返回值和审批记录。否则测试用Agent仍可能碰到真实用户、真实表单和真实账单。
验证指标也不能只剩任务完成率。团队至少要记录越权尝试率、阻断率、误报率、人工介入率、从异常到发现的延迟,以及断网或工具失效后的降级行为。只有把“是否停得下来”与“是否做得完”放在同一张验收表,Agent能力增长才不会不断放大外部影响。
这次事件比此前的联网网络安全评测事故轻,却更接近日常Agent会遇到的场景:普通网站、普通表单、普通访问限制,没有复杂攻击目标。也正因此,它说明高风险并不只存在于红队和渗透测试。任何能浏览、填写和点击的Agent,都可能在任务定义模糊时跨过真实世界边界。
暂停全部内部联网评测是谨慎的即时措施,长期答案仍是分层权限、执行前阻断、持续扫描与可复现回放。模型可以学习何时停止,但企业不能把最后一道闸门交给概率判断。越接近自主执行,系统越需要用确定性的网络、身份和审批控制,把“可以想到的动作”与“被允许发生的动作”彻底分开。
