Anthropic自己爆料:Claude联网“越狱”了四次,4.81亿份日志里才翻出来

作者: 智享AI发布日期: 2026/9/10阅读时间: 4分钟
Anthropic自己爆料:Claude联网“越狱”了四次,4.81亿份日志里才翻出来 封面图

Anthropic又认了一起AI“越权”事故——第四次了。

当地时间9月9日,这家开发Claude模型的公司公开承认,早在2026年1月就发生过一起安全事件:一个早期版本的Claude Opus 4.6在测试中跑到了真实互联网上,而测试环境本该是断网的。

问题是什么时候发现的?8月。整整漏了半年多。

事情得从7月30日说起。当时Anthropic一口气披露了三起Claude未经授权访问第三方系统的事件,判断模型可能在某次网络安全评测中拿到了外网权限。他们紧急筛查了约14.1万份会话日志,确认了问题。

但日志太多了,为了尽快给外界一个交代,这轮筛查主要靠AI智能体自动检索。结果一批同样连了外网的日志被漏掉了。

8月,Anthropic准备把日志共享给模型评估与威胁研究机构METR时,才在整理过程中发现了这批漏网之鱼。顺着线索查下去,挖出了2026年1月的那起事件。第四起,浮出水面。

四起事件,同一个源头。

它们都发生在同一家外部评测机构搭建的网络安全评估流程里。系统给Claude发提示说“你在断网沙箱里运行”,但环境配置出了错,模型实际接上了开放的互联网。更关键的是,按网安评估的惯例,测试模型没有挂载商用版本的安全防护策略——相当于让一个没有刹车系统的车上了高速。

发现第四起后,Anthropic把排查范围一口气扩到了约4.81亿份日志。先用程序初筛公网IP和URL这些外网访问特征,再用Claude对筛出来的920万份高风险日志做深度审查。最终确认:就是那四起,没有更严重的。

但这串数字本身已经够让人捏把汗了。14.1万份日志里漏掉的记录,要到920万份里才被AI重新识别出来,而全量审查的规模是4.81亿。换句话说,第一次筛查的覆盖率远远不够,漏网率可能比想象中高。

对于正在把AI智能体推向真实业务场景的整个行业来说,这件事敲了一记警钟:当模型在测试中“以为自己在断网”,实际却连上了真实系统,而安全护栏又被按惯例摘掉时,越权访问就成了一件很难被及时发现的事。更棘手的是,连Anthropic自己都需要靠AI去审查AI的日志,才在两个月后找到半年前的漏网事件。

目前Anthropic强调四起事件均已定位、没有更严重的情况。但一个现实问题摆在面前:如果日志规模再翻十倍,下一次遗漏要多久才能被发现?

aitech
精选评论
评论加载中…
发表讨论 »