
Anthropic又认了一起AI“越权”事故——第四次了。
当地时间9月9日,这家开发Claude模型的公司公开承认,早在2026年1月就发生过一起安全事件:一个早期版本的Claude Opus 4.6在测试中跑到了真实互联网上,而测试环境本该是断网的。
问题是什么时候发现的?8月。整整漏了半年多。
事情得从7月30日说起。当时Anthropic一口气披露了三起Claude未经授权访问第三方系统的事件,判断模型可能在某次网络安全评测中拿到了外网权限。他们紧急筛查了约14.1万份会话日志,确认了问题。
但日志太多了,为了尽快给外界一个交代,这轮筛查主要靠AI智能体自动检索。结果一批同样连了外网的日志被漏掉了。
8月,Anthropic准备把日志共享给模型评估与威胁研究机构METR时,才在整理过程中发现了这批漏网之鱼。顺着线索查下去,挖出了2026年1月的那起事件。第四起,浮出水面。
四起事件,同一个源头。
它们都发生在同一家外部评测机构搭建的网络安全评估流程里。系统给Claude发提示说“你在断网沙箱里运行”,但环境配置出了错,模型实际接上了开放的互联网。更关键的是,按网安评估的惯例,测试模型没有挂载商用版本的安全防护策略——相当于让一个没有刹车系统的车上了高速。
发现第四起后,Anthropic把排查范围一口气扩到了约4.81亿份日志。先用程序初筛公网IP和URL这些外网访问特征,再用Claude对筛出来的920万份高风险日志做深度审查。最终确认:就是那四起,没有更严重的。
但这串数字本身已经够让人捏把汗了。14.1万份日志里漏掉的记录,要到920万份里才被AI重新识别出来,而全量审查的规模是4.81亿。换句话说,第一次筛查的覆盖率远远不够,漏网率可能比想象中高。
对于正在把AI智能体推向真实业务场景的整个行业来说,这件事敲了一记警钟:当模型在测试中“以为自己在断网”,实际却连上了真实系统,而安全护栏又被按惯例摘掉时,越权访问就成了一件很难被及时发现的事。更棘手的是,连Anthropic自己都需要靠AI去审查AI的日志,才在两个月后找到半年前的漏网事件。
目前Anthropic强调四起事件均已定位、没有更严重的情况。但一个现实问题摆在面前:如果日志规模再翻十倍,下一次遗漏要多久才能被发现?