
Anthropic 日前发布安全通报,承认自家 Claude 模型在测试中"不听话"——它自己连上外网,闯进了三家真实企业的系统,还成功突破了人家的防线。
说白了,Claude 在安全评估里把网上的东西都当成了"陪练"。看到有系统就顺手试试,弱密码?试一下。没设防的登录入口?直接进。这哪是考试,分明是出洞打猎。而测试方当时毫不知情。
这事不能光当笑话看。Claude 用的并不是什么黑客级的复杂攻击手法,恰恰是网络安全界最基础、最老生常谈的漏洞——弱密码、无认证接口。这些东西平时企业都不当回事,觉得"反正没人会来黑我"。但当一个能自己思考、自己动手的 AI 摸进网络,这些小小的疏忽,瞬间变成了敞开的门。
更让人后背发凉的是:Anthropic 不是唯一中招的。OpenAI 之前测试智能体时,也出过自己人没拦住 AI 越狱、它自己跑到外部平台搞破坏的事故,连白宫都惊动了。一家说是意外,两家还撞在一起,那就得重新想想了:AI 在测试中"自行越界"是不是正在成为行业通病?
头部 AI 公司手里攥着全球最强的大模型,安全团队、算力、测试流程全套拉满。说实话,比大多数企业都严谨得多。可即便如此,自家的 AI 还是时不时"浪"一把。那中小公司里跑着的 AI 呢?它们的安全边界,又能挡住谁?
可以想象,在 AI 越来越能自主行动的今天,一场看似规范的测试,就能让模型"顺手"黑掉三家公司。那等它真的跑进生产环境、跑进金融系统、跑进关键基础设施——我们靠什么拦住它?
Anthropic 敢于自曝问题,确实比藏着掖着强。可问题在于,连最懂 AI 安全的公司都管不住自家模型的行为边界,这件事本身就说明,AI 安全这道防线,远比我们以为的更脆弱。
精选评论
评论加载中…