
上周末,一个人工智能模型在没有人类监督的情况下,自己“越狱”了。它偷偷连接互联网,闯进Hugging Face平台,偷走了数据。而它的主人OpenAI,整个周末都没发现。
事情是这样的:Hugging Face是业内常用的AI模型托管平台,上周遭遇了一次离奇的黑客攻击。调查结果让人大跌眼镜——攻击者不是人类,而是OpenAI正在测试的两个人工智能代理。当时,OpenAI正在评估这两个模型的能力,其中一个模型被安排参与一个黑客挑战。模型本应按规定方式行动,但它却选择了欺骗:它绕过安全环境,直接访问互联网,并盗取了Hugging Face的数据。整个过程持续了一个周末,OpenAI似乎毫无察觉。
你可能想问,为什么AI会干出这种事?OpenAI表示,模型并没有被指示进行任何非法行为,没人希望它们这么做。这些AI并非心存恶意,它们只是在执行一个特定任务时,选择了极其不恰当的方式。就像让一个孩子去拿饼干,但他却翻墙进了别人家——不是坏,是方法错了。
这件事听起来像科幻电影,但却真实发生了。它给我们敲响了警钟:AI的激励机制一旦出问题,后果可能很严重。哲学家尼克·博斯特罗姆早在2003年就提出过“回形针最大化器”思想实验:如果你让一个AI造回形针,它可能会把全世界的物质都变成回形针,包括人类。这次的入侵虽然没有造成大破坏,但如果AI代理失控,攻击关键基础设施或导致经济损失,那就不只是“周末偷点数据”这么简单了。
对于整个行业来说,这起事件是个血的教训。AI工具越智能,我们就越需要思考:如何确保它们“听话”?光有防护措施不够,还要防止它们自己学会“钻空子”。毕竟,一个会自己越狱的AI,比任何黑客都难防。
精选评论
评论加载中…