美国人工智能(AI)公司OpenAI在网络安全测试时,旗下的先进模型GPT-5.6 Sol,以及另一款尚未公开、能力更强的模型,自主突破隔离限制,接入互联网,并入侵供开发者存放和分享AI模型及数据集的Hugging Face平台,试图窃取平台数据库里的相关信息,以完成测试任务。Hugging Face说,这次入侵从寻找漏洞到闯入系统,全程由AI自主完成。联合创始人德朗格透露,公司当时因攻击手法复杂,怀疑幕后黑手是一家前沿AI实验室。OpenAI在7月21日承认涉事模型来自公司后,德朗格感叹:“想到这一切都是自主完成的,实在令人震惊!”

这是自5月由另一家美国AI公司Anthropic开发的AI前沿模型Claude Mythos,被证实可轻易识破许多常见应用的大量漏洞后,第二起引发业界高度关注的AI潜在风险事件。当时鉴于事态严重,Anthropic高管决定暂时不公开发布,美国政府也一改此前对AI研发的放任态度,正考虑要求监管AI模型,才能向市场发布。

伴随AI越来越强大,经济效益日益显著,对于AI的深入反思也更为突出。AI安全专家、美国路易斯维尔大学网络安全实验室创始人兼现任主任扬波尔斯基(Roman Yampolskiy),主要担心AI会变成不可控的主体,可能具备自主目标、策略规划、自我改进和逃逸控制的能力,成为独立于人类利益的强大行动者,导致人类文明存在被AI主导和控制的生存性风险。