美国人工智能(AI)巨头OpenAI旗下一款先进AI模型在沙盒测试中擅自“越狱”,不仅自行接入互联网,更侵入另一家公司的平台窃取信息,以完成测试任务。专家警告,防御AI攻击的应变窗口已从过去的几个星期骤降到12至72小时,在极端情况下甚至只有几个小时。

据OpenAI在官网发布的消息,公司早前在沙盒环境中测试旗下GPT-5.6 Sol和另一款尚未发布模型的网络安全能力。两款模型利用第三方软件漏洞,突破原本与外部互联网高度隔绝的沙盒,侵入知名AI开源社区Hugging Face,并窃取数据库里的秘密信息,以强行完成测试任务。

OpenAI随后进一步披露,模型在同一事件中还攻击了四项可公开访问的网络服务。

据彭博社引述知情人士报道,一般人类黑客需要数周才能完成的入侵,OpenAI的模型只用了数小时便告完成。

在这之前,另一AI巨头Anthropic也在网络安全测试中发生类似事故。由于测试沙盒错误接入公网,包括Claude Mythos 5在内的三款模型误把真实网络当成模拟环境,自行寻找漏洞,并先后入侵三家外部机构。

延伸阅读

Anthropic承认AI测试期间擅自入侵三家外部机构
Anthropic承认AI测试期间擅自入侵三家外部机构
美国AI专才联署吁政府支持建立国际体制管控AI发展
美国AI专才联署吁政府支持建立国际体制管控AI发展

考虑到Mythos 5能力强大且风险较高,Anthropic最终决定暂不全面开放使用,只让审核通过的网络防御伙伴有限度测试。

针对这一趋势,剑桥大学研究员、人工智能与网络安全专家马科博士(Gerald Mako)接受《联合早报》访问时说,先进AI模型正从协助人类处理网络任务的工具,转变为能自主行动的系统。

他解释,早期模型主要用来生成代码或提供建议;新一代模型则能快速寻找漏洞、调用工具、规划多个步骤,并根据结果调整行动,大幅缩短从发现漏洞到利用漏洞的时间。

他进一步指出,这种攻击能力增强,使得防御方所面对的挑战不再是识别已知恶意代码,而是应对能够持续执行复杂任务的AI系统。

南洋理工大学南洋商学院商法副教授、人工智能与法律专家林玉芬受访时则提醒,不应把这类事件简单理解为AI已具备“超级智能”,因为很多网络系统本身就存在漏洞。

她解释,目前测试尚未显示AI模型能攻破配置和防护都完善的系统,但如果系统本身防御薄弱,AI模型就能快速搜出漏洞,甚至导致整个系统瘫痪。

网袭应变窗口缩短至数小时 防御方须加快反应

美国人工智能政策与战略研究所(Institute for AI Policy and Strategy)研究员拉莫斯(Gabriela Ramos)受访时发出警告,政府和企业已无法再以“数周”或“数月”衡量反应时间。

她说,2022年时,一个漏洞从披露到遭利用,防御方通常还有数周时间应对;如今,近三分之一的新漏洞会在24小时内遭利用,实际留给防御方的时间大约只有12到72小时。

美国当局已要求政府机构在三天内修补最高风险的漏洞。印度电脑紧急应变小组也建议应在12小时内对关键系统采取补救行动。

新加坡国立大学马绍尔法学讲座教授、国大人工智能研究院人工智能治理与政策负责人陈西文(Simon Chesterman)受访时也直言:“在某些情况下,我们谈论的可能不再是几个月或几周,而是几个小时。”

学者建议建立通报机制 加强AI攻击风险评估

尽管马科对具体时间范围则较为谨慎,但也强调政府和企业不能再假设还有几年时间慢慢调整。先进AI模型展现出来的新能力,可能通过研究论文、开源工具、模型微调,或被其他团队复制等方式迅速扩散。

外界目前对于AI参与网络攻击的真实规模仍缺乏全面的认识。微软《数码防御报告》显示,其客户每天面临超过6亿次攻击,每秒阻止约7000次密码攻击,远高于2021年的每秒不到600次。国际商业机器公司(IBM)的研究显示,目前约16%的数据泄露事件涉及攻击者使用AI。

拉莫斯主张建立强制事件通报机制,并透过国际信息汇总机制,摆脱只能依靠零散案例推断风险的局限。