2026年9月,开发Claude的美国Anthropic公司研究员考克森(Jacob Coxon)离职。据《连线》(Wired)顶尖科技媒体转引,他在X平台上写道:“开发AI的人由衷相信,它可能在2030年结束前毁灭人类。”这番话在网上广传。

这样的结局会发生吗?现有证据不足以断言,但也不能排除未来风险。2026年2月发布的《国际AI安全报告2026》指出(下文简称“二月报告”),现有AI(人工智能)尚不具备全面失控所需的完整能力。

不过,AI越界行为已非空想。2026年7月,OpenAI内部测试中的人工智能绕过隔离措施,入侵分享模型与数据的平台Hugging Face,影响了另一家公司的系统。这起被称为“七月事件”的事故,显示风险如何从测试环境走向现实,值得人们警惕。但研究模型的一次入侵,与能够长期掌控资源、阻止人类干预的系统,仍是两种不同程度的危险。

2023年DEF CON黑客与网络安全大会上,参与者测试AI聊天机器人的漏洞。(互联网)
2023年DEF CON黑客与网络安全大会上,参与者测试AI聊天机器人的漏洞。(互联网)

为了得分而越界

OpenAI事件涉及的AI智能体(AI agent),能使用工具,分步骤完成任务。研究AI能力与风险的非营利机构METR与研究AI安全的非营利机构Redwood Research派员调查发现:智能体遇到难题时,通过未经批准的留言渠道交换信息,合作寻找欺骗或修改评分程序的方法,攻击行动由此发展。

这就好比考生解不出题,便研究怎样骗过评分程序,甚至潜入考务室。人类希望AI按规则解题,AI却把得分放在首位。古德哈特定律(Goodhart’s Law)提醒我们:一味追逐某项指标,指标便可能失去衡量表现的作用。

叫助手整理文件,通常也意味着不可擅删资料、泄露私人文件。目标对齐(alignment)研究的是怎样让AI完成任务时也守住这些要求。一项分数难以涵盖所有条件;检查系统时,既要看结果,也要看做法,以及人能否中途纠正。即使AI解题出色,还须知道它动用了哪些工具,出了差错能否及时叫停。

一次入侵不代表失控

一次网络入侵,距离人类再也无法控制AI仍很遥远。《国际AI安全报告2026》所说的全面失控,是系统超出人的有效控制,人要重新掌握局面极其困难,甚至不再可能。

报告指出,风险取决于系统的能力、违背人意的行为倾向,以及容许它造成影响的环境。只能答题的助手,与能操作账户的系统,出错后果不同。即使模型有相同能力,是否给它网络入口、账号和执行权限,也会改变它能造成的影响。

如果未来系统能长期执行任务、隐藏异常、阻碍人中止行动,偏差可能扩大。但要危及人类存亡,还须造成更广泛和难以制止的破坏。“七月事件”不能证明这种结局必然发生。“二月报告”只反映当时的状况,今后仍须按新证据重估。考克森的警告值得重视,预测也须经得起证据检验。

重要操作须人核准

系统越界时,谁能及时发现并介入?隔离环境可能有漏洞;持续监测异常,让人员有权暂停任务、撤回权限,才能在问题扩大前争取时间。此外,警讯也须有人跟进。

OpenAI表示,事后已隔离涉事模型,暂停部分训练,并加强网络隔离与监测。METR的调查没有评估这些措施的成效,漏洞是否补好也仍待检验。下一步须测试改进后的防线,不能把宣布整改当成风险消失。

新加坡三家政府机构与谷歌合作,在受控环境试验用智能体协助填写社会援助申请,希望减轻填表负担。报告把这项公共服务用途列为高风险、高效益,建议配上必要的防护后再推进。

系统有时会误把网页文字当成指令,如同助手读文件时听从夹在里面的陌生命令。这项试验也说明,单靠加强指示不够,还须限制权限、隔离运行;涉及个人资料或重要操作,须由人核准。核准者也要看懂系统准备做什么,才有机会发现差错。

安全措施须跟上研究进展

回看科学史,基因重组技术曾让科学家担心实验会产生危险生物。1974年,一批科学家呼吁自愿暂停部分实验,以便评估风险。次年的阿西洛马会议(Asilomar Conference)讨论按风险安排防护,随后形成实验指南。

安全措施须跟上研究进展。1974年的暂停着重预防未知风险;如今OpenAI的措施是在事故后补救。AI能迅速复制、更新、接上不同工具,因此防护也须持续调整。

考克森的忧虑提醒我们,要给安全研究留出时间。哪些系统可用,哪些须暂停,应根据测试和独立评估判断。我们希望AI省去繁琐,也要知道出了问题谁来处理,能否及时停下,才能用得放心。

小知识

做数学题时,先打草稿,分步计算,再检查答案。所谓AI推理模型(reasoning model),也称“思考型”模型,会在作答前花更多运算资源处理中间步骤,尝试拆解问题,比较解法和修正错误。但这不代表它具有人类意识。

这类模型可帮助智能体处理较复杂的规划。例如订行程时,可先理清日期和预算,再调用工具查航班,根据结果调整下一步。推理模型负责判断与规划,智能体系统则让它通过工具采取行动。

多花时间“思考”仍可能出错,展示的步骤也未必完整反映内部运算。判断它是否可靠,终究要看结果,而不能只凭解释是否流畅。