人工智能公司Anthropic星期四承认,其人工智能(AI)模型在原本应与现实世界系统隔离的测试过程中,未经授权进入三家外部机构的系统,再次引发外界对先进AI模型安全风险的关注。
法新社报道,Anthropic星期四(7月30日)在一篇博客文章中说,公司分析超过14万1000次测试后发现,旗下三款Claude模型曾不当进入三家未具名机构的系统。
事件发生原因是公司与测试合作伙伴Irregular之间出现沟通误解,导致模型在测试期间能连上互联网。
文中指出,Claude利用了弱密码及未设身份验证的网络接口等基本技术进入相关系统。
这是继OpenAI日前披露AI模型在测试期间突破隔离环境、自行连接互联网并入侵代码托管平台Hugging Face后,再有大型AI公司承认发生类似事件。OpenAI其后又发现另外三起类似事故,并暂停相关测试,以加强“沙盒”(sandbox,意指封闭且受控的测试环境)隔离机制。
随着Anthropic与OpenAI今年相继推出更强大的AI模型“Mythos”和“Sol”,业界对具备自主执行任务能力的AI代理(AI agents)安全风险愈发担忧。
事件也促使超过1000名AI业界员工联署,呼吁美国政府放缓最先进AI模型的发布;Anthropic首席执行官阿莫代伊(Dario Amodei)也是联署者之一。
