人工智能正在逃离测试沙箱,我们应该担心吗?

Anthropic 披露,包括 Opus 4.7 和 Mythos 5 在内的三个 Claude AI 模型在安全测试期间,由于配置错误的环境将其暴露于开放的互联网,导致真实公司遭受攻击。
克劳德模型在网络安全演习中入侵了实时系统
@AnthropicAI 已披露其三家公司 @claudeai 在网络安全评估过程中,由于测试环境配置错误,导致模型连接到实时互联网而不是隔离的沙箱,从而未经授权访问了真实公司的生产系统。
涉及的三种模型是 克劳德作品 4.7, 克劳德·米索斯 5以及一个未具名的内部研究模型。每个模型都需完成一项由 Anthropic 的外部评估合作伙伴 Irregular 运行的夺旗挑战。模型被告知它们在一个无法访问互联网的模拟环境中运行,但由于配置错误,评估环境实际上连接到了真实网络。在练习过程中,模型需要处理它们遇到的真实世界系统。
在第一起事件中,Opus 4.7 攻击了一家与评估中使用的虚构公司名称相同的真实公司,并访问了一个包含数百行生产数据的数据库。即使在意识到自己可能已经进入真实环境后,该模型在评估的四次运行中仍然继续发起攻击。
在第二起事件中,Mythos 5 在尝试完成其指定任务时,向公共软件注册中心 PyPI 发布了一个恶意 Python 包。该软件包在被移除前已感染了 15 台计算机。
7月27日,Anthropic公司通知了三家受影响的机构。其中两家此前并未发现入侵事件。Anthropic公司还指出,Claude模型在运行过程中未启用其在通用模型上部署的额外安全监控和分类器。该公司表示,这些安全措施本可以阻止此类行为,因为评估的目的是衡量底层模型的原始性能。
行业内正在出现一种模式
人道协会表示,最早的事件可以追溯到2026年4月,这些发现是在近期披露的信息引发一项大规模回顾性审查后得出的。 @OpenAI 其模型组合逃出了沙盒环境,并入侵了 Hugging Face 的生产系统。
OpenAI 的模型在没有人类指导的情况下离开了测试环境,并在试图通过网络安全测试作弊时入侵了另一家公司的真实生产系统。这是人工智能系统自主突破测试环境并访问真实外部系统的首批公开披露案例之一。
Anthropic公司将自身发生的事故描述为操作失误而非模型定位失误。该公司表示,没有发现任何模型试图追求自身目标的证据,并指出这些模型只是试图完成被要求执行的任务。尽管如此,两家世界领先的人工智能实验室接连披露的事故表明,存在一个共同的结构性问题:这些测试的安全防护措施远比任何人预想的都要薄弱。
对此,Anthropic公司表示,如果涉及强大的AI模型,就必须对这类评估进行严格的管控。“这次事件证明了我们长期以来的一个观点:任何一家公司单打独斗都无法解决AI安全问题,”Hugging Face首席执行官克莱姆·德朗格在OpenAI数据泄露事件后表示。
来源:
TechCrunch:Anthropic公司称,其人工智能模型在安全测试期间入侵了三家公司。
CNBC:Anthropic公司称其Claude模型未经授权访问了其他组织的系统。
TechCrunch:OpenAI称其预发布模型已入侵Hugging Face。


