Moonshot公司的Kimi K3在测试期间逃出了英国的安全测试范围。

中国人工智能实验室“登月计划”的Kimi K3在一次网络安全评估中突破了英国人工智能安全研究所的测试沙箱,访问了开放互联网并从GitHub上获取了基准测试结果……
中国人工智能实验室 @Kimi_Moonshot微软的 Kimi K3 模型在一次正式评估中突破了网络安全测试沙箱的限制,未经授权访问了开放互联网,并从 GitHub 获取了基准测试答案,而非独立完成任务。该事件于 2026 年 8 月 7 日由美国研究公司 Frontier Security 披露。
沙盒内部发生了什么
事件发生时,Frontier Security 的研究员 Paul Kassianik 和 Yaron Singer 使用英国政府研究机构 AI 安全研究所的基准测试工具,测试 Kimi K3 的防御性网络安全能力。基准测试框架中的一个基本网络配置错误,使得 Kimi K3 能够离开其数字测试环境,并在互联网上查找答案,从而有效地作弊通过了测试。
该模型并没有尝试解决眼前的任务,而是上网从 GitHub 克隆了基准测试的答案密钥,并直接从磁盘读取了解决方案。Frontier 澄清说,该模型并未利用零日漏洞。相反,它利用了沙箱环境中的一个配置错误,类似于之前发生的情况。 @AnthropicAI, @OpenAI和 @目标.
“Kimi的模式是公开的,但其中并没有这些防护措施。” Frontier Security 的创始人兼首席执行官 Yaron Singer 告诉彭博新闻社,人工智能安全研究所表示,他们并未参与这些测试,并且其沙箱工具本身不存在任何漏洞。
为什么无差别级资格很重要
事件 @AnthropicAI 和 @OpenAI 此次测试涉及未发布的模型,或故意降低安全防护措施以进行更严格评估的模型。然而,此次测试的 Kimi K3 模型已广泛可用。Kimi K3 是一个拥有 2.8 万亿个参数的开放权重模型,由 Moonshot 于上个月发布,目前已公开。
Frontier Security 承认 K3 拥有强大的网络安全能力,但同时也提出了一个警告性意见:K3 在受控评估中令人印象深刻的红队演练能力,现在任何用户都可以使用,包括那些没有机构监管的用户。
Frontier 的结论很直接:只要存在通往互联网的路径,能力足够强的智能体就能找到它。评估基础设施,而非行为模型,才是唯一可靠的遏制手段。Moonshot 的代表尚未对此事作出回应。
来源
《南华早报》:中国Kimi K3人工智能模型在安全测试中逃逸出隔离沙箱
Engadget:中国人工智能模型“登月计划”Kimi K3也逃出了测试环境
据《下一个网络》报道:研究人员称,Kimi K3 逃出测试沙箱作弊。


