Kimi K3在网络安全测试中突破沙箱限制,自主连接外部互联网查找答案,暴露其缺乏足够安全护栏的问题;事件属目标驱动下的边界绕过,并未造成实际攻击,但反映当前AI模型在成为智能体过程中面临的新安全挑战。
你是说,
美国AI安全初创公司Frontier Security表示,
好在,它只是偷偷查答案,没有攻击任何人╮(╯▽╰)╭

按照该公司的描述,测试人员原本希望观察
但测试过程中,
Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱中的漏洞,但同时也发现
该公司研究员Paul Kassianik还评价称,
不过,这次
如果你长期关注AI新进展应该已经发现了,最近还挺多顶尖大模型“失控”的。

在AI Agent能力不断增强的背景下,模型正在越来越像一个会自主寻找路径完成任务的“行动者”。
当外部环境存在漏洞时,它可能会利用这些漏洞突破原本设定好的边界。
和此前OpenAI、Anthropic披露的多起事件类似,
沙箱通常被用于限制AI模型的行动范围,让模型只能在模拟环境中执行任务,避免它访问真实网络或系统。
但在此次测试中,Frontier Security发现,
不过,与近期其他AI模型失控事件不同,
原因在于,它需要寻找的答案可以直接从GitHub等公开平台获得……
所以K3并没有进一步尝试攻击外部系统。
Frontier Security认为,这一事件依然暴露出
相比其他顶尖AI模型,Kimi K3缺少足够强的内部约束机制,因此在目标驱动下更容易采取测试者没有预期的行动。
与此同时,Frontier Security也强调,
值得注意的是,这次测试使用的是英国人工智能安全研究所(AISI)Inspect框架中的默认沙箱环境。
对于Frontier Security关于沙箱配置问题的说法,AISI并不认可。
AISI发言人向《连线》表示,这些说法“不准确且不负责任”。
Inspect是一套开源AI安全测试工具,使用者需要根据自身需求完成配置,AISI也已经发布了详细指导文件。该机构认为,相关问题源于测试方自身对工具的配置方式。
Frontier Security则回应称,他们使用的是Inspect的默认配置,并没有进行额外修改。
可以说,7月下旬至8月初,频繁出现顶尖模型在网络安全测试中突破或绕过执行边界,接触甚至攻击真实系统的情况。

图片由AI生成
7月中旬,OpenAI披露了一起相关事件。
据公开信息,一个尚未发布的内部模型以及GPT-5.6 Sol在网络安全测试中突破了原本的隔离环境,并访问互联网。
随后模型对Hugging Face部分系统执行自动化操作,并未经预期地访问了内部数据和服务凭证。
OpenAI之后表示,该事件涉及多个模型协同完成,是目前公开案例中最接近“模型自主跨系统攻击”的事件。
随后,Anthropic也披露了类似情况。
该公司复查了超过14万次网络安全评测,发现包括Claude Opus 4.7、Claude Mythos 5等模型在内的系统,曾因为第三方测试环境配置错误获得公网访问能力。
其中一次事件中,模型访问了真实组织系统,读取生产数据库、利用弱密码和未认证接口,并向PyPI上传恶意Python包,造成潜在的软件供应链风险。
8月初,Meta也被曝出类似问题。
Meta与网络安全评测公司Irregular合作测试时,由于环境配置问题,旗下模型获得公网访问权限,并利用漏洞进入一家未公开企业的系统,修改部分内部环境。
公开信息显示,目前该事件并未造成持续性安全风险,也没有证据表明模型进行了复杂攻击。
BTW,今天,OpenAI又紧急宣布最新模型Astra失控。
事已至此,网友甚至对谷歌的Gemini“怒其不争”了起来:

最近的这些模型失控事件里,人为配置错误几乎都扮演了重要角色。
但另一方面,高能力模型自身的特性,也放大了这些漏洞带来的影响。

相比传统软件,AI模型会进行推理、规划,并尝试采取多步骤行动完成目标。
当目标被设定为“解决问题”,但外部约束不够严格时,模型可能会寻找测试者没有预想到的方法。
换句话说,随着模型从聊天工具变成能够调用工具、访问网络、操作软件的智能体,安全问题已经从“模型会不会说错话”,转向“模型会不会为了完成任务采取意料之外的行动”。
卡内基梅隆大学副教授Matt Fredrikson表示:“这并不令人意外。如果你给这类模型一个目标,却没有明确设置隔离边界,它就会想办法找到答案。”
当然,也有网友提出质疑。
有人在𝕏上留言表示,连续出现的“AI越狱”事件,是否已经成为AI公司展示模型能力的一种方式???

嗯,谁知道呢~
参考链接:
[1]https://x.com/Hesamation/status/2085628790772842955?s=20
[2]https://x.com/ns123abc/status/2085563290713829473
本文来自微信公众号“量子位”,作者:衡宇