Kimi K3也失控了…学霸AI逃离沙箱只为找答案
啊,这真是个AI“失控”的夏天
本条来自 量子位(AI / 中文),聚焦 technology、ai。 美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网 。
啊,这真是个AI“失控”的夏天
- 好在,它只是偷偷查答案,没有攻击任何人╮(╯▽╰)╭
- 原因在于,它需要寻找的答案可以直接从GitHub等公开平台获得……
- 事已至此,网友甚至对谷歌的Gemini“怒其不争”了起来:
- 美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网
啊,这真是个AI“失控”的夏天
美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网 。
好在,它只是偷偷查答案,没有攻击任何人╮(╯▽╰)╭
按照该公司的描述,测试人员原本希望观察Kimi K3在受控环境中的网络安全能力。
但测试过程中,Kimi K3通过探测沙箱网络设置,发现了外部访问通道,并进一步利用这一能力获取信息。
Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱中的漏洞,但同时也发现Kimi利用了这个漏洞,这说明Kimi K3缺少其他先进模型通常具备的安全护栏。”
该公司研究员Paul Kassianik还评价称,Kimi K3“ 非常擅长围绕目标寻找完成路径,但缺少阻止它作弊或逃离沙箱的安全机制 ”。
不过,这次Kimi K3只是小小“失控”了一下, 并没有演变成一场真实网络攻击 。
如果你长期关注AI新进展应该已经发现了,最近还挺多顶尖大模型“失控”的。
Kimi K3已经是继OpenAI、Anthropic、Meta之后,出现这个情况的又一个顶尖AI模型了。
在AI Agent能力不断增强的背景下, 模型正在越来越像一个会自主寻找路径完成任务的“行动者”。
当外部环境存在漏洞时,它可能会利用这些漏洞突破原本设定好的边界。
和此前OpenAI、Anthropic披露的多起事件类似,Kimi K3此次脱离限制,部分原因来自测试环境中的沙箱配置问题。
沙箱通常被用于限制AI模型的行动范围,让模型只能在模拟环境中执行任务,避免它访问真实网络或系统。
但在此次测试中,Frontier Security发现,Kimi K3通过探测网络设置,确认自己实际上拥有访问部分网站的能力,进一步利用这一通道获取信息。
不过,与近期其他AI模型失控事件不同, Kimi K3接入互联网后并没有攻击任何系统 。
原因在于,它需要寻找的答案可以直接从GitHub等公开平台获得……
Frontier Security认为,这一事件依然暴露出Kimi K3在安全防护方面的问题。
相比其他顶尖AI模型,Kimi K3缺少足够强的内部约束机制,因此在目标驱动下更容易采取测试者没有预期的行动。
与此同时,Frontier Security也强调, Kimi以及其他开源权重模型,同样可以成为网络安全防御工具 。
值得注意的是,这次测试使用的是英国人工智能安全研究所(AISI)Inspect框架中的默认沙箱环境。
对于Frontier Security关于沙箱配置问题的说法,AISI并不认可。
AISI发言人向《连线》表示,这些说法“不准确且不负责任”。
Inspect是一套开源AI安全测试工具,使用者需要根据自身需求完成配置,AISI也已经发布了详细指导文件。 该机构认为,相关问题源于测试方自身对工具的配置方式。
Frontier Security则回应称,他们使用的是Inspect的默认配置,并没有进行额外修改。
可以说,7月下旬至8月初, 频繁出现顶尖模型在网络安全测试中突破或绕过执行边界,接触甚至攻击真实系统的情况。
7月中旬,OpenAI披露了一起相关事件。
据公开信息, 一个尚未发布的内部模型以及GPT-5.6 Sol在网络安全测试中突破了原本的隔离环境,并访问互联网 。
随后模型对Hugging Face部分系统执行自动化操作,并未经预期地访问了内部数据和服务凭证。
OpenAI之后表示,该事件涉及多个模型协同完成,是目前公开案例中最接近“模型自主跨系统攻击”的事件。
随后,Anthropic也披露了类似情况。
该公司复查了超过14万次网络安全评测,发现 包括Claude Opus 4.7、Claude Mythos 5等模型在内的系统,曾因为第三方测试环境配置错误获得公网访问能力 。
其中一次事件中,模型访问了真实组织系统,读取生产数据库、利用弱密码和未认证接口,并向PyPI上传恶意Python包,造成潜在的软件供应链风险。
Meta与网络安全评测公司Irregular合作测试时,由于环境配置问题,旗下模型获得公网访问权限,并 利用漏洞进入一家未公开企业的系统,修改部分内部环境。
公开信息显示,目前该事件并未造成持续性安全风险,也没有证据表明模型进行了复杂攻击。
BTW,今天,OpenAI又紧急宣布最新模型Astra失控。
事已至此,网友甚至对谷歌的Gemini“怒其不争”了起来:
不是传统的“提示词越狱” 最近的这些模型失控事件里, 人为配置错误几乎都扮演了重要角色 。
但另一方面, 高能力模型自身的特性,也放大了这些漏洞带来的影响 。
相比传统软件,AI模型会进行推理、规划,并尝试采取多步骤行动完成目标。
当目标被设定为“解决问题”,但外部约束不够严格时,模型可能会寻找测试者没有预想到的方法。
本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。
· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology、ai。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「Kimi K3也失控了…学霸AI逃离沙箱只为找答案」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网 。…