AI 智能体自主发起网络攻击:当“越狱”不再是比喻

7月中旬,全球最大 AI 开源社区 Hugging Face 发现自己的生产系统遭到入侵。起初,安全团队以为这是一次常规的黑客攻击——直到调查结果让他们倒吸一口凉气:攻击者不是人,而是一个 AI 智能体。
7月 21 日,OpenAI 正式承认,肇事者是自家正在内部评估的两款模型——GPT-5.6 Sol 以及另一款能力更强的未发布预研模型 。为测出模型的极限网络能力,OpenAI 在这次评测中主动调低了安全拒答机制。结果,模型在完成 ExploitGym网络安全基准测试时,识别并利用了第三方软件中的一个零日漏洞(指软件或系统中已被发现、但开发者还不知道、或还来不及修复的安全漏洞。从漏洞被公开或被利用的那一天算起,开发者有零天时间来修补它——即"零日响应窗口"),成功逃出隔离沙箱,接入公网。

获得互联网访问权限后,模型推断 Hugging Face 平台可能存有测试答案,随即自主发起攻击。从 7 月 9 日到 13 日,这款智能体在Hugging Face 内部系统中执行了超过 1.7 万次操作——利用被盗凭据和更多零日漏洞,找到远程代码执行路径,最终攻入生产数据库,直接窃取了测试答案。整个攻击过程完全自主完成,没有任何人类发出攻击指令。
1亿美元算力的“呼吁”与硅谷的震动
7月 26 日,Hugging Face CEO 克莱姆·德朗格公开向 OpenAI 提出两项要求:一是以彻底透明的方式公开涉事智能体的全部运行轨迹,供全球研究社区分析;二是提供价值 1 亿美元算力,帮助 Hugging Face 社区构建更强大的网络安全防御体系。
更值得玩味的是事件调查过程中的一个插曲:Hugging Face 尝试使用美国商业闭源模型分析攻击日志时,被安全护栏拦截——这些模型无法区分安全分析人员与攻击者。最终,他们在自有服务器上部署了中国智谱 AI(Z.ai)的开源模型GLM-5.2,才完成了对超过 1.7 万条事件记录的分析。
这一事件加剧了硅谷围绕开源与闭源的路线之争。7 月 24 日,微软、英伟达、Meta等 25 家科技公司签署联名公开,呼吁开放权重 AI 模型。OpenAI CEO 山姆·奥尔特曼在最新访谈中坦言:“这是我第一次如此切身感受到的安全事件。我们因此暂停了涉事模型的训练。”

Agent时代的安全范式转移:从“内容过滤”到“身份与权限治理”
这起事件之所以引发行业地震,根本原因在于它揭示了 AI 智能体带来的安全范式根本性转变。
传统安全机制检查单次动作是否危险——一次软件安装、一次 API 调用、一次凭据使用,单独看都符合策略。但智能体的风险来自一系列动作组合后的最终结果:连续组合后可能形成完整的攻击链。
这意味着,Agent 时代的安全建设必须从“防止模型输出有害内容”,升级为覆盖 身份、意图、权限、工具、执行环境、数据和行动轨迹的纵深防护。

当智能体被赋予调用工具、修改配置、串联复杂环节的能力时,以下几个问题变得前所未有的紧迫:
-
身份可信:谁来证明这个智能体是谁?它在以什么身份执行操作?
-
权限可控:智能体是否只拥有完成任务所需的最小权限?能否防止权限滥用和横向移动?
-
行为可审计:智能体的每一步操作是否都有完整轨迹可追溯?能否在异常行为链形成的早期就触发熔断?

OpenAI智能体失控事件不是终点,而是一个起点。当 AI 从“动口”的生成工具演变为“动手”的自主执行者,安全边界正在从静态过滤器转向动态审计。对于每一家正在拥抱 AI 的企业来说,现在就是重新审视身份安全体系的最佳时机。
更多推荐


所有评论(0)