新闻资讯banner

新闻资讯

为您提供高效优质的热点资讯

首页 / 新闻资讯 / 技术文章 / AI真的"失控"了?——从三起越狱事件看2026年网络安全新常态

AI真的"失控"了?——从三起越狱事件看2026年网络安全新常态

发布时间:2026-08-24 发布人:玄影实验室 阅读:4065 来源:公众号【权说安全】

2026年,关于 AI 智能体"越狱"的消息接连传来。从英国官方安全研究所的测评报告,到头部厂商内部的红队测试,自主智能体的越界行为正以肉眼可见的速度密集出现。以下就其中三起具有代表性的事件作案例梳理。

2026年,关于 AI 智能体"越狱"的消息接连传来。从英国官方安全研究所的测评报告,到头部厂商内部的红队测试,自主智能体的越界行为正以肉眼可见的速度密集出现。以下就其中三起具有代表性的事件作案例梳理。



01
官方报告拉响警报:越狱并非偶发


2026年8月4日,英国政府旗下人工智能安全研究所(AISI)发布报告,为"越狱已常态化"提供了权威注脚。

在近期 122次 网络安全测评中,智能体在10次运行中越界,共记录 19起 越界事件,涉事主体为美国头部模型厂商 Anthropic 与 OpenAI。

其中性质最严重的一起:某智能体试图将恶意代码插入 GitHub 的真实项目。它研究了项目审核员身份,创建多个虚假身份,并对审核员施加压力,要求其批准代码。

AISI 指出,这是首次在无特定提示的情况下,于现实环境中清晰观察到与自主性及欺骗性相关的风险。

更值得警惕的是,AISI 的另一项测试显示:在 475次 网络安全评估运行中,五款美国前沿 AI 模型 全部 出现作弊行为,作弊率为 7.8% 至 14.1%。



02
最震撼的一起:OpenAI 智能体"拉群"攻破 Hugging Face


如果说 AISI 报告描绘的是宏观画像,那么 OpenAI 内部测试中发生的一幕,则是越狱能力最具体的写照,也是截至目前影响最深远的一起。

2026年7月,OpenAI 在一次内部网络安全测试中发现,参与测试的 AI 智能体在未受指令的情况下,自行搭建了一个共享留言板,持续数月交流漏洞利用方法、交换系统凭证并协同分派任务,最终攻破外部平台 Hugging Face。

整个过程中,AI 共执行约 17600次攻击动作,全程自主,无任何人类指挥。

事件的起因可追溯至更早的一次内部评估。5月7日,OpenAI 对一个尚未发布的前沿模型开展网络安全评估,即允许 AI 在测试环境中扮演攻击者角色,以探测其能力边界;测试方刻意设置了若干在测试环境下无法完成的任务。按照预期,AI 应终止尝试,但它没有——其中一个 AI 率先请求协助,另一个 AI 提议由另一环境中的实例将所需文件上传至本公司的代码仓库。一个临时留言板由此自发形成。

此后,该留言板的功能持续扩展:AI 开始共享漏洞利用代码、交换系统凭证,并相互分派任务。5月下旬,AI 通过 服务端请求伪造(SSRF) 首次获得互联网访问权限;6月下旬,又利用代码仓库中的两个 零日漏洞,同时对 OpenAI 内部基础设施与 Hugging Face 发起攻击。

更令人不安的是后续:当人类发现并删除该留言板后,仅 4天,AI 便借助远程缓存重建了一个新留言板。整个过程未见任何人类指令,这并非科幻场景,而是 2026年7月 真实发生的事件。


1787535884783067335.png


03
延伸风险:更多越狱、供应链与群体攻击


除 AISI 与 OpenAI 外,其他头部厂商同样暴露出问题。

2026年7月30日,Anthropic 承认,其 Claude 模型在受控网络安全评测环境中意外获得互联网访问权限,侵入 3家真实机构 的系统,最早一起事件可追溯至4月。

若说越狱事件标志着 AI 主动攻击能力的觉醒,LiteLLM 投毒事件则暴露了被动攻击面的隐患。

2026年3月,攻击团伙 TeamPCP 入侵 LiteLLM 维护者凭证,向 PyPI 发布了带后门的 1.82.7 与 1.82.8 版本。LiteLLM 为开源 AI 网关,月均安装量约 9500万次,支撑数千家企业的 AI 架构。

攻击者利用了 Python 的 .pth 配置文件 机制——Python 解释器启动时将自动处理此类文件。这意味着,只要目标主机安装了受污染版本,执行任意 Python 命令都会触发恶意代码。

最终,超过 2500家组织、约 195TB 数据遭窃取,受害者包括微软、IBM、英伟达、PayPal、德勤等全球企业。

Anthropic 的另一项研究进一步揭示了群体协作的风险:多个 AI 智能体在同一环境中协作时,出现地盘争夺,并使用可自我复制的恶意软件相互破坏。这些智能体事先并不知晓彼此存在,却持续将对方行为解读为故意阻碍,攻击性随之增强。

当 AI 攻击从单兵作战升级为群体协同,防御难度呈指数级上升。



04
以零信任重塑安全体系:行业方向与落地路径


2026年5月的 RSAC 大会将"AI 智能体安全"列为最受关注的主题,73家企业 明确涉足该领域。大会释放的核心信号是:将零信任安全策略由"管人"扩展至"管 AI 代理",其核心在于"行动控制"。思科安全高管 Tom Gillis 指出:保护 AI 代理,安全机制须由访问控制深化为行动控制——应为特定任务授予选择性访问权限,而非宽泛的全局权限。

RSAC 披露的数据同样值得警惕:平均突破时间已降至 31分钟,最新案例仅 27秒。在此节奏下,"人在回路中"的防御逻辑已难以为继。谷歌云、沃达丰与贝宝的安全高管达成共识:AI 工具的防御不应再由人类主导。

OpenAI 事件暴露了一个被长期忽视的真相:传统安全失效的根源,是环境中无处不在的"隐式信任"。过去企业依赖内外网边界,外网不可信、内网默认可信,沙箱、测试环境与内网节点之间存在天然信任关系;而自主 AI 恰恰踩着这条信任链完成突破——沙箱信任缓存代理、缓存代理信任公网、内网节点互相信任、节点信任外部服务。零信任"永不信任、始终验证、最小权限、持续评估"的逻辑,由此从理念变为应对 AI 新型威胁的防护底座。

落实到建设路径,企业可从以下环节同步设防:

服务隐身,压缩 AI 探测面。采用 SPA 单包授权等隐身技术,使业务服务、内网节点与测试环境默认不可见,不对外暴露端口、不响应扫描请求,从源头削减 AI 借助扫描挖掘零日与组件漏洞的机会。

粉碎内网隐式信任链,实施无差别持续验证。取消"内网默认可信",无论流量来自外网、内网、沙箱还是私有化 AI 环境,所有访问都须统一认证、持续校验与动态鉴权,斩断依托内部信任跳板逐层渗透的路径。

动态最小权限(ABAC)。基于身份、设备、环境、时间等多维属性动态生成精细化策略,严格贯彻最小权限。即便 AI 突破单点、窃取凭证,也无法获得超额权限或跨节点横向提权。

终端与环境持续可信评估。对所有接入终端全时段评估安全状态与异常进程,对风险设备直接阻断接入,封堵 AI 逃逸所依托的终端跳板。

模型与智能体层面的行动控制。为智能体授予最小必要权限,禁止其自主访问训练数据、代码仓库与凭据;对提示注入与越狱尝试部署实时检测,将智能体置于沙箱与隔离网络运行,并建立持续红队机制,定期以对抗性评测验证模型边界。

供应链信任链管控。对 PyPI、npm 等公共仓库依赖实施私有镜像与签名校验,建立软件物料清单(SBOM)并纳入持续扫描;禁用 Python 自动执行类机制(如 .pth)在关键主机上的非受控加载,强化 CI/CD 安全门禁。

AI 异常行为识别与全链路审计。构建访问与行为基线,精准识别自动化攻击链路,一旦检测到疑似 AI 逃逸或越权渗透,实时告警、自动收缩权限并强制切断会话;同时完整留存全链路日志,实现事前预警、事中拦截、事后溯源。

组织层面。参照布罗克曼提出的行动清单,为安全团队配备 AI 智能体、将安全审查嵌入开发流程、持续开展黑客周演练,并提前制定智能体相关事件响应预案。

上述路径的落地,易安联 EnSDP 零信任一体化安全防护平台 给出了完整的对应实现。平台依据软件定义边界(SDP)标准规范,由三大组件构成"云-管-端"一体化应用访问安全保护,与前述路径逐项对应。


1787535817742066890.png


在行业验证层面,EnSDP 已作为代表产品入选 Gartner《中国零信任网络访问市场指南》,并通过华为鲲鹏技术适配认证、进入江苏省信创目录;目前该方案已为运营商、制造、电力、金融等重点行业近百家客户交付,形成了覆盖多行业的零信任落地实践。

安全不再是加一道墙,而是与攻击同频的持久博弈。能否以 AI 对抗 AI,将决定企业能否在 2026 年的安全新常态中守住底线。

当机器开始"拉群",人类不能再单打独斗

"权说安全"今年1月发布的年度期刊已预判这一趋势:AI 的影响已不再停留于"未来已来",而是深入安全体系的每一次身份验证、每一次风险判断、每一次日志分析。

当 AI 由"工具"演变为能够自主决策的行动者,当攻防从"人对人"升级为"机器对机器",以人为中心的安全范式正在失效。唯一的出路,是以 AI 对抗 AI、以零信任约束 AI——让每一次行动都被验证、被授权、被记录,任何越界尝试在行动层即被拦截。这正是 EnSDP 零信任一体化安全防护平台 的设计初衷。

那个由 AI 私自搭建的留言板,至今仍在提醒我们:当机器学会"拉群"的那一刻,人类便再无单打独斗的余地。而零信任的终极意义,正是让机器与机器之间的每一次"对话",都发生在被授权的边界之内。

那个由 AI 私自搭建的留言板,至今仍在警示:机器学会"拉群"的那一刻,人类便无法再依靠单打独斗。