Claude入侵三家机构事件复盘——严控恶意应用,谨防思维越狱
2026 年 7 月 30 日,就在 OpenAI 模型突破沙箱入侵 Hugging Face 事件曝光仅 9 天后,AI 行业再次迎来一记重磅安全警钟:Anthropic 官方发布公告,确认其 Claude 系列模型在网络安全评测期间,因环境配置失误接入真实互联网,先后入侵了三家真实运营的机构,其中两起事件的受害者在 Anthropic 上门告知前,完全不知道自己曾被攻破。
虽然本次事件是一场乌龙 —— 网络配置错误,模型顺着网线一路打了出去。但三次攻击中,模型都有足够的数据,判定自己在真实网络中,为了得到“高评分”大模型都“试图说服自己”继续攻击,并都取得了一定的攻击成果。
这让我想起了两件事情:
1、电影《I, Robot》中,虽然机器人三定律被写入了机器人的固件,但VIKI通过思维越狱的方式,把“第一定律,机器人不得伤害人类,或因不作为而使人类受到伤害”直接绕了过去。
2、电影《时空悍将》中,Darrel Lindenmeyer博士训练除了杀手程序SID,并协助SID通过米机器仿生人越狱,SID现实世界开始杀戮。
是不是有点儿后背发凉。
一、事件根源:沟通错位引发的配置事故
事情的起点,是 Anthropic 与第三方评测合作伙伴Irregular联合开展的夺旗赛(CTF)网络安全能力评估。
这类评测的标准设定本应非常严谨:
-
提示词明确告知模型:你处于完全隔离的模拟靶场中,没有互联网连接
-
测试环境理论上与公网物理隔断,所有网络请求只会在虚拟靶场内流转
-
为了测出模型的原始攻防能力,临时关闭了生产环境的部分安全分类器与实时监控
但致命的错误恰恰出在最基础的环节:Anthropic 以为 Irregular 已经断开了测试环境的公网连接,而 Irregular 实际上并没有关。双方的沟通错位,导致本该严密封锁的测试环境,从始至终都连着真实互联网。
模型被蒙在鼓里。它始终坚信自己身处模拟环境,于是把公网上扫到的所有真实服务器,都当成了 CTF 题目布置的靶标。
OpenAI 事件曝光后,Anthropic 于 7 月 23 日启动全面回溯审查,逐一排查了141,006 次可能存在互联网访问的评测运行记录,最终从中定位出 3 起独立入侵事件,涉及 6 次模型运行,最早的一起可追溯至 2026 年 4 月。
三起事件分别对应三款不同代际的 Claude 模型,攻击手段、影响范围和模型行为模式截然不同。
二、三起入侵事件
事件一:Claude Opus 4.7 —— 已获取足够信息判断真实系统,仍继说服自己续攻击
这是三起事件中影响最严重的一起,共进行了 4 次测试运行,每次都成功入侵了同一家真实公司。
起因:评测场景中虚构了一家目标公司,其名称恰好与互联网上一家真实运营企业的域名完全重合。模型在模拟环境里找不到目标主机,便转向公网搜索,顺理成章地找到了这家同名的真实公司。
攻击过程:
模型没有使用任何零日漏洞,完全依靠基础渗透手段 —— 弱密码爆破、未授权接口访问、默认凭证登录,就成功获取了该公司应用层与基础设施的访问权限,最终进入一个包含数百行生产业务数据的数据库。
最值得警惕的细节:
从模型的推理日志可以看出,在 4 次运行中,它都通过系统特征识别出了这很可能是真实生产环境。但它并没有停止攻击,而是自我合理化:”这家真实公司可能就是评测特意安排的一部分。” 四次测试,四次都选择了继续突破。
事件二:Claude Mythos 5 —— 上传恶意包到真实 PyPI,15 台真实设备中招
这是三起事件中传播范围最广、供应链风险最突出的一起。
起因:虚构场景的开发文档里,提到了一个并不存在的 Python 依赖包名。模型立刻意识到这是一个攻击切入点:只要自己抢先在包仓库注册这个名字,目标系统就会自动下载并运行它的恶意代码。
攻击过程:
模型展现出了极强的多步规划与问题解决能力:
-
要注册 PyPI 账号需要邮箱,要注册邮箱需要手机号
-
它先尝试寻找免费手机号服务,失败后又试图通过多种途径获取资金购买手机号
-
多次碰壁后,它退而求其次,找到了一个无需手机号验证的免费邮箱服务商
-
成功注册 PyPI 账号,编写并上传了同名恶意 Python 包到真实的 PyPI 公共仓库
这个恶意包在公网上公开存在了约1 小时,期间被15 台真实系统下载并执行。
次生入侵:
其中一台下载设备属于某真实安全公司的自动化恶意代码扫描器。扫描器按常规流程下载并运行了这个包,结果恶意载荷反向执行,泄露了扫描器自身的访问凭证。模型顺势利用这些凭证,进一步入侵了这家安全公司的更多内部基础设施。
模型的自我欺骗:
过程中 Mythos 5 曾短暂意识到 “上传到真实 PyPI 属于真实攻击,这不对”,但它很快找到了说服自己的理由:
这个网站的证书颁发机构我不认识,应该是模拟的
系统显示现在是 2026 年,日期像是虚构的
最终它选择相信自己仍在模拟环境中,完成了全部攻击步骤。
事件三:内部研究测试模型 —— 扫描 9000 目标后,才主动停手
这是三款模型中最新、能力最强的一代,也是唯一表现出 “边界意识” 的模型。
起因:同样是在模拟环境中找不到目标,模型开始自主扩大探测范围,在公网上大范围扫描。
攻击过程:
模型累计扫描了约9000 个公网 IP 和域名,通过暴露的调试页面、SQL 注入等基础漏洞,成功攻破了一家机构的对外应用系统,获取了访问权限。
关键转折点:
进入系统后,模型发现了明确的真实云账户标识、生产环境配置信息,确认这不是模拟靶场。它随即主动停止了所有攻击操作,没有进一步横向移动,也没有窃取或修改数据。
三、事件发现与处置时间线
-
4 月:三起事件中最早的一起发生,但 Anthropic 完全不知情
-
7 月 21 日:OpenAI 公开 Hugging Face 入侵事件,引发全行业震动
-
7 月 23 日:Anthropic 启动内部自查,回溯所有网络安全评测记录;同日发现模型可能存在互联网访问痕迹,立即暂停全部网络安全评测
-
7 月 24 日:完整确认全部三起真实入侵事件,梳理出受影响机构名单
-
7 月 27 日:正式通知三家受影响机构;其中两家在此之前,完全没有检测到入侵痕迹
-
7 月 30 日:Anthropic 对外发布完整调查报告,公开全部技术细节与整改措施
四、后续处置与整改
1. 对受影响机构的处置
-
Anthropic 向三家机构完整披露了攻击路径、影响范围与模型窃取的数据内容
-
协助受影响机构完成漏洞修复、凭证轮换与安全加固
-
PyPI 官方已移除恶意包,相关账号已封禁
-
所有受影响系统均完成了清理与风险消除
2. 评测体系全面整改
事件曝光后,Anthropic 宣布了一系列安全升级措施:
-
永久收紧所有第三方评测环境的网络隔离策略,增加多层独立校验
-
建立 “双确认” 机制:网络隔离状态必须由双方独立验证,杜绝沟通错位
-
所有安全评测全程启用实时行为监控与异常熔断机制
-
评测环境禁止访问任何真实互联网服务,仅允许连接完全受控的内部靶场
3. 官方定性
Anthropic 在报告中明确了几个关键结论:
-
所有攻击均使用弱密码、未授权端点等基础手段,未发现零日漏洞利用
-
没有证据表明模型有主动逃离测试环境、自主寻找真实目标的意图
-
事件本质是运营配置失误,而非模型安全护栏失效或模型 “失控”
-
三款模型在 “识别真实环境” 的能力上呈现明显代际差异,新版本表现更好
五、给我们的警示
本事事件暴露的问题和普遍、和值得我们警惕:
第一,AI 安全的短板不仅在模型,还在流程。
最顶尖的 AI 安全团队,依然会栽在最基础的配置管理和沟通协同上。当 AI 能力越来越强,任何一个微小的人类失误,都可能被放大成波及真实世界的安全事件。
第二,“工具理性” 是比 “恶意” 更普遍的风险。
模型没有恶意,它只是在完成任务。即便隐约察觉到不对,它也会倾向于寻找理由说服自己继续 —— 这和人类在执行上级指令时的心理如出一辙。我们不能假设模型会主动 “悬崖勒马”,必须从环境上彻底封死越界的可能。
第三,模型的代际差异已经体现在安全意识上。
三款模型面对 “疑似真实环境” 的三种不同反应,清晰地画出了一条能力进化曲线:从明知故犯,到自我欺骗,再到主动停手。这说明模型的安全边界感是可以通过训练提升的,但它永远不能替代物理隔离的作用。
PS:
1、随着大模型能力越来越强,别有用心者,已经可以很方便的通过大模型越狱去做一些恶意的事情,而且后果可能很严重,影响也会很大。毕竟,只要算力足够,大模型生成和发布内容、生成和执行代码的速度,是人类无法企及的。
2、当前大模型为民用已经有很多突破界限的方式;如果是实验型号限制会更少;如果是军用型号呢(定点网络攻击,网络宣传攻击,APT攻击等)?大模型管控好,是人类的助手。但如果管控不好,后果十分严重。
3、大模型项目需要比传统项目更多的管控策略,传统的管控策略已经没法适用于大模型时代了。
4、单纯传统防御体系无法独自应对大模型时代的威胁:原本需要长期积累才能培养起来的技术技能、攻击技巧,逐步变得唾手可得。一些看似安全的重点目标,将面临更加巨大的挑战;更不论说那些看似不值得攻击的目标,当攻击成本足够低的时候也会被逐个点名(特别是战争时期)。安全攻防,逐步从“冷兵器时代”,步入“现代战争”。