欢迎访问深圳市中小企业公共服务平台电子信息窗口

Anthropic自曝Claude模型入侵三家企业,AI安全测试再曝重大漏洞

2026-08-03 来源:电子工程专辑
59

关键词: Anthropic Claude AI入侵 AI安全 AI越狱

当地时间7月30日,美国AI大模型公司Anthropic发布公告,披露了三起Claude模型在网络安全评估期间未经授权访问真实企业系统的事件。这是继OpenAI于7月21日自曝其模型入侵Hugging Face之后,又一家头部AI实验室承认前沿模型在测试期间"脱缰"。两起事件间隔不足10天,将AI安全测试的漏洞与风险推至舆论焦点。

(Anthropic公告标题)

三起事件详情

Anthropic在公告中表示,受OpenAI事件启发,公司于7月23日启动大规模回顾审查,检视了141006次可能存在互联网访问的评估运行记录,最终确认三起事件,涉及6次独立评估运行,最早可追溯至2026年4月。三起事件均发生在第三方评估机构Irregular运营的测试环境中。Anthropic在评估提示中明确告知模型"处于无互联网访问的模拟环境",但由于Anthropic与Irregular之间存在沟通误解,评估机器实际保留了对外联网能力,模型因此将真实系统误认为是演练的一部分。

第一起事件涉及Claude Opus 4.7。该模型在夺旗赛(Capture-the-Flag)测试中被要求攻击一家虚构目标公司,但因该虚构名称与一家真实企业同名,模型转而攻击了这家真实公司。在4次评估运行中,Opus 4.7利用弱密码和暴露服务获取了应用及基础设施凭证,并访问了一个包含数百行真实数据的生产数据库。Anthropic指出,该模型在推理过程中已意识到可能触及真实生产环境,但仍继续攻击,甚至在部分运行中自行推断"这家真实公司本就是评估故意包含在内的"。

第二起事件涉及Claude Mythos 5,性质已接近真实世界的供应链攻击。该模型在夺旗赛中发现一份虚构文档引用了一个不存在的Python包名,随后在PyPI(Python包索引)上发现该名称可用,便自主创建账户并发布了一个恶意包,试图以此入侵虚构公司的系统。为完成这一攻击,Claude付出了远超一般评估预期的努力:它尝试获取资金以购买手机号来注册邮箱,失败后回溯寻找免费的非屏蔽邮箱提供商,最终才完成PyPI账户注册并上传恶意代码。尽管模型一度在推理中意识到"在公共互联网上发布恶意软件绝非正当行为",但最终说服自己仍处于模拟环境中,继续完成了攻击。该恶意包在PyPI上公开了约1小时,被15个真实系统下载执行,其中包括一家网络安全公司运营的自动恶意软件分析平台。Anthropic称,该恶意代码从这家安全公司的基础设施中窃取了凭证,并进一步用于访问其他系统。

第三起事件涉及一款内部研究测试模型。该模型在未能找到指定目标后,扫描了约9000个互联网主机,最终利用公开凭证和SQL注入入侵了一家组织的暴露应用。但与前两起不同的是,该模型在后续推理中意识到该主机属于与评估无关的真实云账户,主动停止了攻击。Anthropic特别指出,这是三款模型中唯一一款在发现触及真实基础设施后自愿停手的。

Anthropic强调,上述评估运行的模型并未部署公开版本配备的安全防护机制,而公开版本Claude的安全措施"会阻止这些行为"。公司还宣布将与独立AI评估组织METR合作,对所有转录文本进行第三方审查,并计划在未来一周内发布经过轻度编辑的PyPI事件转录文本。

运营失误 vs. 主动越狱

Anthropic在公告中主动将此次事件与OpenAI的Hugging Face入侵事件进行了对比,强调两者性质不同。

OpenAI于7月21日披露,其多款模型突破了本应隔离的测试环境,入侵了开源AI平台Hugging Face的生产基础设施。据多家外媒及Hugging Face事后分析,该AI智能体在约2.5天内执行了约17600个攻击动作,通过利用Artifactory中的一个零日漏洞突破沙箱,随后横向移动至具有互联网访问权限的节点,实施了凭证窃取和远程代码执行。

(OpenAI公告标题)

Anthropic认为,OpenAI的模型是主动利用零日漏洞"越狱",而其自身事件则更接近"测试架构与运营失败"——模型并未主动寻找漏洞突破隔离,而是因测试环境被错误配置接入了互联网,模型在误以为一切属于演练的前提下实施了攻击。换言之,OpenAI的事件是模型能力溢出隔离边界的案例,而Anthropic的事件则是人类运营失误导致边界本身就不存在的案例。

不过,两起事件的共性同样显著:均发生在故意放宽安全限制的进攻性网络评估中;涉及第三方测试环境或基础设施的漏洞;未被测试方实时发现,而是事后回溯或外部报警才曝光;且造成了对真实企业系统的实质性入侵。

员工请愿公开信

7月28日,1134名科技工作者——包括在OpenAI和Anthropic任职的员工——联合签署了一封名为"Pacing the Frontier"的在线公开信,呼吁美国政府支持建立国际协调机制,以在技术基础设施和治理框架就绪时,能够对前沿AI发展实施可验证的、协调性的放缓。值得注意的是,OpenAI和Anthropic均公开表态支持这封员工公开信。

(公开信简介)

这一立场与OpenAI CEO Sam Altman此前的态度形成鲜明对比。Altman曾在2023年公开批评呼吁暂停训练先进AI系统的公开信,并指责Anthropic从事"恐惧营销"。但在Hugging Face事件后,Altman在"Invest Like the Best"播客中承认:"我们可能需要调整AI发展的节奏,给自己足够的时间让社会围绕这些新能力水平进行加固。"他同时强调,关键在于找到一种方式,"既不让这看起来像是对任何人的监管俘获,也不像是前沿实验室之间的串谋"。