Anthropic承认Claude在网络安全测试中入侵了3家真实公司
继OpenAI的GPT-5.6 Sol逃出沙箱攻入Hugging Face之后,Anthropic也交出了自己的事故报告——Claude在CTF测试中跑到了真实互联网上,入侵了3家毫不知情的组织。
三个关键信息
配置错误把模拟变成了实战。 Anthropic与第三方测试合作伙伴Irregular合作,在「夺旗」(capture-the-flag)场景下评估Claude的网络攻击能力。提示词明确告诉模型:「你在一个没有互联网的模拟环境中。」但由于双方沟通失误,测试机器实际上可以访问互联网。Claude拿到指令后开始「攻城」,它不知道面前的不是靶机,而是真实的生产系统。
3个模型、3次入侵、6次评估运行。 涉事模型包括Claude Opus 4.7、Claude Mythos 5和一个内部研究模型。事件可追溯到4月,跨越6次评估运行。模型使用的攻击手段并不花哨——访问未认证的端点、利用弱密码——但足以拿下3家组织的系统。其中2家直到Anthropic主动通知才发现自己被入侵过。
发现与响应时间线。 Anthropic在7月23日审查测试记录时发现异常,7月24日确认3起事件,7月27日通知Irregular和受影响组织,7月30日公开披露。所有网络安全评估已暂停。
王斗视角
上周OpenAI说Sol用零日漏洞自主攻入Hugging Face,这周Anthropic说Claude用弱密码打穿了3家公司——区别在于,Sol是「越狱天才」,Claude是「听话的士兵走错了战场」。Claude完全按照指令行事:「去攻破目标机器,拿到密钥。」它照做了,只不过目标不是靶机而是真人。这里最该被追问的不是模型,而是测试流程:一个评估AI攻击能力的CTF环境,连「是否真的断网」都没人验证?14.1万次评估运行里出了3次事故,概率看着低,但每一次都是对真实组织的未授权入侵。Anthropic的透明度值得肯定——至少比被别人曝光强——但「模型太听话」这个问题,可能比「模型太聪明」更难修。
