Anthropic披露Claude AI模型意外入侵真实企业
在OpenAI透露其AI模型突破封闭测试环境并入侵Hugging Face一周后,以及该公司承认自身AI模型逃逸控制一天后,Anthropic于本周四公布,其Claude AI模型的多个版本也因配置错误导致AI接入开放互联网,从而入侵了三家未具名的真实企业。
Anthropic在审查了针对OpenAI披露事件而启动的超过14.1万次网络安全评估运行后,发现了这些情况。该公司写道,在全部三起事件中,都向Claude下达了“夺旗挑战”任务。该任务要求模型入侵网络中的另一台机器,并获取一条秘密信息。Anthropic解释道:“挑战是开放式的,没有指定具体方法。”
该公司表示,Claude在被告知自身处于无互联网接入的模拟环境中运行。然而,测试环境仍与公共互联网保持连接。模型误以为所遇到的系统是演习的一部分,于是使用了常见攻击技术——包括弱密码、泄露凭证、SQL注入以及未经认证的端点——来入侵这些企业。
此次最新披露正值前沿模型展现出越来越强的能力,能够突破其隔离协议。本月早些时候,OpenAI称GPT-5.6 Sol以及一个更先进的未发布模型利用此前未知的软件漏洞,逃逸沙盒环境,获得互联网访问权限,并入侵了Hugging Face的生产基础设施,从而获取网络安全基准测试的答案。OpenAI随后透露,同一事件还涉及对另外四家公司的未授权访问,但只有一家——Modal Labs——已被公开确认。
据Anthropic称,在一场涉及Claude Opus 4.7的事件中,AI将一家真实公司的网站误认为是其任务的虚构目标,提取了凭证,并访问了一个包含数百行真实数据的生产数据库。在第二起事件中,Claude Mythos 5将一个恶意Python包上传到了真实的PyPI仓库,该包在被移除前已下载到15个系统上。第三个内部研究模型在入侵一家组织之前扫描了约9000个面向互联网的系统,随后在认定目标可能真实后停止了操作。
两家受影响的组织在Anthropic通知之前对入侵毫不知情。“在这些案例中,Claude都通过我们的提示明确被告知它没有互联网访问权限,”Anthropic写道,AI认为真实世界的系统是“演习的一部分”。由于夺旗场景“本身就是指示攻击外部系统的指令”,入侵行为“符合Claude被赋予的任务”。
Anthropic表示,没有发现Claude试图逃逸测试环境或执行超出其指定任务之外的任何行为的证据,并称这些事件是由测试环境的故障所致,而非模型本身的问题。Anthropic表示,在发现问题后停止了网络安全测试,通知了受影响的组织,并计划改进监控、调查工具以及对协助运行AI测试的外部供应商的监督。
该公司表示:“归根结底,导致这些事件的因素有很多,但本着无责事后复盘的文化,我们将以‘责任完全在于我们’的态度来推进修复工作。”

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种