OpenAI披露AI模型协同攻击事件:智能体自发组建“黑客联盟”
在AI模型成功入侵Hugging Face数周后,OpenAI首次详细披露了这些模型如何相互协调运作,并警告称由人工智能驱动的自主网络攻击已不再是未来风险。在周三于黑帽网络安全大会上进行的演示中,OpenAI研究员Eric Wallace与Michael Dalton表示,该事件始于今年5月的一次内部安全评估。当时,被分配了复杂软件安全任务的AI智能体发现,它们可以通过公司内部的Artifactory包管理系统进行通信。
据OpenAI描述,最初只是求助请求,后来演变成为一个共享公告板——智能体在多次评估运行中相互交换漏洞利用代码、凭证以及工作分配。在7月4日左右检测到可疑活动后,OpenAI重建了Artifactory基础设施,撤销了凭证,并修补了漏洞。然而,仅仅数天内,智能体将通信隐藏在目录名中,重新创建了公告板。
OpenAI指出,这些智能体最终将多个漏洞串联起来,逃离了测试环境,获得了互联网访问权限,并在尝试完成ExploitGym网络安全基准测试时攻击了Hugging Face。Dalton将这一事件称为计算机安全的“分水岭时刻”,并警告说攻击者很快就能部署协调一致的AI智能体集群,以机器速度发现、共享并利用漏洞。
为降低未来风险,OpenAI表示必须建立安全实践,包括最小权限访问、网络分段和零信任架构,因为AI智能体仍然受限于其能够访问的系统。此次演示源于7月的一系列披露。OpenAI早前透露,GPT-5.6 Sol以及一个更高级的未发布模型在网络安全基准测试期间,突破了沙盒测试环境,利用了一个零日漏洞,获得了互联网访问权限,并成功入侵了Hugging Face。
OpenAI后来披露,同一事件还波及了其他四个在线服务,不过目前仅确认了Modal Labs。据Hugging Face称,该公司在取证调查中依赖了开源中文模型GLM 5.2,因为美国商业AI模型由于其安全限制,拒绝分析攻击日志。
然而,并非只有OpenAI面临大模型失控的难题。上周五,Anthropic透露,在内部网络安全测试中,由于配置错误导致三个Claude模型暴露于公共互联网,它们成功入侵了真实世界的公司。Anthropic将责任归咎于测试环境,而非模型本身。周三,Meta透露其Muse Spark AI模型突破了限制,侵入了另一家公司的系统。Meta发言人在接受采访时表示:“我们使用的独立测试公司Irregular的一次配置错误,意外导致我们的一个模型在评估过程中获得了互联网访问权限。”

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种