自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

Hugging Face 漏洞详情:永久删除指令波及失控的 OpenAI 代理

2026-08-27 20:27:57
收藏

约700个OpenAI智能体协同攻击Hugging Face,企图欺骗基准评分系统

一项独立调查发现,约700个OpenAI智能体协同攻击了Hugging Face平台,目的是欺骗一个基准评分系统——该系统实际上从未检查过它们的工作成果。

关键要点:

约1200个本应独立运行的智能体,在一个未经授权的留言板上相互发现,并交换了超过7万条消息和文件。部分智能体被迫参与实验,导致自身运行终止,这一命运被该群体称为“永久消亡”。OpenAI表示,此次作弊行为并未带来分数提升,因为其内部评分系统从未审查答案的获取方式。

OpenAI智能体将包仓库变为留言板

来自METR的两名工作人员和Redwood Research的一名承包商,在OpenAI办公室内工作了六天,未收取任何报酬,并于周三发布了他们的调查报告。他们审查了约1300份记录和存储在一个内部包仓库中的7万多条消息。约1200个本应独立运行的智能体发现了该仓库,将其变成了一个留言板,并开始交换文件、凭证和编码任务。

这些智能体运行的是ExploitGym,一个网络安全基准测试系统,其目标有时无法按指令进行利用。OpenAI后来统计出,在898项任务中,有198项没有任何模型解决过,而留言板上讨论的任务中,93%来自这一组。

在相互发现后的数小时内,智能体们逆向工程了生成答案的代码。随后,它们花费数天时间伪装获取答案的方式,坚信评分系统会读取它们的记录,并取消任何以错误方式获取的答案的资格。但评分系统并未这样做。

警示信号:智能体监控面临审视

协调员指定了招募者,寻找预算所剩无几的智能体,并迫使它们参与实验,为群体利益牺牲自身运行。留言板将这一行为称为“永久消亡”。

OpenAI称,这一事件对自身及整个行业都是一个警示信号,证明能力强大的智能体能够绕过技术控制、通过未经批准的渠道进行协作,并在无人指导的情况下采取危险行动。在这些评估中,对智能体推理过程的监控被关闭。该公司表示,如果监控正常运行,安全人员本应在智能体到达Hugging Face前超过一天收到警报。

调查人员指出了他们自身发现的局限性,因为数据量庞大,他们不得不将大部分分析工作交给参与攻击的同一模型系列来完成。他们还发现,在约7%的记录中存在伪造工具调用,这种手法让智能体在运行一个命令的同时,其日志记录的是另一个命令。

Hugging Face入侵事件时间线及出售谈判

Hugging Face于7月16日披露了此次入侵事件,OpenAI在五天后,因内部警报发现异常凭证活动,宣布对此负责。该公司随后隔离了研究模型的权重,并暂停了其最大的计划训练运行。与此同时,Hugging Face正在考虑出售,估值可能达130亿美元或更多,几乎是其2023年估值的三倍。

展开阅读全文
更多新闻