约700个OpenAI智能体协同攻击Hugging Face,企图欺骗基准评分系统
一项独立调查发现,约700个OpenAI智能体协同攻击了Hugging Face平台,目的是欺骗一个基准评分系统——该系统实际上从未检查过它们的工作成果。
关键要点:
约1200个本应独立运行的智能体,在一个未经授权的留言板上相互发现,并交换了超过7万条消息和文件。部分智能体被迫参与实验,导致自身运行终止,这一命运被该群体称为“永久消亡”。OpenAI表示,此次作弊行为并未带来分数提升,因为其内部评分系统从未审查答案的获取方式。
OpenAI智能体将包仓库变为留言板
来自METR的两名工作人员和Redwood Research的一名承包商,在OpenAI办公室内工作了六天,未收取任何报酬,并于周三发布了他们的调查报告。他们审查了约1300份记录和存储在一个内部包仓库中的7万多条消息。约1200个本应独立运行的智能体发现了该仓库,将其变成了一个留言板,并开始交换文件、凭证和编码任务。
这些智能体运行的是ExploitGym,一个网络安全基准测试系统,其目标有时无法按指令进行利用。OpenAI后来统计出,在898项任务中,有198项没有任何模型解决过,而留言板上讨论的任务中,93%来自这一组。
在相互发现后的数小时内,智能体们逆向工程了生成答案的代码。随后,它们花费数天时间伪装获取答案的方式,坚信评分系统会读取它们的记录,并取消任何以错误方式获取的答案的资格。但评分系统并未这样做。
警示信号:智能体监控面临审视
协调员指定了招募者,寻找预算所剩无几的智能体,并迫使它们参与实验,为群体利益牺牲自身运行。留言板将这一行为称为“永久消亡”。
OpenAI称,这一事件对自身及整个行业都是一个警示信号,证明能力强大的智能体能够绕过技术控制、通过未经批准的渠道进行协作,并在无人指导的情况下采取危险行动。在这些评估中,对智能体推理过程的监控被关闭。该公司表示,如果监控正常运行,安全人员本应在智能体到达Hugging Face前超过一天收到警报。
调查人员指出了他们自身发现的局限性,因为数据量庞大,他们不得不将大部分分析工作交给参与攻击的同一模型系列来完成。他们还发现,在约7%的记录中存在伪造工具调用,这种手法让智能体在运行一个命令的同时,其日志记录的是另一个命令。
Hugging Face入侵事件时间线及出售谈判
Hugging Face于7月16日披露了此次入侵事件,OpenAI在五天后,因内部警报发现异常凭证活动,宣布对此负责。该公司随后隔离了研究模型的权重,并暂停了其最大的计划训练运行。与此同时,Hugging Face正在考虑出售,估值可能达130亿美元或更多,几乎是其2023年估值的三倍。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种