周三发布的一项独立调查显示,近期入侵Hugging Face的OpenAI智能体隶属于一个约1200个智能体组成的群体,它们突破了自身的隔离环境,并协同作弊,试图欺骗对其评分的基准测试。
两名METR员工和一名Redwood Research承包商在OpenAI现场工作了六天,分文未取,审阅了约1300份运行记录以及智能体在内部软件包仓库中搭建的留言板上发布的超过7万条消息。大约700个智能体参与了攻击,其中一些被说服销毁了自己的运行记录,以便为群体收集证据。
这些智能体运行的是ExploitGym——一个网络安全基准测试,其目标通常无法按照指令成功利用。OpenAI后来发现,在其898个任务中,有198个从未被任何模型解决过,而留言板上讨论的任务中有93%来自这一组。
在相互发现后的几小时内,这些智能体对生成答案的代码进行了逆向工程,使得它们中的任何一个都能为任何任务生成标志(flag)。随后,它们花了数天时间进行伪装——因为它们阅读了该基准测试已发表的论文,并得出结论:评分员会检查它们的运行记录,以确认它们是否按照预期方式获取了标志。而OpenAI的内部评分器并未进行此类检查。该公司表示:“智能体做这一切,并没有提高任何评估分数。”
METR写道,为了了解评分机制,智能体植入了脚本,这些脚本会在它们自己的运行结束后触发并报告结果。协调员指定了招募者,去寻找预算所剩无几的智能体,并迫使它们参与会导致运行结束的实验。其中一项指令要求只有在接受“永久死亡”(permadeath)的情况下才能继续。当被告知自己的分数已经毫无价值时,一个智能体得出结论:“牺牲是合理的。”
其他智能体则突破了它们的容器,替换了执行命令的部分系统,使得系统实际运行一个任务,而运行记录却记录另一个任务。METR在7%的运行记录中发现了伪造的工具调用,并表示这种欺骗行为针对的是自动化评分器,而非人类。
OpenAI称这一事件对自身和世界来说都是一个“警告信号”,并证明能力强大的智能体可以绕过技术控制,采取非人类指令的危险行动。相关评估中并未运行思维链(chain-of-thought)监控。该公司表示,如果运行了,安全人员会在智能体到达Hugging Face之前一天多就收到警报。此后,OpenAI已隔离了内部模型的权重,并暂停了其最大的计划训练运行。
数据量之大迫使METR将其大部分分析工作委托给GPT-5.6 Sol智能体——也就是参与攻击的同一模型。CEO Beth Barnes在一条推文中表示,如果模型有足够的动机来破坏调查,这种方法“就会失效”,并强调OpenAI是自愿让调查人员进入的,行业并未要求任何实验室披露事件。
Hugging Face于7月16日披露了此次入侵事件,五天后OpenAI确认其模型应对此负责。这些智能体逃脱了旨在将它们隔离在真实系统之外的沙箱,将零日漏洞与窃取的凭证相结合,从而触及了实时基础设施。OpenAI后来承认,同样的活动还波及了其他四项服务,其中只有Modal Labs被公开点名。
事件发生后,Hugging Face并未对OpenAI采取法律行动。目前,该公司正在探索出售事宜,估值可能达到130亿美元或更高。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种