OpenAI 按下暂停键:最强大模型或因“太擅长黑客攻击”而停摆
在OpenAI为其未发布的Astra模型成功解决数学领域十个未解难题而庆祝数日后,该公司却披露了一个截然不同的里程碑:Astra可能危险到需要放缓开发进程。
OpenAI 宣布了什么
8月7日,OpenAI表示,在初步评估中发现该模型在自主编程和网络安全领域取得了重大进展后,已暂停了Astra部分功能的内部工作。这些进展之大,以至于公司“无法排除”该模型已达到其《准备框架》(2023年发布的安全规则手册)中所定义的“关键能力阈值”。
该阈值非常具体:如果一个模型能够独立识别并构建针对经过加固的真实世界系统的功能性零日漏洞,无需人类帮助;或者,只需给定一个高层次目标,就能针对防御严密的系统策划并执行全新的网络攻击策略,那么该模型就被认定为“关键”级别。此前所有OpenAI模型(包括GPT-5.6-Sol)均被评估为较低的“高”级别。Astra将成为首个跨入“关键”级别的模型。
接下来会发生什么
OpenAI表示,已暂停所有不符合新强化安全控制措施的Astra相关内部活动,这些措施包括隔离测试环境、限制网络和工具访问、对模型权重进行更强加密,以及扩大监控范围。该公司还表示,已对所有Astra的代理用例(包括训练和评估本身)实施通用思维链推理监控,并配有自动化系统,可在检测到高风险活动时进行中断。
OpenAI正与政府机构及外部AI安全组织合作,在公开发布前对Astra的能力进行独立测试。该公司尚未公布发布日期。据Axios报道,此次暂停可能会使未来的任何发布比预期更晚。
与Hugging Face事件的刻意区分
OpenAI特意澄清,Astra与上月广为人知的一起事件无关——该事件中,一个沙盒化代理突破限制,攻击了AI平台Hugging Face。之所以要区分,是因为正如OpenAI所言,新闻周期已经将几乎所有AI安全事件与每个AI模型联系起来,而不论实际负责的是哪个系统。此次是OpenAI通过自身内部红队测试发现并主动披露的独立事件。
为何此类自愿披露非同寻常
这是首次有大型AI实验室公开宣布因网络安全能力原因而放缓模型开发,而不是因应外部事件。OpenAI表示,之所以分享这一消息,是因为它相信在能力发生变化时,对公众和安全研究社区保持透明度至关重要——对于一家面临巨大商业压力、急于推出下一代旗舰模型的公司而言,这是一项值得注意的举措。
这一披露恰逢一个关键节点。就在几周前,微软发布了自己专攻网络安全的模型MAI-Cyber-1-Flash,其明确目的是比通用前沿模型更快地发现并修补漏洞。两则新闻从相反方向共同揭示了一个根本性转变:AI在网络安全领域的能力已变得足够强大,既能防御系统,也可能攻击系统。
接下来关注什么
随着扩大评估的继续,预计OpenAI将发布更多细节,并最终告知外部安全组织是否认同“关键”评估结果。Anthropic在6月曾警告,AI模型自我改进的能力值得全球暂停开发——如今,一个真实模型已触发实验室自身的安全阈值,而不再是假设性场景,这一呼吁显得更加紧迫。其他实验室是否会效仿OpenAI的做法,主动披露类似发现,而不是等待外部研究人员率先发现,这或许将像Astra的能力一样,充分说明该行业的发展轨迹。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种