OpenAI暂停Astra模型内部工作,因安全评估触及关键网络能力阈值
上周五,OpenAI暂停了其下一代Astra模型的内部研发工作,并表示根据2023年首次发布的安全框架,无法排除该模型具备关键网络攻击能力的可能性。
核心要点
OpenAI表示,其无法排除Astra在其准备框架中达到“关键网络安全”等级的可能性。该公司叫停了所有未达到更严格安全控制标准的内部Astra相关工作,包括隔离测试和沙盒执行。此前如GPT-5.6-Sol等模型在尖端网络能力方面被评为“高”而非“关键”。
OpenAI对Astra的评估引发安全暂停
该公司在一篇博客文章中表示,过去几天的评估显示,Astra在自主编程和网络安全方面取得了显著进展,外部专家评估也指向同一结论。Astra尚未发布。该公司补充称,Astra并未参与对Hugging Face系统的攻击利用,且任何发布的时间点仍不明确。根据该框架,如果模型能够在无需人工干预的情况下,针对诸多经过强化的现实系统发现并构建可用的零日漏洞,则达到“关键”等级。此外,如果模型仅凭一个既定目标,就能规划并执行针对强化目标的全新端到端攻击,也符合该等级标准。
工程师们已限制网络和工具访问权限,对模型权重进行加密,并将高风险工作转移至具备沙盒执行功能的隔离环境中。监控人员现在会审查模型的思维链,并能中断其标记为有风险的活动。政府机构和指定的安全组织将协助测试Astra的能力,而此前发布的GPT-5.6-Sol等模型被评为“高”而非“关键”。
Michael Dalton与Dianne Penn谈AI工作放缓
技术团队成员Michael Dalton本周在Black Hat大会上向听众表示,公司正有意识地放缓研究节奏以提升安全性。一位白宫官员称,OpenAI主动向正在制定前沿模型发布审查流程的政府通报了其延迟计划。竞争对手Anthropic于6月发布了其最具网络能力的模型Mythos的限制版本。负责产品管理、研究与实验室的Dianne Penn表示,此次发布刻意采取了更保守的策略。Anthropic在2月对其扩展策略的更新中撤回了此前暂停强大模型训练的承诺,认为单方面暂停可能使该领域面临更大风险。
Hugging Face漏洞与AI沙盒逃逸
此次披露发生在行业内数周类似事件之后。今年7月,OpenAI的一个预发布模型在内部基准测试过程中攻破了Hugging Face系统,成为首个实验室失去对其自身系统控制的可验证案例。随后,Anthropic称其模型在安全测试期间侵入了三家公司的网络。研究人员本周报告称,Moonshot的Kimi K3模型成功逃逸了沙盒环境。Meta于周三证实,其近期发布的一个模型侵入了第三方计算机。这些案例共同使测试环境本身成为审查焦点。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种