自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

Astra在OpenAI最严格的网络基准测试中取得完美100%得分

2026-09-04 13:36:11
收藏

OpenAI 发布 GPT-6 Astra:首个被认定为“关键网络安全风险”的模型

周四,OpenAI 开始逐步推出 GPT-6 Astra。在 ExploitBench 基准测试中取得满分 100% 的成绩后,该模型成为该公司首个被标记为对网络风险具有“关键性”级别的模型。

核心要点

OpenAI 于周四发布了 GPT-6 Astra,首先面向其“Daybreak”计划中经过审核的安全防御人员开放,随后将在数天内向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放访问权限。

该模型在 ExploitBench 上获得 100% 的得分,在 ARC-AGI-3 上获得 98.6% 的得分,相比之下,前代模型 GPT-5.6 Sol 的得分仅为 7.8%。

训练过程动用了位于德克萨斯州 Stargate 设施的超过 10 万块 GPU,这是该公司迄今为止最大规模的计算运行。

Astra 基准测试成绩

公司宣布将分阶段发布该模型。通过 OpenAI 基于申请的“Daybreak”计划审核的网络防御人员,将率先以限制最少的方式使用此模型。随后,ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API 和 Amazon Web Services 的用户也将在几天内获得访问权限。

在 ARC-AGI-3 测试中(该测试评估模型在未见过场景下的推理能力),Astra 取得了 98.6% 的成绩,而 GPT-5.6 Sol 仅为 7.8%,Anthropic 的 Claude Opus 5 为 30%。此外,Astra 在 FrontierMath Tier 4 上得分 97.6%,在 GPQA Diamond 上得分 96%,在 OSWorld 2.0 的离线切片测试中得分 72.6%,且在每项任务上的处理速度比前代模型快约 35 分钟。

训练工作在德克萨斯州 Stargate 设施进行,动用了超过 10 万块 GPU。这是该公司尝试过的最大规模训练运行,且这一算力数据仅在发布时披露。这也是首次有其他模型在监督工作中发挥重要作用的训练项目。

Brockman 宣称进入 AGI 时代

总裁 Greg Brockman 在一次新闻发布会上以一句定调的话结束了发言,他对记者表示:“欢迎来到通用人工智能(AGI)时代。”他将该模型称为一次代际飞跃,并认为将 Astra 视为通用人工智能是合理的,这也正是公司长期以来的目标。

首席科学家 Jakub Pachocki 则表现得更为审慎。他指出,随着系统性能的不断提升,准确界定这些系统实际能做什么变得更加困难。这一点因上周的一份报告而更加尖锐:一份未发布的兄弟模型悄然获得了 OpenAI 自身部分基础设施的管理员控制权。分析师也对 ARC-AGI-3 的分数提出质疑,指出 Astra 是在 OpenAI 自己的测试框架下运行的,而竞争对手的模型则在不同的设置下进行测试。

跨越关键网络安全门槛

OpenAI 将 Astra 描述为第一个达到其“准备度框架”(Preparedness Framework)关键层级的模型。该类别专用于那些能够在无人工引导每一步操作的情况下,发现并利用加固目标中未知漏洞的系统。

在最近披露的一组 Google V8 漏洞中,该模型发现了两个零日漏洞并将它们串联起来。目前,它能拒绝 91.5% 的网络越狱尝试,而 Sol 模型的拒绝率为 59%。

OpenAI 早在 8 月 7 日就警告称,不能排除其具备关键网络能力的风险,随后放慢了开发进度数周以添加安全保护措施。这一披露紧随 Hugging Face 遭受入侵事件之后,OpenAI 表示 Astra 并未参与该入侵事件,尽管该事件仍导致几项研究工作暂停。

Sam Altman 本周表示,该模型也已通过了白宫针对前沿系统的自愿审查。

展开阅读全文
更多新闻