自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

OpenAI的719篇数学论文来自测试其反对顾问

2026-10-09 07:16:31
收藏

OpenAI发布719篇数学论文引发争议,专家呼吁停止在专有模型上测试高级数学问题

10月6日,OpenAI将其未发布的内部模型生成的719篇数学论文上传至GitHub。然而,就在这一周前,其自身的咨询小组曾要求各大实验室停止在专有模型上进行高级数学问题的测试。

基于超过600份调查回复,位于新泽西州普林斯顿高等研究院的“数学与人工智能咨询组”于9月29日发布了指导建议。该小组在声明中明确指出:“我们首先要澄清的是,我们不赞同这种做法,并要求各方停止在专有模型上测试高级数学问题。”

该文件同时警告称,私有内部模型的使用可能导致行业出现“双轨制”,即少数实验室凭借封闭资源迅速超越其他研究团队,从而破坏领域的公平竞争环境。

背景与回应

OpenAI在其代码库中表示,作为模型开发的一部分,公司会对模型在公开研究问题上进行测试。随着现有数学基准测试趋于饱和,这些测试范围得到了扩展。OpenAI声称已与咨询组进行沟通,并参考了其建议后发布了相关内容。然而,该咨询组在10月6日发表的声明中强调,其顾问角色并不代表对OpenAI获取这些成果过程的认可。

关于合规性的最终裁决权,该小组已交给更广泛的数学界来评判。

技术细节与形式化验证

OpenAI将这719篇论文归类为372个数学家族,每个家族围绕一个主要结果及其相关证明构建。该公司为其专有模型提供了约4,000个问题,平均每个结果需要ChatGPT Pro进行约三小时的思考计算。

咨询组建议AI实验室公布每项结果的模型名称、提示词(prompts)、简化的思维链、耗时以及计算成本。目前,OpenAI公布了10个推理摘要,且约42%的主要结果附带了Lean形式化证明。

Lean是一种可用于计算机验证证明的编程语言。如果代码编译成功,仅意味着形式化陈述在逻辑上是成立的,但这并不等同于代码与书面论证完全一致。

潜在风险与学术质疑

Alexander Bastounis、Fabian Circelli和Anders C. Hansen在10月6日发布的一篇论文中深入探讨了上述差距。他们发现,OpenAI撰写的纳维-斯托克斯(Navier-Stokes)方程论文所做出的主张,强于其Lean代码实际证明的内容,其中一项估计甚至改变了输入导数的阶数。

作者还在OpenAI的欧拉(Euler)证明检测到了类似的误译现象。他们在文中写道:“OpenAI的书面证明以及其他自动形式化的Lean证明,不应在未经历与其他证明相同的同行评审过程和严格审查的情况下被盲目信任。”

此外,OpenAI于9月8日宣布了纳维-斯托克斯方程的结果。据《Cryptopolitan》报道,纽约大学数学家Tristan Buckmaster当时对该工作中涉及的最小人类投入量描述提出了质疑。对此,公司承诺将为有关重大AI成果的研讨会、会议和特别项目提供资金支持。

学界反应

10月6日,著名数学家陶哲轩发文指出,许多AI提示工程师往往在解决问题后就对该领域失去兴趣。他写道,许多人无法回答关于该结果的问题或就此发表演讲。值得注意的是,他的帖子并未点名OpenAI。

此前,《Cryptopolitan》在9月的报道中指出,该公司表示其顾问无权干预其研究的节奏。

展开阅读全文
更多新闻