OpenAI发布722篇数学论文:单提示词生成引发争议与期待
周二,OpenAI在GitHub上发布了722篇数学手稿。这些内容均由该公司尚未公开的内部模型生成。OpenAI的一位发言人表示,几乎所有成果都源于向单一AI智能体发出的单个提示词,尽管部分结果可能需要多次尝试才能达成。
大胆宣称与谨慎审视
这是一项大胆的宣称,也可能标志着数学领域的一次重大突破。然而,并非所有人都买账或对此持欢迎态度。“在他们发布模型并允许他人复现结果之前,我认为对于‘单次提示即解决复杂问题’的说法,应将其视为未经证实的猜测。”麻省理工学院数学家安德鲁·萨瑟兰(Andrew Sutherland)对《科学美国人》表示,“我们需要看到证据。”
这些论文被归类为372个“家族”,每个家族包含相关的一组研究成果,其中可以捆绑主要定理、辅助论证、推论或替代证明。因此,722这个数字指的是手稿的数量,而非已解决问题数量。据OpenAI称,他们向模型提出了约4000个问题,并保留了那些被认为具有足够重要性而值得发布的输出结果。
计算资源与验证局限
据OpenAI介绍,平均每个结果消耗的计算量相当于ChatGPT Pro用户大约三个小时的推理算力。这与上月关于纳维-斯托克斯方程(Navier-Stokes)的主张形成鲜明对比,后者动用了10,000个协同智能体,耗时88小时。
OpenAI仅公布了其中10个结果的简化推理摘要。此外,根据仓库中的形式化目录显示,在722篇论文中,仅有162篇附带了由计算机验证的主要结果。这约占整个合集的22%,这些内容已被转化为Lean语言——一种能够机械检查每一步逻辑的软件工具。
OpenAI自身也承认,并非所有手稿都具备Lean形式化验证,且“某些未形式化的结果可能存在瑕疵”。换言之,他们发布的大量内容可能存在错误。通过Lean的快速检查只能确认证明过程符合Lean中写下的陈述,并不能证明该陈述与原始问题一致,也不能证明结果是新颖或重要的——而这正是数学家们目前需要评判的部分。
学界反应两极分化
这也正是研究人员感到担忧的地方。“现在的情况是,AI能够在人类无法理解、验证或为其承担责任的情况下输出数学论证。”新泽西州普林斯顿高等研究院在一份声明中表示,“我们认为,人类对数学的理解仍然至关重要。在这个新时代,我们如何朝着一种将人类对数学的理解作为负责任学术产出组成部分的新范式迈进?”
另一方面,阿比舍克·萨哈(Abhishek Saha)教授则相当兴奋。他写道:“这是数学界的大日子。”但他同时指出,大多数问题属于“现有计划内的非凡进展”或“令人惊讶的突破”,而非彻底改变游戏规则的类型。
这意味着集合中的大多数问题虽然有趣,但并未像千禧年大奖难题那样具有不可逾越性或变革性。而在722个问题中,唯一占据这一特殊位置的是“准黎曼猜想”(Quasi-Riemann Hypothesis)。
透明度缺失与未来展望
此次发布也未达到普林斯顿高等研究院顾问小组于9月29日所建议的标准:包括模型名称、提示词、思维链摘要、每项结果所花费的时间及计算成本。OpenAI公布了平均计算数据和10份推理摘要,但未公开提示词,并表示仍在努力以负责任的方式发布模型。
多伦多大学数学家丹尼尔·利特(Daniel Litt)持相反观点,他认为没有理由要求公司对这些数学问题的答案保密。相比之下,Anthropic上个月采取了不同的路径,其经过Lean验证的费马大定理证明包含了1300万行代码,并全部公开在GitHub上。该证明是对安德鲁·怀尔斯1995年发表的定理的形式化,而非声称新的成果。
OpenAI表示,随着获取到更多验证,他们将补充Lean形式化内容;目前,722篇手稿中有162篇已完成此项工作。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种