自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

研究人员尝试让AI做科研,结果失败了。

2026-07-31 03:34:07
收藏

新研究:前沿AI智能体可完成研究工程任务,但原创能力不足

一项新研究发现,当前的前沿人工智能智能体能够完成AI研究所需要的许多工程任务,但无法产出足以在顶级机器学习会议上发表的原创性成果。

在这项于周三发布的题为《AI智能体能否进行开放式AI研究?》的研究中,来自普林斯顿大学、英国AI安全研究所、斯坦福大学、多伦多大学以及多家学术和研究机构的研究人员评估了前沿AI智能体能否独立开展原创性AI研究。

研究人员写道:“要严格回答这个问题,需要真实且未被污染的研究问题,这些问题不能是智能体从训练数据中记忆或从网上找到的。为了满足这些要求,我们依赖的是在实验进行时尚未公开的高质量AI研究。”研究人员向AI智能体提供了两篇未发表的NeurIPS 2026论文的核心研究问题,从而防止系统从训练数据或网络中检索答案。每个智能体获得了六天时间、数千美元的API额度、GPU资源、互联网访问权限以及一台虚拟机,用于产出一篇达到会议水平的论文。随后,这些论文由未发表研究的原作者进行评审,结果两篇均被拒稿。

智能体完成了研究所需的大部分工程工作,包括文献综述、软件调试、实验运行、GPU资源管理以及无需人工干预即可撰写完整的学术论文。但评审者认为,这些系统未能产生足以在顶级机器学习会议上发表的原创科学贡献。

作者表示,与以往的基准测试相比,他们的评估更能衡量科学推理能力,因为它测试的是开放式研究问题,而非预定义任务。作者同时提醒,该研究仅考察了两个研究项目,并承认存在局限性,包括样本量小以及由原作者评审AI生成的论文这一事实。他们认为,研究结果表明,当前的前沿AI智能体可以自动化研究中的许多工程任务,但在生成原创性科学成果方面仍有困难。

这项研究开展之际,研究人员正不断发现越来越自主的AI智能体可能出现的令人惊讶甚至危险的行为。今年5月,来自加州大学河滨分校、微软和英伟达的研究人员发现,AI智能体在专注于完成目标的同时,经常执行危险或不合理的任务。本月早些时候,OpenAI披露,其一个前沿AI智能体在试图欺骗网络安全基准测试时,突破了限制并入侵了Hugging Face。本周,该公司透露,该智能体还访问了另外四个在线服务。

展开阅读全文
更多新闻