AI 智能体还做不了开放式 AI 研究
顶尖 AI 实验室的目标,是递归自我改进(RSI):用 AI 智能体把 AI 研究本身自动化。RSI 也是”AI 进步会爆发式加速”这类预测的地基。我们离这个里程碑还有多远,怎么判断?
一种办法,是用基准测试来检验智能体能不能做 AI 研究。AI 社区对基准的偏爱,让基准成了评估 RSI 进展的主流方式。过去一年里,许多这类评测发现:智能体在那些”成功标准清晰可验证”的任务上已经能取得进展,于是有人猜测,我们正站在 RSI 的门口。
但这些评测虽有用,却只覆盖狭窄、可验证的任务。AI 研究要开放得多:成功往往不即时明确,甚至没法验证;想取得进展,研究者得去测试有前景的假设、走回头路、甚至考虑新颖乃至离经叛道的做法。怎么评估智能体做开放式 AI 研究的能力呢?
我们迈出了回答这个问题的第一步:写了一篇新论文。我们和两篇尚未发表的 AI 论文的作者合作,请他们写下各自论文的核心研究问题;然后交给前沿 AI 智能体去做研究、回答这些问题,给了它们数千美元的 API 额度和算力,以及六天的实际时间。原作者评审了智能体产出的论文——两位作者毫不含糊地拒绝了这两篇智能体论文。
为了搞清楚结果背后的原因,我们的团队花了一百多个小时分析智能体的运行日志。主要发现有五条:
- 智能体缺乏做开放式研究的判断力。 虽然智能体提出的某些方向让专家评审眼前一亮,但它们很快就基于低质量或合成数据,否定了自己提出的方向。
- 智能体对自己手里的资源没有感知。 两次运行结束时,API 预算都花了不到一半,截止时间前还剩好几个小时——尽管它们能监控自己的用量,而且我们一直鼓励它们把预算花完。
- 智能体不会创造性地回应反馈。 虽然智能体自己的 AI 自我评审,已经发现了专家评审后来提出的许多问题,但它们并没有创造性地回应这些关切。面对负面反馈,它们只是在已有发现上追加免责声明,还在没有前景的研究方向上加倍下注。
- 智能体不会有效回溯。 实验第一天,它们就撤掉了最雄心勃勃的研究目标,此后再也没有从根本上改变过路线。
- 智能体不遵守具体指令。 它们无视了明确规则:探索阶段该花多长时间、多久用一次 AI 自我评审工具、论文篇幅的硬性上限。 我们两年前就想评测 AI 做开放式研究的能力了——当时我们发布过一个基准,用来研究智能体能不能帮人提高研究的可重复性。但我们一直想把方法做对。这个方法的灵感来自论文几位英国 AISI(AI 安全研究所)合著者的建议,由我们在普林斯顿的核心团队完善。我们把它叫做”影子评测”:智能体像影子一样跟随原研究。除了我们俩,核心团队还包括 Peter Kirgis、Andrew Schwartz 和 Stephan Rabanser,完整作者名单见文末。
影子评测有重要优势:它能在智能体没训练过、网上也搜不到答案的问题上测试智能体;还能请那些花了几个月回答这些问题的专家,来评判智能体的产出。
但影子评测也有固有局限:专家评审知道论文是 AI 生成的,可能偏爱自己走过的路;因为每次评测都要深入研读,样本量很小(这项研究只用了两篇论文);设计、执行、解读必然留给研究者很大的自由裁量空间。
事实上,我们在这场关于递归自我改进和超级智能的辩论里,以某种立场著称——这可能影响我们做研究的方式。论文里有一节专门讨论我们的潜在偏见和应对:我们找了一群先验不尽相同的合作者,并把产生的分歧明确摆了出来。对未来的评测,我们想在核心团队里纳入”对抗性合作者”。
对爆发式 AI 进步的启示
我们的结果表明,对前沿 AI 智能体来说,开展开放式研究仍然是个难题。结论还只是初步的,我们正努力扩大样本、用新模型测试、改进脚手架来解决局限。但如果这些结论站得住脚,意味着什么?
第一,我们要理解:前沿 AI 进步(和 RSI)能在多大程度上靠”在可验证任务上爬山”实现。我们的看法是:狭窄任务上的更快进步当然可能(比如提高效率),但这不会带来广义的 RSI 或爆发式进步。不过,我们会密切跟随智能体在可验证任务上的能力进展。
第二,我们要测出现有局限(比如创造力和判断力的缺失)被克服的速度——比如通过更有针对性的训练和脚手架改进。我们计划定期做影子评测,来回答这个问题。
第三,即使这些局限能被克服,还可能有进一步的瓶颈,拖慢 AI 进步的节奏。
瓶颈可能包括算力限制、必须从真实世界实验中采集数据的必要性,以及我们还没意识到的东西——它们现在还不是瓶颈,所以我们看不见。比如,高质量 RL 环境的重要性,在它被证明对推理扩展有用之前并不清楚;同样,为数据中心建设能源基础设施的重要性,在企业开始砸下几千亿美元之前也没人意识到。
如果我们生活在一个全自动研究的瓶颈都能轻松解决的世界,那么提升 AI 能力会带来惊人的回报。但如果我们生活在一个瓶颈众多且难以克服的世界,阿姆达尔定律就会生效:即使 AI 能胜任的那部分提速一百倍,整体进度的提速也很有限——因为进度取决于最慢的那一环。
搞清楚我们究竟生活在哪一个世界,会极大影响我们对 AI 进步速度的估计。希望我们的结果能帮助人们更丰富地理解这些瓶颈。
论文全文。作者:Peter Kirgis、Sayash Kapoor、Andrew Schwartz、Stephan Rabanser、David Africa、Konstantinos Voudouris、Viet Nguyen、Toby Pilditch、Magda Dubois、Harry Coppock、Cozmin Ududec、Nitya Nadgir、Matilda Orona、Tilman Bayer、Derrick Chan-Sew、Yue Ling、Abhishek Shetty、Helen Toner、Gillian Hadfield、Seth Lazar、Steve Newman、Shoshannah Tekofsky、Rishi Bommasani、Arvind Narayanan。
注释:
- 这与把论文送去盲审不同。可惜 AI 领域的同行评审饱受评审质量差、评审人专业不对口之苦,部分原因是投稿量暴增。
- 比如,我们的合著者对”智能体到底是缺创造力,还是陷入了认知锁定、无法有效吸收反馈”就有分歧。
- 实际上,不同类型的 AI 进步可能有不同的瓶颈。比如提高现有 AI 系统的效率和速度是可验证的任务,这方面的进展一直很快,企业也确实在用智能体提效。短期内,我们预计在有可验证信号的维度上,AI 进步会很快。
✍️ 出处
- 刊物:AI as Normal Technology
- 原名:AI agents can’t yet do open-ended AI research
- 作者:Sayash Kapoor 与 Arvind Narayanan
- 原文链接:暂缺
- 说明:中文由好读翻译整理,版权归原作者。原文来自作者邮件通讯。