哈佛物理学家用Claude三个月写出36篇论文

哈佛大学物理学家马修·施瓦茨(Matthew Schwartz)在Anthropic官方博客发表客座文章,公开了一个名为BootLoops的开源框架:它让大语言模型执行「精确」科学计算,并系统性地填补学科之间的知识空隙。三个月里,他与19位合作者产出36篇手稿,横跨从粒子物理到语言学的18个领域。
施瓦茨现为Anthropic访问研究员。他总结的关键不是把Claude当人类研究员用,而是反过来找「Claude形状的问题」(Claude-shaped problems)——许多学科卡壳的难题,其解法在数学、物理或计算机领域早已成熟,只是本领域学者不知情。他用「凸包」作比:人类知识沿各学科向不同方向延伸,学科之间的空隙无人探索,而BootLoops要做的就是填这些空隙。
框架的技术内核来自他的本行:粒子物理中的散射振幅计算,采用「半数值自举」路线——在少数特殊点把积分算到上千位有效数字,再用高精度数值敲定其余系数。这类任务天然适合AI:横跨多个学科、需要海量代码开发,而且结果极易检验。BootLoops还立了一条防作弊标准:一个费曼图只有在其完整解析形式已知、且能用Python脚本在普通笔记本上算到任意精度时,才算真正被攻克——面对需要逐位对齐的30位有效数字,模型没有蒙混过关的空间。
成果已经落地:生态学中,Claude帮助解出一个尘封20年的生物多样性理论方程,显示巴拿马树种组成的变化速度比此前估计快4.5倍;群体遗传学中,它分析了数十亿对突变,为基因转换寻找证据。研究还连接起粒子物理、生态学、群体遗传学、经济学与语言学等原本互不相通的领域。
但整篇文章最反复出现的主题是清醒:模型经常过早宣布胜利,或者从完全正确的计算中得出错误结论,很多结果要等人类专家介入、定下方向后才具有科学价值。施瓦茨的建议非常直白——「一切自己看」(Look at everything yourself)。此外项目也相当烧钱,计算和token开销都很高。
BootLoops源代码已在GitHub开放,且不绑定特定模型,Claude、Gemini、ChatGPT都能驱动。在「AI取代科学家」的喧嚣之外,它展示了一个更可信的分工:人类定方向、模型做苦力、脚本验结果。
编译自 The Decoder(基于 Anthropic 官方博客客座文章),原标题:"Open-source 「BootLoops」 harness supports AI models in performing precise scientific calculations"