2026年9月16日,斯坦福大学研究团队在《自然》杂志发表论文,提出“Paper2Agent”框架。该框架能将静态研究论文转化为交互式AI智能体。在早期演示中,两个基于无关研究构建的智能体协作,发现了一种此前未被报道的与注意缺陷多动障碍(ADHD)相关的基因联系。这一发现既未出现在原始论文中,也未被人类研究者记录。

打破代码复用壁垒

尽管开放科学有所进展,但复现计算方法仍面临巨大障碍。研究人员需手动配置环境、调试代码,才能应用他人技术。论文第一作者焦成(Jiacheng Miao)和资深作者邹纯青(James Zou)指出,传统论文要求读者自行适配代码和数据,严重阻碍了知识传播。

以谷歌DeepMind的AlphaGenome为例,虽然模型公开,但其复杂的API和参数结构对非软件背景的生物学家而言难以逾越。2016年《自然》调查显示,超70%的研究者曾尝试复现实验但失败。Paper2Agent旨在弥合“拥有代码”与“运行代码”之间的差距。

基于MCP协议的智能体转化

Paper2Agent将论文及其附属材料(代码、数据、工作流)转化为“虚拟通讯作者”——一个基于模型上下文协议(MCP)的AI智能体。MCP是Anthropic于2024年11月推出的开放标准,允许AI智能体通过自然语言调用外部工具。

系统通过六步流水线自动构建智能体:定位代码仓库、构建隔离环境、扫描教程、执行工作流、提取工具并封装为MCP服务器。关键在于严格的验证机制:只有当工具在3%容差内复现数值结果,并通过感知哈希技术匹配基线图表时,才算通过。这有效防止了AI可能产生的“代码幻觉”。

生成的MCP服务器暴露三类功能:可执行的MCP工具、结构化数据的MCP资源,以及指导复杂分析的MCP提示。

基准测试与跨学科表现

在AlphaGenome案例中,Paper2Agent在约45分钟内生成了22个功能性工具,成本约14美元。相比直接访问代码库,其查询准确率从80.3%提升至91.2%(在100篇bioRxiv论文基准测试中),单次查询时间从4.3分钟降至1.6分钟,成本从38美分降至20美分。

该系统在统计学、计算机视觉等10篇跨学科论文的测试中,准确率达到98.1%,显示出良好的通用性。

自主协作引发新发现

最引人注目的成果来自智能体的自主协作。团队部署了分别基于基因组突变预测和ADHD全基因组关联研究的两个智能体。它们合作标记出靠近MPHOSPH9基因的分子变异与ADHD风险增加有关。邹纯青表示,这一联系此前未在科学文献中出现。

另一项演示中,智能体通过整合AlphaGenome、scCRISPRi和Perturb-seq数据,确定了银屑病风险变异背后的因果基因GPR137。这种跨模态相关性策略并非源自任何单篇论文,而是智能体自主推理的结果。

研究强调,尽管发现源于AI协作,但归属权仍追溯至原始论文和人类作者,保留了科学署名规范。

局限性与未来展望

在转化的100篇论文中,26篇因代码不完整或环境配置问题失败。研究人员认为,这种失败本身揭示了计算可复现性的现状,有助于绘制“可执行方法地图”。

系统也存在局限:无法捕捉未写下的“隐性知识”,且多智能体得出的科学结论仍需独立复现验证。此外,底层大模型的性能直接影响准确率,目前外部尚难完全独立验证其混淆矩阵。

Paper2Agent源代码已在GitHub以MIT许可证开源。转化一篇复杂论文的成本约15美元,耗时30分钟至3小时。邹实验室已构建100多个论文智能体,并计划推动计算论文附带原生智能体成为常态。这项工作得到了陈-朱克伯格生物中心、斯坦福数字健康中心及美国国立卫生研究院的支持。