网站地图联系我们所长信箱办公信息系统English中国科学院
 
 
首页概况简介机构设置研究队伍科研成果实验观测合作交流研究生教育学会学报图书馆党群工作创新文化科学传播信息公开
  新闻动态
  您现在的位置:首页 > 新闻动态 > 学术前沿
Nature:将科研论文重塑为交互式、可靠的AI智能体
2026-09-22 | 作者: | 【 】【打印】【关闭

科研论文是科学交流的主要形式,是记录与传播研究方法、成果的重要途径。然而论文本质上属于被动的信息载体,“公开发表”并不意味着“容易使用”。尤其是当论文介绍了一种新的计算方法时,往往还需要读者主动定位代码仓库、安装依赖、配置运行环境、理解输入输出,并根据需要修改程序后才能真正将其应用于实际数据。对于不熟悉编程的研究者,这些繁琐的过程构成了方法传播与应用的技术壁垒。

人工智能(AI)智能体为解决这一问题提供了契机(Lu et al., 2026; Gottweis et al., 2026)。AI智能体能够主动调用外部工具、执行程序,并根据执行结果对后续步骤进行调整,自主完成用户设定的目标(Yuksekgonul et al., 2025)。因其以大语言模型为核心,用户可通过自然语言与之交互,大幅降低了使用门槛。在这一背景下,来自斯坦福大学的Miao及其研究团队提出设想:与其让研究者自主学习如何使用论文中的代码,能否构建一个相当于“虚拟通讯作者”的AI智能体,直接帮助读者理解和使用论文中的方法与数据?

最近,他们利用Claude Code开发了Paper2Agent框架(1a):首先将论文转换为Model Context ProtocolMCP)服务器(Paper2MCP),再将该服务器连接到兼容的AI智能体,从而形成面向特定论文的智能体。每个MCP服务器包含三个核心组成部分:(1MCP工具(tools),将论文中的核心方法封装为可以实际执行的函数;(2MCP资源(resources),将论文文本、代码库、补充材料、数据集、表格、图件等整理为结构化资源库,便于智能体检索与调用;(3MCP提示(prompts),其中包含了能够引导智能体完成论文、代码中复杂分析的指令。为了提高可靠性,Paper2Agent配置了多个专职智能体(1b):首先识别论文对应的代码库;由环境智能体(Environment agent)配置运行环境、由提取智能体(Extraction agent)实现论文的核心分析工具;随后由测试智能体(Testing agent)将工具输出与原文的输出进行比较,反复验证-修复(Refine),剔除不合格工具;最终部署至Hugging Face等平台,形成论文智能体。用户无需进行任何本地配置,即可通过自然语言调用。

1 Paper2Agent框架

为验证Paper2Agent的可靠性,研究团队进行了诸多测试,结果表明:(1Paper2Agent生成的智能体具有较高的准确性与处理效率。以基因组学为例,构建AlphaGenome智能体耗时约45分钟、成本14美元,自动生成了22个全部通过验证的MCP工具(2a);在教程类问题以及原论文未直接给出答案的新问题上,准确率分别达98.7±1.3%100.0±0.0%,明显高于Claude+Repo和生物医学智能体Biomni,且运行时间更短(2b–2c)。值得注意的是,在重现原文对低密度脂蛋白胆固醇的分析时,智能体提出SORT1可能是候选因果基因之一,进一步比较发现CELSR2PSRC1也获得了较高的预测分数,而原文则重点讨论了后两者的作用。这表明论文智能体不仅可以重复原论文已经开展的分析,还能让研究者以较低的使用成本对分析进行扩展。(2Paper2Agent生成的AI智能体能忠实复现原始分析结果,并将其进一步应用于新数据。Scanpy智能体生成的7个工具全部通过验证,在多个公开数据集上的输出与人类研究者结果一致,并能根据数据特性自适应调整参数。(3Paper2Agent框架具备良好的可扩展性与稳健性。作者开展了大规模分析和评价,发现在100篇计算生物学论文中,74篇成功转化为智能体,产生的599个候选工具中593个通过自动化验证;300个教程类问题中Paper2Agent准确率达91.2±1.6%;在10篇非生物学计算论文的42个任务中准确率达到98.1±0.8%26篇以数据和发现为重点的论文中,回答问题的准确率达到89.0± 3.1%。此外,未发现智能体存在捷径学习(shortcut learning)的证据,面对与论文内容不匹配的问题(permuted paper–question benchmark),其正确拒绝率达100%。即便在代码库存在故障的情况下,Paper2Agent也能有效检测并开展修复。(4)多个论文智能体可协作开展新发现。人类科学研究往往需要整合多种研究成果、结合多种研究方法。作者将Paper2Agent生成的3个智能体(AlphaGenomeMPRA-coupled scCRISPRiPerturb-seq)协作,探究银屑病相关变异rs887314的因果基因。AlphaGenome首先预测GPR137为该位点受影响最大的基因,随后,在人类的监督下,AI阅读论文与数据,提出10种候选验证策略。人类研究者从中选定signature-correlation分析后执行验证,认为GPR137很可能是该病相关位点的因果基因。

2 Paper2Agent生成的AlphaGenome智能体。(aAlphaGenome MCP服务器与智能体的构建;(b)测试结果的准确率;(c)运行时间;(d)通过“规划-执行-观察”循环(planning–action–observation cycles)实现分析

Miao及其团队开发的Paper2Agent框架,将科研论文从静态的文档和代码库,转变为能与人类交互、可自主执行分析的AI智能体。研究人员只需通过自然语言,即可调用论文中的复杂算法,在科学发现的传播与实际应用之间架起了一座桥梁,是AI与科学研究结合的重要一步。更进一步,这项突破性工作或许将开创一种全新的研究范式:让不同论文驱动的AI智能体“同台竞技”,研究者可在统一框架下对各篇论文的算法与结果进行直观的横向比较;将多样化的科学方法封装为模块化工具,便于研究者在数据处理与科学研究中灵活组合、交叉验证;通过AI智能体阅读与处理海量文献,研究者可以快速消化其中的方法和观点,由此让文献从被动的信息载体,转变为可并行调用、自由协同的“通讯作者智囊团”。但我们仍需要注意,执行结果通过验证并不等同于科学结论一定正确,且开放性科学问题往往存在多个合理解释。更重要的是,研究方向的选择、假设的提出与机制解释仍须由人类研究者主导,Paper2Agent更适合作为增强科研能力的工具。如果未来将AI智能体视为论文的一部分,其维护、管理以及安全边界都需要进一步明确,使其更好地服务于科学发现的传播、加速科学方法的应用。

主要参考文献

Miao J, Davis J R, Zhang Y, et al. Reimagining research papers as interactive and reliable AI agents[J]. Nature, 2026: 1-9. 原文链接

Lu C, Lu C, Lange R T, et al. Towards end-to-end automation of AI research[J]. Nature, 2026, 651(8107): 914-919.

Gottweis J, Weng W H, Daryin A, et al. Accelerating scientific discovery with Co-Scientist[J]. Nature, 2026: 1-3.

Yuksekgonul M, Bianchi F, Boen J, et al. Optimizing generative AI by backpropagating language model feedback[J]. Nature, 2025, 639(8055): 609-616.

(撰稿:杨媛媛,史锋/环境演变与碳循环学科中心)

 
地址:北京市朝阳区北土城西路19号 邮 编:100029 电话:010-82998001 传真:010-62010846
版权所有© 2009- 中国科学院地质与地球物理研究所 京ICP备05029136号 京公网安备110402500032号