Nature 2026 | 辅助科研人员编写专业级经验型软件的人工智能系统

今天介绍的是发表在 Nature 的原创论文。该研究主要围绕自动化生成专业科研仿真代码的 AI 系统 ERA 展开,重点解决科研人员编写数值预测软件耗时漫长、方案探索局限的行业痛点,创新性结合大语言模型与树搜索算法,可自主整合文献思路迭代优化代码;在单细胞数据分析、新冠住院预测、时空建模等六大跨学科任务中,产出的工具均超越人类顶尖方案,还通过思路融合诞生数十种全新高性能算法。该工作打通 LLM 自动生成专业实证软件的完整流程,大幅降低计算科学开发门槛,对加速生物、公共卫生、地理等多领域计算科研迭代具备里程碑式参考意义。

获取详情及资源:

0 摘要

科研探索流程常常受限于人工编写计算实验配套软件的低效过程,针对该痛点,该工作提出实证研究辅助系统 ERA,这一套人工智能系统可生成达到专业水准的科研软件,软件优化目标为最大化设定的质量评价指标。该系统结合大语言模型与树搜索算法,系统性提升软件质量指标,同时在庞大的可行解空间中完成智能寻优。当 ERA 整合借鉴外部文献中的复杂科研思路开展迭代探索后,输出成果能够达到行业专家水准,多项不同类型任务的测试结果均验证了树搜索模块的实用效果。在生物信息学场景中,ERA 自主研发 40 套全新单细胞数据分析算法,在公开评测榜单上性能超越人类研发的最优方法;在流行病学领域,该系统生成 14 组预测模型,对新冠住院人数的预测精度优于美国疾控中心集成预测模型以及其余所有单一预测模型。ERA 还可产出专业级软件,分别用于地理空间分析、斑马鱼神经活动预测、积分数值求解,同时设计出一套全新的基于规则的时序预测构建框架。该系统能够针对各类科研任务自主设计并落地全新解决方案,为加速科学研究进程迈出重要一步。

1 引言

以最大化可量化质量评分为设计目标的经验型软件应用十分广泛,是各类科研工作的核心支撑工具。近年来多款经验型软件助力多项诺贝尔化学奖成果诞生,1998 年密度泛函理论、2013 年分子动力学模拟、2024 年蛋白质结构预测均依托此类软件完成关键研究。经验型软件是搭建各类复杂系统模型的基础工具,应用场景涵盖气象模拟所需的地球大气垂直分层参数化、湍流流体力学中的应力响应参数化、社会系统演化趋势预测等多个领域。

然而,科研领域的经验型软件开发周期漫长、开发难度极高。面向特定学科领域的经验型软件需要大量繁琐的开发工作,开发周期往往长达数年。若要借助经验型软件验证复杂科学假设,仅依靠基础理论从头编写代码的难度会进一步提升。传统开发流程通常不会系统性地遍历各类备选实现方案,软件架构的设计决策大多依靠研发人员的主观经验或便捷性考量,缺少全面对照实验的支撑。软件开发环节耗费了大量时间,极大压缩了科研人员能够高效探索的研究方向范围。

该工作提出 ERA 人工智能系统,该系统可全自动、系统性生成经验型软件,用于解决具备量化评价指标的科研任务。ERA 依托大语言模型迭代改写代码,持续优化软件的量化质量得分;系统会生成多版候选软件方案,并借助树搜索算法筛选具备迭代优化价值的候选程序。代码变异优化存在多种实现思路,ERA 的开发思路源自多次卡格乐数据竞赛实践。该系统在代码变异迭代过程中融入多渠道科研思路,高引学术论文、专业教材、检索引擎文献结果均为思路来源。实际应用中,相关科研思路可由研究人员手动导入,也可依托检索引擎自动调取文献研究内容,大语言模型将结合导入的科研指导信息完成代码编写。

测试结果表明,针对覆盖众多学科、带有量化评价标准的科研任务,ERA 生成的软件性能优于现有最优方案。该系统之所以能够产出达到专家水准的程序,是因为它可在前所未有的规模下持续、全面地遍历各类可行方案,从而在海量备选方案中筛选出稀缺的高质量解决方案。

**图1|ERA 算法:基于大模型树搜索的自动化算法研发框架与性能验证。**该图分为 a、b、c 三部分,完整介绍ERA(基于 ERA 树搜索)自动化算法研发系统:包含算法整体流程、代码生成任务基准性能、系统自动化科研的工作逻辑。

2 可量化评分任务概述

ERA 依托卡格乐练习赛数据集完成开发迭代,同时选取多个学科领域具备重要科研与工程价值、可量化打分的任务完成系统测试,各类评测任务详情如下。

单细胞 RNA 测序批次整合任务:该任务需要在高维稀疏数据中区分微弱生物信号与背景噪声,通过剔除各类混杂干扰因素,实现不同实验室转录组数据的大规模整合分析。

美国疾控中心新冠病例预测任务:该任务基于存在时间滞后、带有噪声的实时监测数据,对非线性流行病演化规律进行预测,可提前数周预估新冠感染规模,为公共卫生政策制定与医疗资源调配提供数据支撑。

时序预测任务:该任务面向多种数据集与应用场景,完成时序数据未来结果的预测工作。

地理空间图像分割任务:该任务针对复杂卫星遥感影像,实现逐像素多标签精细语义分割,更高精度的分割结果能够显著提升环境监测与灾害应急处置的工作效果。

ZAPBench 全脑神经活动预测基准任务:该任务需要预测脊椎动物完整大脑内七万余个神经元的活动状态,在该基准测试中取得优异表现,有助于从系统层面解析大脑功能与生物行为的内在机制。

复杂积分数值求解任务:该任务用于求解常规数值计算方法难以处理的积分方程,广泛应用于各类物理、工程系统建模工作。

3 Kaggle 练习赛评测基准

ERA 的设计目标是在经过筛选的多场卡格乐竞赛中取得优异评测分数。卡格乐平台依靠榜单百分位排名衡量人工编写代码的性能水平,该系统将生成的代码直接提交至平台完成打分评测。整套基准测试包含 2023 年度 16 场练习赛,覆盖回归、分类两大类任务。练习赛是十分理想的评测基准,其迭代调试速度快、任务逻辑简洁,同时可与数千名开发者的人工成果进行横向性能对标。想要在榜单中获得高分,开发者需要编写逻辑复杂的程序,但任务本身无需解决高难度专业科研问题。

该系统基础运行策略采用一套简易提示词模板,模板将竞赛任务描述与上一轮迭代代码拼接整合。图 1b 采用 16 场练习赛公开榜单平均百分位排名作为评价指标,对比验证 ERA 的综合性能,测试结果显示 ERA 性能大幅优于单次大语言模型调用、千份模型输出择优方案,同时超越 AIDE 工具;核心优势在于系统能够维持多样化的候选代码搜索树,当某一条代码变异分支出现性能瓶颈时,可及时回溯调整搜索方向。在迭代寻优过程中,系统会发掘出可使评测分数大幅跃升的优化策略,多次分数跃升效果叠加后,最终生成质量最优的代码解决方案。

在提示词中加入对应任务的专业指导信息,能够显著提升系统性能,文中通过两组对照实验进行说明。搭载专家指导的树搜索实验中,向 ERA 输入卡格乐竞赛通用高分编写思路。梯度提升决策树开发实验中,要求 ERA 不调用第三方标准工具包,从零完整实现梯度提升决策树算法库。人工核验结果表明,两种场景下系统生成的代码均严格遵循提示词内给出的编写指导。

该系统随后在分属不同科研领域的六项基准任务中完成综合评测,实验探究了多种融合科研文献思路、优化系统输出效果的实现方式,相关内容见图 1c 。

4 基因组学:单细胞 RNA 测序数据批次整合

单细胞 RNA 测序技术极大提升了科研人员解析细胞异质性、发现全新细胞亚型、推导基因调控网络与细胞发育轨迹、筛选优质药物治疗靶点的研究能力,如今已有上万套测序数据集完成数亿个细胞的单分子测序。整合分析多套来源差异较大的单细胞 RNA 测序数据集存在一项核心难题,需要通过计算手段剔除样本间复杂的批次效应,同时完整保留数据中蕴含的真实生物学信号。目前用于单细胞 RNA 测序数据批次整合的工具已接近三百款,学界也搭建了多项基准评测体系,用于定量评估工具去除批次效应的效果以及对生物变异信息的保留能力。

该研究采用 OpenProblems v2.0.0 批次整合基准评测体系,检验 ERA 在单细胞数据整合任务中的性能。截至 2025 年 7 月,该持续更新的基准平台基于 6 套人、小鼠单细胞数据集,采用 13 项评价指标,对 15 款当前最优算法与 8 组对照方法开展评测,指标可同时量化算法去除批次效应的能力与保留真实生物学差异带来的数据变异的能力,相关结果见图 2a。为防止模型在基准数据集上发生过拟合,研究采用独立数据集完成 ERA 的参数优化。每一轮 ERA 迭代完成后,依据优化数据集的评测结果筛选最优代码方案,并在 OpenProblems 预留测试数据集上输出最终性能指标,测试集总计包含 1747937 个细胞。向大语言模型输入的提示词包含单细胞批次整合任务说明、数据集读取代码、评价指标实现代码,还可按需补充特定科研思路相关文字材料。

研究首先在无专业科研思路指导的条件下运行 ERA,系统输出的算法方案在设计思路上与 ComBat 算法相近,但综合性能优于 OpenProblems 榜单现有全部算法,对应结果见图 2b 中 “无专业思路指导(树搜索)” 组别。后续实验进一步验证 ERA 能否在现有成熟算法基础上实现性能优化,研究从 OpenProblems 基准平台筛选九款算法,其中包含榜单综合表现最优的六款算法。针对每一款目标算法,研究获取对应论文原文,借助 Gemini 2.5 Pro 提炼算法核心摘要,并将摘要内容补充至大语言模型的提示词中,具体操作流程见实验方法。两两对比结果显示,九款参考算法中有八款,ERA 重构后的代码综合得分均优于论文原文公布的测试结果,相关对比数据见图 2b。该次测试综合性能最优的方案为 ERA 重构实现的批次平衡 k 近邻算法(BBKNN(树搜索)),相较于现有公开最优算法 ComBat 综合性能提升 14%;在全部测试数据集、13 项评价指标中的 11 项上,该重构方案性能均持平或超越原版 BBKNN 算法,结果见图 2b。该优异性能证明 ERA 能够高效消除批次效应,同时完整保留数据中的生物学特征。实验还发现,针对无公开开源代码的 TabVI 算法,ERA 同样可以编写出高性能实现程序。领域专家人工核验 ERA 生成的全部代码后确认,几乎所有代码实现均严格遵循目标算法的理论框架;同一算法经多轮重复运行后,ERA 输出代码的性能表现整体稳定。除此之外,即便将 ERA 重构方案与完成超参数调优的原版算法对比,ERA 依旧能够实现性能提升,说明该系统的优化效果不局限于超参数寻优层面。

BBKNN(树搜索)性能提升的部分原因是融合了 ComBat 与 BBKNN 两种现有算法,而非单纯复刻 BBKNN 原有逻辑,相关分析见图 2c。原版 BBKNN 依托主成分分析嵌入向量完成近邻计算,而 BBKNN(树搜索)采用经 ComBat 校正后的主成分嵌入向量计算近邻,可消除全局性、与批次相关的线性方差。两种实现方案后续均跨批次求取 k 近邻并构建图结构,仅在代码具体实现细节上存在差异,以此消除局部批次效应。研究人员手动修改 BBKNN(树搜索)与公开原版 BBKNN 代码后验证,采用 ComBat 校正后的主成分嵌入向量是两种算法实现性能提升的关键,也印证了不同算法思路相互融合重组具备重要优化价值。

上述实验结果推动研究进一步探索系统性生成更复杂科研思路的方法。科研人员常融合多种研究思路开发全新算法,受此启发,该研究基于 11 种基础算法的代码摘要,通过程序自动完成全部两两组合,共计生成 55 组算法思路重组方案;11 种基础算法包含无指导生成方案、9 款复刻算法以及 TabVI 算法,下文统一称作基础算法。研究将每一组重组方案写入提示词输入 ERA 完成代码生成。针对每一组基础算法及其重组方案,筛选三类算法均可正常计算的评价指标,对比各组最优搜索节点的平均评测分数。实验结果显示,经树搜索生成的重组算法实现方案性能普遍优于对应的原始基础算法,55 组重组方案中有 24 组(占比 44%)综合性能同时优于参与组合的两款原始算法;剩余 31 组重组方案中,有 22 组性能优于两款原始算法中的其中一款。

第二阶段借助 Gemini 深度科研工具与 AI 协同科研工具,新增生成并落地实现 21 种全新算法思路,具体操作流程见实验方法。将各组思路输入 ERA 完成代码构建后统计性能:11 种基础算法中有 6 种、55 组算法重组方案中有 29 种、9 组深度科研生成思路中有 4 种、12 组 AI 协同科研生成思路中有 1 种,总计 87 组方案里的 40 组,综合性能均超越 OpenProblems 榜单上所有已发表算法,相关对比结果见图 2d。

为进一步解析 ERA 所探索的算法思路空间,研究利用 Gemini 文本嵌入模型为每一段生成代码生成特征向量,并计算向量间余弦相似度。特征向量可视化结果呈现出界限清晰的聚类分区,大致可划分为深度学习类算法与非深度学习类算法两大集群,这一现象说明 ERA 具备产出多样化算法解决方案的能力。

5 公共卫生方向:新冠住院人数预测任务

美国新冠预测领域主流基准评测平台为新冠预测中心,该平台由美国疾控中心统筹搭建,汇聚多方力量协同运营。多家来自高校、企业及政府机构的专业团队会每周向平台提交预测结果,各团队采用的建模方法互不相同。平台要求每周提交的预测内容,需覆盖美国 52 个州与属地的新增新冠住院病例,预测时段包含当周及后续三周,同时输出 23 组指定分位数结果。平台采用加权区间得分作为统一评价标准,该指标可同时衡量预测结果的精准度与不确定性区间的匹配程度。

综合表现优异的独立模型涵盖多种类型,包括经典自回归时序模型、梯度提升机器学习模型,以及基于更新方程与再生数贝叶斯估计构建的流行病学模型。新冠预测中心充分利用各类模型方法的差异性,将所有团队提交的预测结果融合构建集成预测模型,该模型稳定性强,长期以来都是美国流行病学预测领域的标杆方案。

图2|ERA 算法在单细胞 RNA 测序多批次数据整合任务上的性能评测。 该图围绕单细胞转录组(scRNA-seq)多批次数据整合任务,验证 ERA 树搜索框架自动优化批次校正算法的效果,分为 a、b、c、d 四个子图,完整展示任务原理、多方法对比、迭代优化过程与全基准榜单。

研究依托 2025 年 5 月 1 日之前的全部公开数据,设计一套严谨的回顾性试验,以此验证 ERA 在该高竞争预测场景下的综合性能。针对每一个预测周期,系统利用此前六周的数据运行 ERA 完成模型优化与筛选,在 2024 至 2025 完整预测周期内构建滚动验证窗口,数据集划分规则有完整记录。由 ERA 生成的谷歌回顾预测模型每周性能收录于时序性能榜单,该榜单直观体现该模型相对新冠预测中心集成模型与其他顶尖参赛团队的性能优势。最优重复实验组与全部重复实验组的加权区间得分,在各独立验证分段下的时序波动均有完整记录。各行政区的横向对比结果显示,该模型在绝大多数州均取得数值更低、效果更优的加权区间得分,同时文中选取典型地区,完成多类模型预测曲线的对照分析。

图3|ERA 算法在流行病 COVID 时序预测任务中的性能评测。 该图针对COVID 流行病感染人数时序预测任务,验证 ERA 树搜索自动优化时序预测模型的效果,分为左上时序滚动预测示意图、b 误差热力图、右上美国各州误差分布、e 全基准柱状对比四部分。

综合全部测试结果,该模型综合性能最优,平均加权区间得分为 26,优于新冠预测中心官方集成模型 29 的平均得分。

在验证该回顾性测试效果之外,研究进一步探究 ERA 大范围探索算法解空间的能力,实验通过复刻现有预测算法、重组算法思路、生成全新预测策略三类方式完成验证。第一组实验仅依靠新冠预测中心公开的简短算法介绍,让 ERA 复刻其他团队的成熟预测方案。基于树搜索生成的基础算法复刻版本不仅严格遵循原文算法逻辑,在八组对照实验中,有六组复刻方案性能优于原始团队提交模型;剩余两组复刻效果不及原版的模型,分别对应复刻约翰斯霍普金斯集成模型与 OHT_JHU 负二项分布模型,原因是复刻代码未使用原版算法所引入的外部辅助数据。第二组实验验证算法思路重组能否进一步提升预测精度,该实验向大语言模型输入两种不同基础模型,由模型提炼二者核心原理并融合形成全新混合算法思路,再将融合后的思路输入 ERA 生成全新混合预测方案。该次实验共生成 26 组混合模型,其中 11 组混合模型的加权区间得分同时优于参与融合的两款基础模型。人工核验全部重组实验生成代码后确认,所有代码均完整融合两款基础模型的核心实现逻辑。最后一组实验借助 Gemini 深度科研工具与 AI 协同科研工具生成全新预测思路,再由 ERA 完成代码落地实现。整套系统性实验共得到 14 套综合性能超越新冠预测中心官方集成模型的预测方案,其中十套来自算法思路重组、两套来自深度科研工具生成思路、一套来自 AI 协同科研工具、一套来自复刻优化后的基础模型。各类生成代码对应的特征向量余弦相似度计算结果显示,不同类型算法代码的特征向量形成清晰聚类。文中完整收录九种树搜索模型、三套性能未超过基准模型的提交方案的完整性能曲线与对应验证集评测结果,同时提供多组不同模型的预测曲线实例。

针对这 14 套高性能预测方案开展深度分析后,可以总结出 ERA 实现性能领先的核心规律。多数表现优异的方案均来自算法重组模型,这类模型呈现出显著的优势互补融合特征。多款成功融合方案中出现频次最高的两款基础模型分别是依托气候基准思路构建的简易模型 CMU-climate_baseline 与统计自回归模型 UMass-ar6_pooled。这一现象说明 ERA 能够稳定发掘出一套高效建模逻辑:以历史均值与近期时序趋势作为稳定基底,再叠加复杂度更高的优化算法进一步提升预测效果。性能最优的多组重组方案均融合了差异化建模逻辑,将流行病学传播模型 CEPH-Rtrend_covid 与统计自回归模型 UMass-ar6_pooled 结合后得到的混合模型,既依托疾病传播理论构建底层逻辑,又可以灵敏捕捉短期数据变化;而高性能机器学习模型 UMass-gbqr 搭配稳定性强的气候基准模型 CMU-climate_baseline 后,依托季节规律搭建稳定预测基底,让机器学习模型能够专注学习短期数据波动。研究最后分别在流行病预测建模、单细胞 RNA 测序批次整合两类任务中完成对照验证,证实采用 ERA 框架的优化效果,明显优于单纯从 128 组随机生成方案里筛选最优结果的简单策略。

6 GIFT-Eval 评测基准

6.1 概述

研究随后采用通用时序预测模型评测基准 GIFT-Eval 完成 ERA 性能测试,该基准是时序预测领域通用评测体系。GIFT-Eval 涵盖七大不同领域的 28 套数据集,数据采集频率跨度极大,从秒级到年度统计数据均有覆盖。该评测基准每月约接收四份全新参赛方案,参赛模型采用的技术路线丰富多样,包含黑盒深度学习模型与大基础模型等。所有提交方案均使用平台官方划分的训练集、验证集、测试集完成打分,评价指标选用归一化平均绝对标度误差,该指标以季节性朴素基准模型作为参照完成计算。

表 1 |ERA 与 N 次随机择优方案在单细胞 RNA 测序批次整合、流行病学建模任务上的性能对比

研究分两个阶段运行 ERA 完成建模。第一阶段采用分数据集独立求解模式,由 ERA 针对每一套数据集单独生成专属算法方案。第二阶段构建通用统一模型,全程仅依赖基础程序库,以 GIFT-Eval 全部数据集的平均评测得分为优化目标,通过爬山算法迭代寻优,最终得到单一通用时序预测模型。

6.2 分数据集求解方案

该阶段实验允许 ERA 调用全套 Python 工具库,涵盖 scikit-learn、statsmodels 与 XGBoost。ERA 的综合性能超越 2025 年 5 月 18 日榜单内所有参赛方案,榜单收录模型包含基础大模型、深度学习模型以及传统时序分析算法。ERA 自动生成的算法方案呈现明显收敛特征,优化方向集中于梯度提升算法、集成学习模型与时序分解类模型。

6.3 通用统一求解方案

研究探究代码变异系统能否从零搭建一套通用时序预测程序库,优化方式为固定单套代码,以 GIFT-Eval 全部数据集的平均平均绝对标度误差作为爬山算法的优化目标。为适配评测基准内多样化的数据特征,该程序库搭载自适应配置系统,最多可生成八组预设超参数组合,以此适配各类数据集;程序会增设验证流程,为每套数据集筛选综合效果最优的参数组合。随着搜索迭代推进,日期与时序趋势相关特征常带来性能大幅提升,最终生成的模型采用分步预测逻辑,依次拟合并剥离各类时序组分,包含基准数值、趋势项、季节周期、日期衍生特征,最后再对残差完成修正。这套模型的参数配置包含各类日期特征,其中一项特征专门提取美国、德国、中国、英国、加拿大、澳大利亚这些国家的节假日信息。最终得到的通用统一模型在 2025 年 5 月榜单中具备极强的竞争力。

7 神经科学、地理空间与数值分析任务

研究还在另外三类完全不同领域的任务上验证了 ERA 的性能,分别是地理空间语义分割、脊椎动物神经活动预测以及数值分析,ERA 在上述每一类任务中均达到专业人工设计算法的水准。

8 讨论

该研究提出了 ERA 这套人工智能系统,该系统依托大语言模型开展树搜索,能够系统性生成并迭代优化面向各类科研任务的程序代码。研究将科研程序开发问题定义为程序搜索问题,目标是找到输出结果综合质量得分最高的程序,由此把代码开发转化为可量化打分的优化任务,实现实证化程序自动生成。ERA 的核心创新在于由大语言模型驱动的代码改写机制,该机制可灵活融合各领域专业知识与外部前沿科研思路。当前先进大语言模型具备精准遵循指令的能力,能够高效遍历各类创新研究思路。ERA 融合了多个相互关联但彼此独立领域的研究成果,涵盖遗传编程、生成式程序开发、大语言模型代码生成、自动机器学习、大模型与搜索算法融合、面向科学发现的智能体等多个研究方向。

遗传编程是该研究的理论基础。遗传编程依托选择、交叉、变异等进化原理,对程序种群开展迭代优化。每个程序的适配度由适配度函数判定,该函数与该研究采用的质量得分具备完全对应关系。尽管遗传编程已取得大量应用成果,但传统方案仅依靠随机变异与代码片段结构化重组完成迭代,例如交换抽象语法树的子树结构。在大语言模型普及之前,遗传编程系统若要融入人类专业知识,只能借助形式文法约束搜索空间,或是利用代码结构指标引导进化搜索方向。ERA 与传统遗传编程的核心区别在于,系统借助大语言模型改写代码,完成具备语义理解能力的智能变异,相较于遗传编程常规的随机改动,能够生成逻辑更复杂、具备实际研究价值的代码变体。

ERA 可以看作由现代人工智能驱动的新一代传统生成式编程方案。传统生成式编程需要研发人员搭建程序生成器,借助模板、领域专用语言、元编程等技术,为一系列同类问题自动生成定制化源代码。与之不同,该研究将受树搜索引导的大语言模型作为代码生成核心引擎。该方案拥有更高灵活度,ERA 能够遍历规模庞大的解空间完成全新程序的合成,还可融合多领域专业知识,这些优势是模板类传统方法难以实现的。

基于海量代码语料预训练得到的大语言模型,彻底革新了代码生成技术。AlphaCode、OpenAI Codex 等系统已验证,仅依靠自然语言描述,就能生成逻辑正确、结构复杂的程序代码。这类系统大多基于提示词完成一次性代码生成。该研究方案与之存在明显区别,将大语言模型置于迭代优化循环中持续工作。模型不会从零生成全新代码,而是在树搜索算法的引导下对已有候选程序进行改写优化,优化过程以质量得分作为反馈信号。

自动机器学习系统旨在通过搜寻最优模型结构与超参数,实现机器学习流水线搭建全流程自动化,其优化目标是在验证集上最大化各项性能评价指标,例如准确率、F1 分数,这与文中定义的可打分优化任务相契合。自动机器学习仅局限于在固定机器学习框架集合内筛选最优模型,而 ERA 具备更强通用性,可对任意程序代码进行改写优化,覆盖数据预处理流程、复杂数值模拟、数学启发式算法等大量传统自动机器学习无法涉足的应用场景。

关联性最高的相关研究,均将大语言模型与搜索算法相结合,以此弥补单次生成模式存在的缺陷。当前已有大量持续增长的研究,把自动算法设计转化为进化优化问题。FunSearch 工具搭配自动化评估器,利用大语言模型提出代码优化方案,以此挖掘全新数学结论。近期出现的 AlphaEvolve 等智能体框架,进一步拓展了这类进化代码迭代流程,用于解决大海捞针式的复杂发现类问题,其核心思路与该研究采用的树搜索算法相近,但这类框架缺少面向科研问题求解所需的多思路探索能力。

面向科研问题的智能体:该细分领域中,高度专用化的系统已展现出突出效果,各类智能体可处理数据科学、计算生物学等多类科研问题。与这类仅适配单一领域的智能体不同,ERA 具备通用的实证程序优化能力,在多个学科的公开评测榜单与学术研究任务中,均取得了等同于人工专家设计程序的性能水平。

据现有文献调研,该研究首次验证了一套系统可在大量具备研究价值、经过充分研究的科学问题上,取得超越人工设计方案的性能。针对不同学科,仅输入前沿论文的方法描述作为提示词,ERA 生成的代码不仅能够严格复现论文算法,其运算结果往往更优。

该研究需要着重区分实证预测模型优化与真正意义上的科学发现,后者需要围绕底层理论、因果作用机制与数学框架完成逻辑推导。尽管该研究选取的核心评测任务,重点考察自动化、可量化打分的高级实证程序开发能力,但该系统底层能力并不局限于此,可进一步支撑科学发现工作。

依托大语言模型搭建的系统能够自主生成达到专家水准的实证程序,这一能力同时带来更广范围的安全隐患,当该技术应用于直接关乎人类福祉的领域时风险尤为突出。该系统能够自动化完成复杂工程流程,大幅降低开展高精度计算任务所需的专业技术门槛。这种技术普惠特性虽能推动正向科研成果产出,但同时也降低了在敏感、具备潜在危险性领域部署高精度模型的准入门槛。该风险属于一类系统性宏观隐患,源于大规模推理算力与基础模型性能指数级提升二者结合所带来的综合影响。

综上,ERA 融合了基于树搜索的代码变异系统与整合复杂科研思路的能力。这类科研思路可来源于已发表学术文献、科研智能体,或是大语言模型自主整合过往挖掘出的思路与求解方案。由于 ERA 能够生成严格契合特定研究思路的代码,因此可针对外部输入的各类科研思路开展遍历寻优。针对单细胞 RNA 测序批次整合任务,ERA 共生成 40 套性能优于现有最优算法的方案;针对流行病学预测任务,共得到 14 套效果超越美国疾控中心集成预测模型的方案。除此之外,ERA 在地理空间推理、神经活动预测、计算数学算法与时序预测全新规则化策略等任务中,均达到行业专家水准。

试错迭代是科学发展的核心路径,对于科研人员与该研究提出的自动化方法而言皆是如此。ERA 能够快速生成专家级解决方案,将一套研究思路的探索周期从数周、数月压缩至数小时、数天。以该方式加速科研进程,将对科学领域的发展产生深远影响。依托该次研究成果,该研究认为,所有能够通过机器量化打分评估求解效果的学科,其发展速度即将迎来大幅跃升。