arXiv 2026 | PIEVO: 通过不确定性最小化实现可演化的科学发现原则
今天介绍的是发表在 arXiv 上的一项研究工作。随着大语言模型(LLM)在科学发现中的应用日益广泛,现有方法通常受限于固定假设空间和不可变的先验原则,导致在面对新颖现象时效率低下。针对这一问题,研究提出了 PIEVO 框架,将科学发现视作对可扩展原则空间的贝叶斯优化,通过信息导向的假设选择和异常驱动的原则扩展机制,使代理能够自主演化理论认知。实验涵盖物理、化学、生物和材料科学四个基准任务,结果显示 PIEVO 在平均解质量上提升至 90.81%∼93.15%,较最先进方法提升约 30%;在收敛速度上实现 83.3% 加速,同时保持在不同领域和 LLM 模型上的稳健性。此外,PIEVO 成功发现纳米螺旋手性光学中的潜在物理机制,验证了原则演化在自动化科学探索中的实际价值。

获取详情及资源:
摘要
基于大型语言模型(LLM)的科学智能体加速了科学发现,但由于依赖固定的初始先验,往往存在显著低效。现有方法主要在静态假设空间中运行,这限制了新现象的发现,并在基线理论失效时造成计算浪费。为解决这一问题,核心关注点从搜索假设转向演化底层科学原则。PIEVO是一种原则可演化框架,将科学发现视为在不断扩展的原则空间上的贝叶斯优化。通过结合基于高斯过程的信息导向假设选择和异常驱动的增广机制,PIEVO使智能体能够自主细化其理论世界观。四个基准上的评估表明,PIEVO(1)实现了最高
1. 引言
基于大型语言模型(LLM)的科学智能体显著加快了自动化科学发现的进程。通过自动化复杂推理和假设生成,这些系统已展现出改变化学、生物学、物理学和材料科学等基础领域研究方法的潜力。尽管取得了这些进展,现有方法仍主要在固定搜索空间内最大化利用。
尽管近期框架开始引入科学原则作为指导,但这些原则或先验知识通常被视为不可变约束。因此,当智能体遇到与先验相矛盾的实验证据时,往往会将有效观测丢弃为错误,而不是将其识别为理论细化和扩展的信号。这种刚性带来显著低效:智能体在固定先验约束下探索假设空间,却无法根据涌现的实验证据更新对真实世界知识的“认知”。
这些限制集中体现为三个主要挑战:(a)科学洞察发现受限,即智能体无法感知超出初始先验的新现象;(b)假设生成低效,原因在于有限且不足的先验知识被重复套用;(c)发现过程中无法处理异常,系统不能利用意外结果扩展其概念边界。
为弥合这一差距,PIEVO将科学发现重新表述为在演化原则空间上的贝叶斯优化。不同于静态假设搜索的标准范式,PIEVO将科学原则建模为可学习的概率先验,并主动引导探索。关键在于,PIEVO采用异常驱动的认识演化机制:通常被丢弃为噪声的高惊异度实验结果被用于催化原则空间扩展和信念更新。这形成了一个双循环优化过程:细化后的原则将搜索约束到高效用流形,而异常则驱动原则本身的结构演化,从而确保智能体的内部模型复杂度随经验数据而扩展。

图1|原理演化示意图 PIEVO通过逐步探索假设候选,演化可优化的原理空间,并寻求能够解释或预测观测到的现象(例如经验观测)的原理。
PIEVO在物理、化学、生物和材料科学四类不同基准上进行了评估。经验结果表明,PIEVO:➊建立了当前最优性能,平均解质量最高达到
总之,主要贡献如下:
(a)提出原则演化概念。这一范式转变将科学发现从静态假设空间中的搜索,转化为对底层科学原则空间的优化;该原则空间约束着大范围的潜在假设。
(b)提出PIEVO框架。该框架通过贝叶斯更新自动演化暂定原则,并基于实验反馈自适应扩展原则空间,将异常转化为科学发现的驱动力。
(c)在四个真实世界任务上进行广泛评估,表明PIEVO相较SOTA获得
2. 相关工作
2.1. 用于科学发现的自主智能体
大型语言模型(LLM)融入科学工作流,推动了从人工实验到自主发现的范式转变。早期工作聚焦于面向特定领域的专用助手,例如有机合成和材料设计。近期进展扩展到能够进行端到端研究管理的通用AI科学家。The-AI-Scientist、AI-Researcher和AgentLaboratory等系统在构思、编码和手稿生成方面表现出能力。与此同时,多智能体框架也通过协作推理和综合工作流管理提升可靠性。然而,一个明确限制仍然存在:这些系统很大程度上仍在预训练知识或静态外部检索的边界内运行。尽管原则感知框架将科学规则作为约束引入,但仍将这些原则视为不可变先验。这种刚性阻碍智能体挑战基础假设,限制其发现与既有理论相矛盾现象的能力。
2.2. 认识演化与主动学习
为超越静态能力,近期研究聚焦于通过交互细化行为的自演化智能体。RAGEN、Agent0和EvolveR等框架利用强化学习和自生成课程,从经验中优化程序性策略。与此并行,贝叶斯推断和主动学习(AL)构成了不确定环境中数据高效决策的理论基础。这些方法已成功适配于LLM驱动的规划和好奇心驱动的世界建模,使智能体能够在有限反馈下最大化信息增益。尽管取得了这些成果,优化目标上仍存在关键差距。现有演化框架和贝叶斯框架主要优化程序性参数(例如策略权重、提示)或事实积累,而不是对语义原则本身进行贝叶斯更新。PIEVO通过将科学原则形式化为可迭代优化的概率信念,而非固定约束,弥合了这一差距,从而通过异常驱动的主动学习实现新物理规律的发现。
3. 方法
3.1. 概述
原则演化的一般概念不同于在固定假设空间中运行的现有方法。PIEVO主动优化科学原则,即科学场景中关于相关性、模式或机制的自然语言陈述。借助贝叶斯推断,PIEVO根据实验证据管理原则后验,并扩展其活跃原则,以高效搜索假设。
PIEVO是一个战略层,通过每次迭代中的提示注入连接到最小科学智能体系统:(a)原则智能体被引导扩展活跃原则范围,或等待另外两个智能体收集足够证据;(b)假设智能体由当前最大后验(MAP)原则作为条件提示引导,提出候选假设;(c)实验智能体被引导测试PIEVO选出的唯一候选。这些模块建立了迭代级指导,使假设探索能够从可演化的原则范围出发。

图3|指导注入机制 PIEVO通过后台优化利用提示模板生成策略性指导(见附录J):(a) 活跃原理,(b) 识别出的高惊讶异常,(c) 假设选择,并将其注入代理上下文以引导推理。
3.2. 理论框架
定义3.1(通用原则空间)。设
本节首先定义PIEVO内部优化与外部物理验证之间的交互,随后形式化PIEVO中的双重不确定性最小化架构,即$ \textbf{原则} \xrightarrow{(a)} \textbf{假设} \xrightarrow{(b)} \textbf{证据} $。
假设空间与原则空间。设
外部验证函数
内部原则信念与似然。PIEVO在原则优化中的认识状态被形式化为每个原则
为遍历
(a)原则
(b)证据
理论框架概述。科学发现被形式化为分别覆盖假设空间和原则空间的双重不确定性问题:
(a)对于假设空间,PIEVO选择可能的高质量假设,以降低原则信念的不确定性。
(b)对于原则空间,PIEVO作为监控器维护工作原则上的后验分布,并迭代细化一组以原则为条件的似然模型,即高斯过程专家,以收敛到真实原则。
3.3. 信息导向假设选择
科学发现本质上需要在利用与探索之间保持平衡。超导体发现(SPO)中的一个动机案例可以说明这一必要性:
示例3.2(SPO中的高奖励陷阱,即范式利用)。考虑室温超导体搜索:结果驱动型智能体(例如PiFlow)会在铜氧化物等既有系统流形内严格爬山。尽管能够进行局部优化,但在当前范式下看似次优的反直觉区域(例如铁基家族)仍会被忽视。
为解决这一差距,引入了假设选择机制,其中假设智能体仅负责提出多样化候选,实验智能体负责执行PIEVO选出的候选。通过同时重视信息增益和产出,系统能够验证涌现的原则,并最终打开更优的假设区域。
信息导向假设选择。下一假设
其中,
通过GP专家建模似然。为以样本高效的方式计算所需似然
为弥合文本命题与数值GP核之间的模态差距,语义对齐被用作物理似然的理论严格代理:
其中,
要点(PIEVO中的假设选择)。总体而言,GP用于建模似然
3.4. 原则的连贯增广
在科学发现中,对外部世界的初始构想往往并不完整。如果真实原则缺失,智能体可能陷入认识停滞。PIEVO通过异常驱动的原则空间扩展解决这一问题,包括(a)识别异常和(b)通过提出新原则来调和异常。
识别异常。系统首先计算异常分数
其中,
通过连贯原则增广调和异常。检测到异常后,PIEVO触发发现阶段,由原则智能体提出新的候选
只有当新原则对
定理3.3(收敛性与效率,非正式)。在连贯原则增广和校准生成器条件下,PIEVO优化循环保证:(a)亚线性累积遗憾,其中累积遗憾满足
总体而言,PIEVO的实现由算法流程和提示模板组成,其优化过程提供了强理论保证。此外,PIEVO的优越效率体现为相较PiFlow更快的收敛速度,并已得到经验验证。
要点(PIEVO中的连贯增广)。基于惊异度的异常检测既允许通过阈值控制敏感性,也支持动态原则调和。这种自闭合更新确保科学认知随经验证据连贯演化。
4. 实验
4.1. 实验设置
任务与基准。PIEVO在四个标准科学发现基准上进行评估:纳米材料光学性质优化(NHO)、分子生物活性优化(MBO)和超导体临界温度优化(SPO),覆盖连续(七维)、离散和混合搜索空间;此外还包括过渡金属配合物优化(TMC),用于四维组合实体搜索。通过采用高保真代理模型,每个任务都旨在受限实验预算内最大化目标性质值。
基线。PIEVO与三类多智能体系统(MAS)进行基准比较:(a)经典策略:包括VanillaMAS,即没有高阶策略的迭代式假设测试循环;以及ReAct,该方法将推理轨迹与动作交错结合。(b)自主科学智能体:包括AI-Researcher和The-AI-Scientist(v1/v2)的定制适配版本;为公平比较,这些版本被限制在核心假设生成模块内,不使用网络搜索和检索。(c)原则引导方法:以PiFlow为代表,该当前最优方法在静态科学原则条件下生成假设。Co-scientist、Kosmos和Robin等其他方法未纳入比较分析,因为它们要么面向特定科学领域定制,要么采用已由选定基线代表的假设测试机制。
实现细节。所有实验均强制采用
4.2. 评估指标
为全面评估性能,采用多维指标衡量以下能力:(a)达到目标,(b)探索宽度,以及(c)有前景的利用。
a. 解质量(SQ)。定义为在假设-结果轨迹
高于
b. 平均成对距离(APD)。该值描述所有有效假设的平均成对距离,其中每个任务均由
更高的APD表示搜索范围更广,这是新发现和覆盖景观的前提。
c. 优化曲线下面积(AUOC)。该值衡量固定预算下的累积最大性能:
更高的AUOC意味着更优的搜索效率,即能够更早识别有前景方向并有效利用。
4.3. 性能分析
表1|在4个基准上的性能比较(以解答质量SQ %衡量) 结果按大语言模型分类,即Qwen3-32B和Gemini-2.5-Flash的非思考模式,并标注相对于Vanilla MAS的SQ优势或劣势。PIEVO优于所有基线,在平均上实现了Vanilla MAS的1.5∼1.7倍SQ。


图4|基于Qwen3-32B的基线轨迹比较 绘制每个任务随时间的累积最佳解答质量。SQ >100%表示超过经验参考值。PIEVO在所有任务中均持续优于基线,但在TMC和SPO等具有挑战性的任务中,由于假设搜索的固有复杂性,差距较小。
PIEVO与六个基线在四个基准上的比较,以及NHO任务中不同几何维度下的可扩展性分析,共产生三个主要观察:
Obs.➊:PIEVO在解质量上建立了新的当前最优水平。PIEVO优于所有基线,平均SQ达到
表2|在4个基准上的探索(APD ↑)与利用(AUOC ↑)比较 结果按大语言模型分类,即Qwen3-32B和Gemini-2.5-Flash的非思考模式,并标注相对于Vanilla MAS的平均性能优劣。PIEVO在探索与利用两方面均实现优越平衡,如图7所示。


图5|参数敏感性消融 异常计数阈值和异常阈值影响原理数量,而sigma作为噪声表示影响系统的探索能力。预热轮次影响系统的初始化能力。
Obs.➋:PIEVO有效平衡探索与利用。PIEVO在多样性(
表3|不同搜索维度下NHO任务性能 最佳结果加粗,次优结果加下划线。


图6|PiFlow与PIEVO在MBO任务中的比较 如表1和表2所示,相较于PiFlow,PIEVO在83.3%的任务中实现加速并降低经验性损失,显示出更高的效率。
Obs.➌:PIEVO在高维搜索空间中表现稳健。在NHO任务中,搜索空间复杂度随几何维度扩展;PIEVO在

图7|所有任务的帕累托前沿 PIEVO位于帕累托前沿,表明其在科学发现中的探索(APD)与利用(AUOC)方面均实现优越平衡。
4.4. 效率分析
PIEVO的发现效率通过两个关键维度评估:解质量(SQ)和计算成本。PIEVO在这两个指标上均表现出显著收益。
Obs.➍:PIEVO实现亚线性遗憾和加速收敛。经验轨迹验证了理论上的亚线性遗憾界
表4|NHO任务的性能与效率比较 性能以表1中SQ表示。

4.5. 案例研究:发现物理机制
任务场景。PIEVO被部署到纳米光子学中的一个挑战性发现任务:识别孤立纳米螺旋中圆二色性(CD)的电动力学起源。不同于已有较充分研究的螺旋阵列,单结构手性的支配规律仍很大程度上未被探索。PIEVO及其智能体在没有任何文档资源的情况下初始化,必须演化出原则来解释从高保真代理模型获得的手性。
Obs.➎:PIEVO自主识别出电动力学机制。仅经过

图8|PIEVO模块在NHO任务中的消融研究 (a) PIEVO层带来的性能提升。 (b) PIEVO各子模块开/关情况下的性价比比较。
4.6. 消融实验
超参数敏感性。PIEVO对关键超参数的敏感性得到分析,包括异常阈值
表5|PIEVO的消融研究 Greedy Only模式用于禁用假设选择,Static Evolution用于禁用NHO任务中的原理优化。效率计算为SQ除以对数时间。

PIEVO模块消融。为区分各组件贡献,在NHO任务上进行了消融。禁用连贯增广(静态演化)后,SQ上限为
PIEVO动态与测试时推理的消融。系统内部机制和Think模式下的测试时推理也得到进一步分析。结果发现:(a)PIEVO系统性地演化出与解质量直接相关的高保真原则,验证了原则空间优化的有效性。(b)存在一种认知干扰效应,即Think模型会降低性能(下降
5. 结论
PIEVO框架将科学发现从静态假设搜索重新表述为在演化原则空间上的贝叶斯优化。通过将基于GP专家的信息导向选择与异常驱动的认识增广协同结合,PIEVO主动细化其理论世界观。经验上,PIEVO实现了解质量