arXiv 2026 | PIEVO: 通过不确定性最小化实现可演化的科学发现原则

今天介绍的是发表在 arXiv 上的一项研究工作。随着大语言模型(LLM)在科学发现中的应用日益广泛,现有方法通常受限于固定假设空间和不可变的先验原则,导致在面对新颖现象时效率低下。针对这一问题,研究提出了 PIEVO 框架,将科学发现视作对可扩展原则空间的贝叶斯优化,通过信息导向的假设选择和异常驱动的原则扩展机制,使代理能够自主演化理论认知。实验涵盖物理、化学、生物和材料科学四个基准任务,结果显示 PIEVO 在平均解质量上提升至 90.81%∼93.15%,较最先进方法提升约 30%;在收敛速度上实现 83.3% 加速,同时保持在不同领域和 LLM 模型上的稳健性。此外,PIEVO 成功发现纳米螺旋手性光学中的潜在物理机制,验证了原则演化在自动化科学探索中的实际价值。

获取详情及资源:

摘要

基于大型语言模型(LLM)的科学智能体加速了科学发现,但由于依赖固定的初始先验,往往存在显著低效。现有方法主要在静态假设空间中运行,这限制了新现象的发现,并在基线理论失效时造成计算浪费。为解决这一问题,核心关注点从搜索假设转向演化底层科学原则。PIEVO是一种原则可演化框架,将科学发现视为在不断扩展的原则空间上的贝叶斯优化。通过结合基于高斯过程的信息导向假设选择和异常驱动的增广机制,PIEVO使智能体能够自主细化其理论世界观。四个基准上的评估表明,PIEVO(1)实现了最高90.81%93.15%的平均解质量,相较当前最优水平提升29.7%31.1%;(2)通过优化紧凑的原则空间显著降低样本复杂度,使收敛步数加快83.3%;(3)在不同科学领域和LLM骨干模型上保持稳健性能。

1. 引言

基于大型语言模型(LLM)的科学智能体显著加快了自动化科学发现的进程。通过自动化复杂推理和假设生成,这些系统已展现出改变化学、生物学、物理学和材料科学等基础领域研究方法的潜力。尽管取得了这些进展,现有方法仍主要在固定搜索空间内最大化利用。

尽管近期框架开始引入科学原则作为指导,但这些原则或先验知识通常被视为不可变约束。因此,当智能体遇到与先验相矛盾的实验证据时,往往会将有效观测丢弃为错误,而不是将其识别为理论细化和扩展的信号。这种刚性带来显著低效:智能体在固定先验约束下探索假设空间,却无法根据涌现的实验证据更新对真实世界知识的“认知”。

这些限制集中体现为三个主要挑战:(a)科学洞察发现受限,即智能体无法感知超出初始先验的新现象;(b)假设生成低效,原因在于有限且不足的先验知识被重复套用;(c)发现过程中无法处理异常,系统不能利用意外结果扩展其概念边界。

为弥合这一差距,PIEVO将科学发现重新表述为在演化原则空间上的贝叶斯优化。不同于静态假设搜索的标准范式,PIEVO将科学原则建模为可学习的概率先验,并主动引导探索。关键在于,PIEVO采用异常驱动的认识演化机制:通常被丢弃为噪声的高惊异度实验结果被用于催化原则空间扩展和信念更新。这形成了一个双循环优化过程:细化后的原则将搜索约束到高效用流形,而异常则驱动原则本身的结构演化,从而确保智能体的内部模型复杂度随经验数据而扩展。

图1|原理演化示意图 PIEVO通过逐步探索假设候选,演化可优化的原理空间,并寻求能够解释或预测观测到的现象(例如经验观测)的原理。

PIEVO在物理、化学、生物和材料科学四类不同基准上进行了评估。经验结果表明,PIEVO:➊建立了当前最优性能,平均解质量最高达到93.15%,超过顶级基线最高31.06%;➋提高了效率,相较PiFlow样本效率提升83.3%,同时推理时间减少约16%;➌在任务和LLM之间表现出稳健的可迁移性;➍揭示了基本机制,识别出亚波长手性光学中的新原则。

总之,主要贡献如下:

(a)提出原则演化概念。这一范式转变将科学发现从静态假设空间中的搜索,转化为对底层科学原则空间的优化;该原则空间约束着大范围的潜在假设。

(b)提出PIEVO框架。该框架通过贝叶斯更新自动演化暂定原则,并基于实验反馈自适应扩展原则空间,将异常转化为科学发现的驱动力。

(c)在四个真实世界任务上进行广泛评估,表明PIEVO相较SOTA获得20%30%的性能提升,从而提高发现效率;同时,盲案例分析验证了其辅助发现物理原则的能力。

2. 相关工作

2.1. 用于科学发现的自主智能体

大型语言模型(LLM)融入科学工作流,推动了从人工实验到自主发现的范式转变。早期工作聚焦于面向特定领域的专用助手,例如有机合成和材料设计。近期进展扩展到能够进行端到端研究管理的通用AI科学家。The-AI-Scientist、AI-Researcher和AgentLaboratory等系统在构思、编码和手稿生成方面表现出能力。与此同时,多智能体框架也通过协作推理和综合工作流管理提升可靠性。然而,一个明确限制仍然存在:这些系统很大程度上仍在预训练知识或静态外部检索的边界内运行。尽管原则感知框架将科学规则作为约束引入,但仍将这些原则视为不可变先验。这种刚性阻碍智能体挑战基础假设,限制其发现与既有理论相矛盾现象的能力。

2.2. 认识演化与主动学习

为超越静态能力,近期研究聚焦于通过交互细化行为的自演化智能体。RAGEN、Agent0和EvolveR等框架利用强化学习和自生成课程,从经验中优化程序性策略。与此并行,贝叶斯推断和主动学习(AL)构成了不确定环境中数据高效决策的理论基础。这些方法已成功适配于LLM驱动的规划和好奇心驱动的世界建模,使智能体能够在有限反馈下最大化信息增益。尽管取得了这些成果,优化目标上仍存在关键差距。现有演化框架和贝叶斯框架主要优化程序性参数(例如策略权重、提示)或事实积累,而不是对语义原则本身进行贝叶斯更新。PIEVO通过将科学原则形式化为可迭代优化的概率信念,而非固定约束,弥合了这一差距,从而通过异常驱动的主动学习实现新物理规律的发现。

3. 方法

3.1. 概述

原则演化的一般概念不同于在固定假设空间中运行的现有方法。PIEVO主动优化科学原则,即科学场景中关于相关性、模式或机制的自然语言陈述。借助贝叶斯推断,PIEVO根据实验证据管理原则后验,并扩展其活跃原则,以高效搜索假设。

PIEVO是一个战略层,通过每次迭代中的提示注入连接到最小科学智能体系统:(a)原则智能体被引导扩展活跃原则范围,或等待另外两个智能体收集足够证据;(b)假设智能体由当前最大后验(MAP)原则作为条件提示引导,提出候选假设;(c)实验智能体被引导测试PIEVO选出的唯一候选。这些模块建立了迭代级指导,使假设探索能够从可演化的原则范围出发。

图3|指导注入机制 PIEVO通过后台优化利用提示模板生成策略性指导(见附录J):(a) 活跃原理,(b) 识别出的高惊讶异常,(c) 假设选择,并将其注入代理上下文以引导推理。

3.2. 理论框架

定义3.1(通用原则空间)。设P¯为可数的通用潜在科学原则集合,并赋予具有有限熵H(p0)的固定先验分布p0。在任意时间步t,智能体维护一个有限的活跃原则PtP¯。目标是在最大化由该原则生成的假设结果的同时,识别未知的真实原则P

本节首先定义PIEVO内部优化与外部物理验证之间的交互,随后形式化PIEVO中的双重不确定性最小化架构,即$ \textbf{原则} \xrightarrow{(a)} \textbf{假设} \xrightarrow{(b)} \textbf{证据} $。

假设空间与原则空间。设H表示所有可能实验假设(例如分子结构)的空间,P¯表示通用科学原则集合。在任意时间t,系统维护一个活跃原则集合Pt={P1,,Pn}P¯

外部验证函数f。一次实验包括选择一个假设hH,并观察一个实值结果yR(例如分子的生物活性)。该过程被建模为y=f(h)+ϵ,其中f是真实的底层物理映射(例如湿实验、仿真等),ϵ为观测噪声。在相关实验中,f对应每个任务的代理模型评估。

内部原则信念与似然。PIEVO在原则优化中的认识状态被形式化为每个原则PPt的信念分布pt(P),并基于交互历史Ht1={(hs,ys)}s=1t1通过贝叶斯推断进行更新。为实现信念更新,观测到结果y的似然p(y|h,P)被建模为生成分布,其中y由假设h和支配原则P给定;该分布描述了当P是真实支配原则时的预期实验结果。借助这一似然,PIEVO能够同时执行假设选择和连贯原则增广。

为遍历P¯,PIEVO将阻碍识别P的两类不同不确定性建模为闭环:

(a)原则假设不确定性。给定一个原则作为假设生成方向,该项刻画将高层原则转化为具体、可检验假设h时的随机性。在相关实验中,该项通过经过充分指令化的LLM实现,该LLM在一个动态优化原则的条件下提出h

(b)证据原则不确定性。基于智能体历史,该项表示关于当前活跃原则范围Pt中哪一原则是最优选择的认识不确定性。该项由假设选择和原则优化奠定基础。

理论框架概述。科学发现被形式化为分别覆盖假设空间和原则空间的双重不确定性问题:

(a)对于假设空间,PIEVO选择可能的高质量假设,以降低原则信念的不确定性。

(b)对于原则空间,PIEVO作为监控器维护工作原则上的后验分布,并迭代细化一组以原则为条件的似然模型,即高斯过程专家,以收敛到真实原则。

3.3. 信息导向假设选择

科学发现本质上需要在利用与探索之间保持平衡。超导体发现(SPO)中的一个动机案例可以说明这一必要性:

示例3.2(SPO中的高奖励陷阱,即范式利用)。考虑室温超导体搜索:结果驱动型智能体(例如PiFlow)会在铜氧化物等既有系统流形内严格爬山。尽管能够进行局部优化,但在当前范式下看似次优的反直觉区域(例如铁基家族)仍会被忽视。

为解决这一差距,引入了假设选择机制,其中假设智能体仅负责提出多样化候选,实验智能体负责执行PIEVO选出的候选。通过同时重视信息增益和产出,系统能够验证涌现的原则,并最终打开更优的假设区域。

信息导向假设选择。下一假设ht通过信息导向采样(IDS)选择。IDS最小化目标:

(1)ht=argminhH(Δt(h))2It(h),

其中,Δt(h)=Ept(P)[v(P)]Ept(P)[μP(h)]是在当前信念下相对于估计最优值v(P)的期望遗憾。分母It(h)=I(P;Y|h,Ht1)为信息增益,定义为后验pt(P)熵的期望减少量。该比值确保只有当关于原则P的期望信息增益足够高时,智能体才会承担高遗憾(探索成本)。

通过GP专家建模似然。为以样本高效的方式计算所需似然p(y|h,P),采用不同的高斯过程(GP)专家{MP}PPt,而非神经网络替代方案,原因有三点。(i)数据效率:在实验预算严重受限(例如T<30)的稀疏数据场景中,GP能够提供稳健泛化和精确贝叶斯推断。(ii)校准不确定性:不同于典型深度模型,GP给出经过适当校准的预测方差σP2(h),这对于公式(1)中的信息论选择至关重要。(iii)解析计算:GP允许通过BALD近似对Δt(h)It(h)进行解析计算,从而避免计算成本高昂的集成重训练。

为弥合文本命题与数值GP核之间的模态差距,语义对齐被用作物理似然的理论严格代理:

(2)ϕ(h,P)=[eheP,eheP2],

其中,eheP分别为假设和原则的归一化嵌入。这使轻量工作即可实现似然估计,从而支持高效的GP训练和推断。

要点(PIEVO中的假设选择)。总体而言,GP用于建模似然p(y|h,P),以更新原则信念,并选择在探索与利用之间保持平衡的假设进行测试。

3.4. 原则的连贯增广

在科学发现中,对外部世界的初始构想往往并不完整。如果真实原则缺失,智能体可能陷入认识停滞。PIEVO通过异常驱动的原则空间扩展解决这一问题,包括(a)识别异常和(b)通过提出新原则来调和异常。

识别异常。系统首先计算异常分数Ss,以监控原则的有效性;该分数是一个有界指标,用于代理实验证据的认识惊异度。该分数量化观测与GP预测之间的不匹配程度,同时考虑模型不确定性和观测噪声。对于新的观测(hs,ys),当前最大后验(MAP)原则PtMAP下的异常分数为:

(3)Ss=1exp((ysμMAP(hs))2σMAP2(hs)+σobs2)>θt,

其中,θt(0,1)为异常阈值,μMAP(hs)σMAP2(hs)分别为MAP原则下的预测均值和方差,σobs2为观测噪声方差。若Ss>θt,则该观测被标记为异常。一组高惊异度假设构成异常集合Ut,表明当前原则空间Pt不足以解释已观测现象。

通过连贯原则增广调和异常。检测到异常后,PIEVO触发发现阶段,由原则智能体提出新的候选PnewP¯以解决Ut中的矛盾。随后,活跃原则Pt的后验信念在增广集合Pt+1=Pt{Pnew}上重新计算:

(4)pt+1(P)p0(P)s=1txip(ys|hs,P),

只有当新原则对Ht提供更强解释力时,才会被采纳。

定理3.3(收敛性与效率,非正式)。在连贯原则增广和校准生成器条件下,PIEVO优化循环保证:(a)亚线性累积遗憾,其中累积遗憾满足R(T)=O~(T);(b)后验一致性,其中系统信念pt(P)集中到最优原则P

总体而言,PIEVO的实现由算法流程和提示模板组成,其优化过程提供了强理论保证。此外,PIEVO的优越效率体现为相较PiFlow更快的收敛速度,并已得到经验验证。

要点(PIEVO中的连贯增广)。基于惊异度的异常检测既允许通过阈值控制敏感性,也支持动态原则调和。这种自闭合更新确保科学认知随经验证据连贯演化。

4. 实验

4.1. 实验设置

任务与基准。PIEVO在四个标准科学发现基准上进行评估:纳米材料光学性质优化(NHO)、分子生物活性优化(MBO)和超导体临界温度优化(SPO),覆盖连续(七维)、离散和混合搜索空间;此外还包括过渡金属配合物优化(TMC),用于四维组合实体搜索。通过采用高保真代理模型,每个任务都旨在受限实验预算内最大化目标性质值。

基线。PIEVO与三类多智能体系统(MAS)进行基准比较:(a)经典策略:包括VanillaMAS,即没有高阶策略的迭代式假设测试循环;以及ReAct,该方法将推理轨迹与动作交错结合。(b)自主科学智能体:包括AI-Researcher和The-AI-Scientist(v1/v2)的定制适配版本;为公平比较,这些版本被限制在核心假设生成模块内,不使用网络搜索和检索。(c)原则引导方法:以PiFlow为代表,该当前最优方法在静态科学原则条件下生成假设。Co-scientist、Kosmos和Robin等其他方法未纳入比较分析,因为它们要么面向特定科学领域定制,要么采用已由选定基线代表的假设测试机制。

实现细节。所有实验均强制采用24次试验的严格预算,并将智能体上下文截断为最近10条消息,以缓解上下文溢出。性能指标报告为三次独立运行的均值±标准差。Qwen3-32B使用no_think提示强制禁用Chain-of-Thought;Gemini-2.5-Flash-NoThinking后端温度设置为0.6。额外的think模式消融实验通过API使用Gemini-2.5-Flash-Thinking。

4.2. 评估指标

为全面评估性能,采用多维指标衡量以下能力:(a)达到目标,(b)探索宽度,以及(c)有前景的利用。

a. 解质量(SQ)。定义为在假设-结果轨迹T内达到的最大结果;结果按每个任务的理论最大值(NHO和SPO)或经验最大值(MBO和TMC)μref归一化:

SQ=max{yk|(hk,yk)T}μref×100%

高于100%的SQ表示发现了优于参考数据集或最大值的解。

b. 平均成对距离(APD)。该值描述所有有效假设的平均成对距离,其中每个任务均由ϕ(h)进行特征化:

APD=2M(M1)i<jMd(ϕ(hi),ϕ(hj))

更高的APD表示搜索范围更广,这是新发现和覆盖景观的前提。

c. 优化曲线下面积(AUOC)。该值衡量固定预算下的累积最大性能:

AUOC=1Tμreft=1Tmaxkt{yk}

更高的AUOC意味着更优的搜索效率,即能够更早识别有前景方向并有效利用。

4.3. 性能分析

表1|在4个基准上的性能比较(以解答质量SQ %衡量) 结果按大语言模型分类,即Qwen3-32B和Gemini-2.5-Flash的非思考模式,并标注相对于Vanilla MAS的SQ优势或劣势。PIEVO优于所有基线,在平均上实现了Vanilla MAS的1.5∼1.7倍SQ。

图4|基于Qwen3-32B的基线轨迹比较 绘制每个任务随时间的累积最佳解答质量。SQ >100%表示超过经验参考值。PIEVO在所有任务中均持续优于基线,但在TMC和SPO等具有挑战性的任务中,由于假设搜索的固有复杂性,差距较小。

PIEVO与六个基线在四个基准上的比较,以及NHO任务中不同几何维度下的可扩展性分析,共产生三个主要观察:

Obs.➊:PIEVO在解质量上建立了新的当前最优水平。PIEVO优于所有基线,平均SQ达到90.81%93.15%。这相当于相较领先AI科学家框架(62.26%64.82%)和原则条件化PiFlow(70.03%71.07%)提升约30%,确认了动态原则演化能够有效地将探索限制在高价值科学流形中。

表2|在4个基准上的探索(APD ↑)与利用(AUOC ↑)比较 结果按大语言模型分类,即Qwen3-32B和Gemini-2.5-Flash的非思考模式,并标注相对于Vanilla MAS的平均性能优劣。PIEVO在探索与利用两方面均实现优越平衡,如图7所示。

图5|参数敏感性消融 异常计数阈值和异常阈值影响原理数量,而sigma作为噪声表示影响系统的探索能力。预热轮次影响系统的初始化能力。

Obs.➋:PIEVO有效平衡探索与利用。PIEVO在多样性(APD=54.7%)和收敛效率(AUOC=84.0%)上均表现出优势。不同于为爬山速度牺牲多样性的基线(例如AIResearcher),PIEVO的双循环机制确保假设空间得到广泛覆盖,同时不牺牲局部优化。

表3|不同搜索维度下NHO任务性能 最佳结果加粗,次优结果加下划线。

图6|PiFlow与PIEVO在MBO任务中的比较 如表1和表2所示,相较于PiFlow,PIEVO在83.3%的任务中实现加速并降低经验性损失,显示出更高的效率。

Obs.➌:PIEVO在高维搜索空间中表现稳健。在NHO任务中,搜索空间复杂度随几何维度扩展;PIEVO在46维上保持84.56%的高平均SQ。相反,随着维度增加,基线性能急剧下降(例如PiFlow降至72.93%),表明PIEVO在复杂设计空间导航方面具有更强可扩展性。

图7|所有任务的帕累托前沿 PIEVO位于帕累托前沿,表明其在科学发现中的探索(APD)与利用(AUOC)方面均实现优越平衡。

4.4. 效率分析

PIEVO的发现效率通过两个关键维度评估:解质量(SQ)和计算成本。PIEVO在这两个指标上均表现出显著收益。

Obs.➍:PIEVO实现亚线性遗憾和加速收敛。经验轨迹验证了理论上的亚线性遗憾界O~(T)。具体而言,相较PiFlow,PIEVO在收敛步数上实现83.3%的加速。曲线拟合显示,PIEVO的遗憾系数(13.49T)显著低于PiFlow(37.91T)。这一约3×的降低从经验上支持了一个理论洞见:在原则空间(熵H(P))上优化,本质上比搜索庞大的假设空间(熵H(H))更具样本效率,即H(P)T<H(H)T

表4|NHO任务的性能与效率比较 性能以表1中SQ表示。τrun表示执行时间(秒)。效率计算为SQ / log10(τrun)

4.5. 案例研究:发现物理机制

任务场景。PIEVO被部署到纳米光子学中的一个挑战性发现任务:识别孤立纳米螺旋中圆二色性(CD)的电动力学起源。不同于已有较充分研究的螺旋阵列,单结构手性的支配规律仍很大程度上未被探索。PIEVO及其智能体在没有任何文档资源的情况下初始化,必须演化出原则来解释从高保真代理模型获得的手性。

Obs.➎:PIEVO自主识别出电动力学机制。仅经过30次迭代,PIEVO便成功识别出一个高惊异度异常。在这一差距触发下,PIEVO综合出一个统一理论,将强手性归因于环向矩和电四极矩之间的干涉。该机制随后通过人工全波FDTD分析得到佐证,展示了PIEVO在复杂系统中揭示物理规律的能力。

图8|PIEVO模块在NHO任务中的消融研究 (a) PIEVO层带来的性能提升。 (b) PIEVO各子模块开/关情况下的性价比比较。

4.6. 消融实验

超参数敏感性。PIEVO对关键超参数的敏感性得到分析,包括异常阈值θt、观测噪声σ和IDS预热轮数。结果显示,PIEVO在较宽的θt范围内具有稳健性,其中最优值需要在异常检测与噪声拒绝之间取得平衡。对于预热,最少量的初始探索(约5轮)已足以使GP专家建立有意义的先验,从而有效降低不确定性。

表5|PIEVO的消融研究 Greedy Only模式用于禁用假设选择,Static Evolution用于禁用NHO任务中的原理优化。效率计算为SQ除以对数时间。

PIEVO模块消融。为区分各组件贡献,在NHO任务上进行了消融。禁用连贯增广(静态演化)后,SQ上限为85.87%,因为智能体无法访问初始先验之外的高价值区域。类似地,移除信息导向选择(贪婪)会使SQ降至84.03%,限制了对原则-证据不确定性的高效消解。完整PIEVO框架达到96.36%的SQ,确认动态原则演化与信息导向采样之间的协同作用对于稳健发现至关重要。

PIEVO动态与测试时推理的消融。系统内部机制和Think模式下的测试时推理也得到进一步分析。结果发现:(a)PIEVO系统性地演化出与解质量直接相关的高保真原则,验证了原则空间优化的有效性。(b)存在一种认知干扰效应,即Think模型会降低性能(下降26.35%),因为LLM的多样化推理与战略层的严格效用发生冲突。

5. 结论

PIEVO框架将科学发现从静态假设搜索重新表述为在演化原则空间上的贝叶斯优化。通过将基于GP专家的信息导向选择与异常驱动的认识增广协同结合,PIEVO主动细化其理论世界观。经验上,PIEVO实现了解质量31.06%的提升、亚线性遗憾以及手性物理的自主发现,从而确立了原则演化作为科学智能体关键范式的地位。