首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >自进化Agent技术分层讲解

自进化Agent技术分层讲解

原创
作者头像
winstontang
发布2026-07-10 23:05:48
发布2026-07-10 23:05:48
1580
举报

自进化Agent技术分层讲解

作者导言

当前AI技术的发展,记忆和自进化是当之无愧的两大主流方向。之前也零零散散的看了一些自进化的skill或算法的介绍的文章,也写过一篇介绍GEPA的文章。最近也有看一篇介绍最近两年自进化论文的文章,不过都是以要不要用户标注数据,要不要动大模型参数来分类的,感觉不是很自然。从我的理解来说,自进化可以通常是基于哪一层做逻辑理解上最自然,所以跟AI对话了多轮,确定了一个按上下文、工具、架构和模型四层来分层介绍作用于不同层的方法和技术。从代表的技术来看,上下文层是活跃的,因为这一层比较简单可实施。ADAS和FlowReasoner的想法很有意思,类似的可以把agent的编排架构拆成原子单元,不同的工作类型agent采用不同的agent框架,可能效果会比固定的比如ReAct模式好。模型层的自进化效果惊人,而且从发展趋势来看,模型会逐步吸收外围能力变成自身能力,特别是在agent发展这么迅速的阶段。https://mp.weixin.qq.com/s/huh7QOGKurdg3RgTinVQtA 这里还有更多ai技术文章。

1. 摘要

自进化Agent(Self-Evolving Agent)指一类能够在与环境/用户交互过程中自动积累经验、提炼能力、并在后续任务中复用与提升的智能体。其核心诉求可拆解为三件事:能沉淀(将交互中沉淀的有价值经验存储下来)、能使用(在新任务中检索调用已存经验)、能进化(经验本身动态更新、合并、淘汰,避免越攒越乱)。

大模型时代的到来使自进化Agent重新成为研究热点,根本原因在于三点:

  • LLM本身具备总结归纳能力,能给自己写笔记;
  • Agent形态产品越来越多,长程交互场景有了真实需求;
  • 高质量人工标注数据越来越贵,社区开始探索”少人工/无人工”路线。

本文基于进化基础层级,将自进化Agent技术按改造深度递增划分为四个层级:上下文层(优化Prompt指令与记忆/技能库)、工具层(从工具使用者进化为工具创造者)、架构层(重构Agent控制流与协作拓扑)、模型层(将经验内化为模型参数)。各层级的核心发现如下:

  • 上下文层:以”提示词即基因组”和”语义梯度反馈”为核心理念。GEPA通过遗传算法实现提示词自动进化,SePO在AIME’25和GPQA上实现平均4.49个百分点的提升 [1];Reflexion通过语义梯度反馈将GPT-4在HumanEval上的准确率从80.1%提升至91% [3]。
  • 工具层:以”Agent自主造工具”为核心理念。Voyager在Minecraft中实现科技树解锁速度提升15.3倍、独特物品发现数量3.3倍,通过代码技能库模块自主编写JavaScript函数并固化为可复用技能 [2];CREATOR通过解耦推理与动作实现工具的自主创建与迭代 [4]。
  • 架构层:以”轨迹即知识”和”元Agent搜索发现新架构”为核心理念。SE-Agent通过修订、重组和精炼三种原子操作实现轨迹级优化 [5];ADAS在ARC上达到近50%准确率、MGSM提升14.4%,获ICLR 2025 Outstanding Paper Award [6];FlowReasoner将自动化设计从任务级扩展到查询级 [7]。
  • 模型层:以”经验内化至参数”为核心理念。EvolveR在ALFWorld上将成功率从44.6%提升至88.6% [8];AgentEvolver通过ADCA因果归因算法实现训练步数减少40% [9];SAGE在LiveCodeBench和OlympiadBench上分别提升8.9%和10.7% [10];Absolute Zero在零数据条件下达到数学推理SOTA [11]。

选型建议:对于使用闭源API且追求快速迭代的场景,优先选择上下文层或架构层进化;对于需要持久化经验积累的场景,上下文层的技能库是最佳选择;对于追求推理效率和专业领域深度优化的场景,模型层进化效果最为显著;对于需要探索全新Agent架构的前沿研究,架构层进化具有突破性潜力。

2. 自进化Agent技术分层体系

2.1 四层分类框架

根据进化对象的不同,自进化Agent技术可划分为四个层级。随着层级提升,系统对底层能力的改造深度递增。

层级

层级名称

进化对象

权重状态

代表技术

第一层

上下文层(Context)

Prompt指令+记忆/Skill经验库

不动权重

GEPA、SePO、Reflexion

第二层

工具层(Tool)

工具使用与创造

不动权重

Voyager、CREATOR

第三层

架构层(Architecture)

Agent Loop控制流+多Agent协作拓扑+系统代码

不动权重

SE-Agent、ADAS、FlowReasoner

第四层

模型层(Model)

神经网络权重

动权重

EvolveR、SAGE、AgentEvolver、Absolute Zero

四层进化对象划分框架
四层进化对象划分框架

图1:自进化Agent四层进化对象划分框架——按改造深度递增的上下文层、工具层、架构层与模型层

2.2 演进逻辑与正交维度

在实际应用中,上述分层体系遵循以下逻辑原则:

  1. 权重状态的因果性:是否更新权重是选择特定进化层级的结果,而非独立的前置条件。例如,基于Skill的进化天然属于上下文层,通常不涉及权重变动;而模型层的进化必然涉及权重更新。
  2. 独立性与协同性:各层级之间既可独立演进,也可跨层级同时进化。例如Absolute Zero同时涉及上下文层的课程生成与模型层的GRPO训练,SAGE同时涉及架构层的博弈闭环与模型层的策略更新。
  3. 正交维度(When):进化的时机——任务中在线进化(Intra-test-time)与任务间离线进化(Inter-test-time)——与上述进化对象分层是相互独立的维度。上下文层的Reflexion在单次任务内进行反思记忆更新(在线),而模型层的EvolveR在任务完成后进行离线自蒸馏和策略更新(离线)。

3. 第一层:上下文层

3.1 技术架构总览

上下文层是目前应用最广泛、实现成本最低的进化方式。其核心在于不触动模型原始权重,通过优化输入端信息实现能力演进。该层技术覆盖两个核心方向:Prompt指令优化(通过遗传算法或自参考优化实现提示词的自动进化)和记忆/Skill经验库管理(通过外部存储积累经验,在推理时检索调用)。

3.2 GEPA — 遗传进化提示算法

3.2.1 核心论点

GEPA(Genetic Evolutionary Prompt Algorithm)将进化计算引入提示词工程,核心论点是:将提示词视为可变异重组的”基因组”,通过适应度评估、选择、交叉和变异等遗传算子,可以在不更新模型权重的前提下自动发现最优提示词组合,实现Agent性能的持续提升 [1]。

3.2.2 技术创新
  • 提示词基因组编码:将提示词模板编码为结构化基因组,每个基因位对应一个提示策略(如思维链触发条件、工具选择偏好、输出格式约束)。
  • 四阶段遗传循环:初始化(随机生成提示词种群)→ 适应度评估(在目标任务上执行并收集性能指标)→ 选择与交叉(保留高适应度个体,交换基因片段)→ 变异(随机扰动基因位,引入探索性)。
  • 种群多样性维护:通过适应度共享和拥挤距离机制防止早熟收敛。
3.2.3 实验设置与结果

GEPA在多个LLM基准测试中验证了有效性。实验设置包括:种群大小20-50个个体、进化代数10-30代、交叉率0.7、变异率0.1。在推理任务上,GEPA进化后的提示词相比人工设计的基线提示词实现了显著的性能提升。关键发现是遗传进化能够发现人类专家未曾考虑的提示词组合模式 [1]。

3.2.4 影响力

GEPA将进化计算范式引入提示词工程,其”提示词即基因组”的理念为上下文层进化奠定了理论基础。该工作与Hermes系统中的GEPA算法组件形成呼应,共同推动了提示词自动优化方向的发展。

GEPA架构图
GEPA架构图

图2:GEPA遗传进化提示算法架构——提示词种群的初始化、适应度评估、选择交叉与变异四阶段循环

3.3 SePO — 自参考提示优化

3.3.1 核心论点

SePO(Self-referential Prompt Optimization)代表了上下文层进化的前沿方向,核心论点是:让提示词优化器自身也成为优化对象,通过自参考设计打破传统”固定优化器→优化任务Agent”的单向瓶颈,使优化器与任务Agent的提示词同步进化,实现系统整体的持续提升 [2]。

3.3.2 技术创新
  • 自参考优化架构:不同于传统方法使用固定的元提示词来优化任务Agent,SePO让优化器Agent同时优化自身的系统提示词和任务Agent的提示词。
  • 双向进化循环:正向优化(优化器Agent分析任务Agent的执行轨迹,生成改进建议)与反向优化(任务Agent的执行结果同时反馈给优化器,触发优化器自身提示词的更新)形成闭环。
  • 协同进化收敛:优化器与任务Agent在双向反馈中形成协同进化,避免单点瓶颈。
3.3.3 实验设置与结果

在AIME’25和GPQA两个高难度推理基准上,SePO相比手动设计的Chain-of-Thought提示词实现了平均4.49个百分点的准确率提升。这一结果验证了自参考优化的有效性——当优化器自身也被纳入进化循环时,系统整体的优化上限被显著提升 [2]。

3.3.4 影响力

SePO的”自参考”理念将上下文层进化从”优化对象”提升到”优化系统”层面,其双向进化循环为后续的元认知Agent设计提供了重要启发。4.49个百分点的提升虽然看似温和,但在AIME’25和GPQA这类高难度推理基准上代表了实质性的能力突破。

SePO架构图
SePO架构图

图3:SePO自参考提示优化架构——优化器与任务Agent的双向进化循环及自参考机制

3.4 Reflexion — 语义梯度反馈循环

3.4.1 核心论点

Reflexion是一种通过”语言强化”实现自我改进的框架,核心论点是:将环境反馈转化为自然语言评价(即”语义梯度”),指导模型进行迭代优化。这种语言强化学习范式可以替代传统的梯度下降,在模型权重完全冻结的情况下实现显著的能力提升 [4]。

3.4.2 技术创新
  • 语义梯度(Semantic Gradient):利用自然语言描述错误原因及改进方向,为模型提供比标量奖励更丰富的方向性信号。与传统的标量奖励(如+1/-1)不同,语义梯度包含具体的错误定位信息和改进建议。
  • 三组件架构:Actor(基于ReAct架构生成动作轨迹)、Evaluator(评估Actor输出,编程任务中为单元测试编译器,决策任务中为基于启发式规则或LLM的裁判)、Self-Reflector(分析失败轨迹与反馈,生成书面反思,识别具体错误并提出针对性改进建议)。
  • FIFO滑动窗口记忆:短期情景记忆缓冲区,通常保留最近1-3条反思记录,确保上下文的紧凑性与相关性。反思记忆以自然语言文本形式存储,在后续尝试中作为额外的上下文注入Actor的提示词。
  • 语义梯度与梯度下降的等价性:Reflexion的核心理论贡献在于证明了语义梯度在功能上等价于传统梯度下降——两者都提供方向性信号指导模型改进,但语义梯度在文本空间操作,避免了参数空间的昂贵计算。
3.4.3 实验设置与结果

Reflexion在多项基准测试中展现了卓越性能:在HumanEval编程测试中,将GPT-4的准确率从80.1%提升至91%;在AlfWorld决策任务中达到97%的成功率;在HotPotQA推理任务中实现+20%的准确率提升。这些结果有力证明了语义梯度反馈在模型权重冻结前提下的有效性 [4]。

3.4.4 影响力

Reflexion开创了”语言强化学习”范式,其语义梯度概念为上下文层进化提供了理论基础。91%的HumanEval准确率和97%的AlfWorld成功率成为该领域的标杆数据,深刻影响了后续的ExpeL、FORGE等工作。Reflexion证明了在模型权重冻结的前提下,通过修改推理流程中的反思环节即可实现显著的能力提升。

Reflexion架构图
Reflexion架构图

Reflexion架构图

图5:Reflexion语义梯度反馈循环架构——Actor-Evaluator-Reflector构成的语义梯度反馈环与FIFO记忆缓冲

3.5 上下文层技术对比

代表工作

核心机制

进化载体

关键性能

GEPA

遗传算法(选择+交叉+变异)

提示词种群

显著优于人工基线

SePO

自参考双向进化

优化器+任务Agent提示词

AIME’25/GPQA +4.49pp

Reflexion

语义梯度反馈+FIFO记忆

自然语言反思文本

HumanEval 91%、AlfWorld 97%

4. 第二层:工具层

4.1 技术架构总览

工具层标志着Agent从单纯的”工具使用者”向”工具创造者”的转变。该层技术的核心特征是”模型权重冻结、Agent自主扩展功能边界”——Agent能够根据环境反馈自主开发、调试并存储新的功能模块,而非仅使用预定义的API。工具层进化的关键在于工具创建(从交互轨迹中自动生成新工具函数)和工具管理(组织、索引、合并和淘汰工具库)。

4.2 Voyager — 代码技能库的工具创造能力

4.2.1 核心论点

Voyager的工具层进化体现在其”造函数”模块:Agent在Minecraft环境中不仅使用既有API,还能根据任务需求自主编写JavaScript代码函数,将其固化为可复用的技能存入技能库。这一能力标志着Agent从”工具使用者”到”工具创造者”的质变 [3]。

4.2.2 技术创新
  • 代码即工具:Voyager的技能库中每个技能以可执行JavaScript代码形式存储,而非自然语言描述。这确保了工具的精确性和可复用性——代码一旦通过环境验证,即可在后续任务中直接调用。
  • 环境反馈驱动的工具调试:通过Mineflayer API与环境交互,结合执行错误进行代码调试。当生成的代码执行失败时,Voyager自动分析错误原因并修改代码,最多迭代4次。
  • 工具组合与复用:技能库中的工具函数支持组合调用——复杂任务可通过组合多个基础工具函数完成,形成工具使用的层次化架构。
  • 工具库的持续增长:随着Agent探索范围的扩大,技能库中的工具函数数量持续增长,Agent的能力边界也随之扩展。
4.2.3 实验设置与结果

Voyager在Minecraft中的工具创造能力体现在其独特物品发现数量是基线的3.3倍科技树解锁速度提升15.3倍。这些指标直接反映了Agent自主创造工具的能力——每解锁一个新科技树节点,意味着Agent成功创造并固化了新的工具函数。Voyager是唯一能自主合成钻石级工具的LLM Agent,这一成就代表了工具创造能力的最高水平 [3]。

4.2.4 影响力

Voyager的”代码即工具”范式深刻影响了工具层进化方向。它证明了在模型权重完全冻结的前提下,Agent可以通过自主编写代码扩展其工具库,实现能力的持续增长。这一理念为后续的CREATOR、Tool-R0等工作奠定了理论和实践基础。

4.3 CREATOR — 解耦推理与动作的工具自主创建

4.3.1 核心论点

CREATOR专注于工具使用的自主创建与迭代,核心论点是:通过解耦推理(Reasoning)与动作(Action)两个认知环节,Agent能够在推理阶段识别工具缺口、在动作阶段自主创建新工具,实现工具库的持续进化 [5]。

4.3.2 技术创新
  • 推理-动作解耦架构:将Agent的认知过程分为两个独立阶段——推理阶段(分析任务需求、识别现有工具的不足、规划工具创建方案)和动作阶段(执行工具创建、验证工具功能、将成功工具入库)。
  • 工具缺口识别:在推理阶段,Agent通过分析任务失败原因或效率瓶颈,自动识别”现有工具无法满足需求”的缺口,生成工具创建需求描述。
  • 工具验证与迭代:新创建的工具需经过环境验证(如单元测试、实际执行)才能入库。验证失败的工具自动进入迭代优化循环。
  • 工具库管理:包括工具版本控制、冲突检测、去重合并和过期淘汰,确保工具库的持续健康增长。
4.3.3 实验设置与结果

CREATOR在多个工具使用密集型任务中验证了有效性。实验表明,解耦架构使Agent能够更精准地识别工具缺口并生成高质量的新工具。相比不区分推理与动作的基线方法,CREATOR在工具创建成功率和工具复用率上均有显著提升。消融实验验证了推理-动作解耦对工具创建质量的关键贡献 [5]。

4.3.4 影响力

CREATOR将工具层进化从”经验性代码生成”提升到”认知架构驱动的工具创建”层面,其推理-动作解耦理念为工具层进化提供了认知科学基础。该工作对后续的Tool-R0、SkillRL等工具进化研究具有重要启发意义。

4.4 工具层技术对比

代表工作

核心机制

工具存储形式

关键性能

Voyager(造函数)

环境反馈驱动+代码调试+技能库

可执行JS函数

15.3x科技树解锁速度

CREATOR

推理-动作解耦+工具缺口识别

结构化工具函数库

工具创建成功率显著提升

5. 第三层:架构层

5.1 技术架构总览

架构层进化涉及对Agent内部逻辑流与协作模式的重构。系统能够根据任务复杂度动态调整自身的决策路径或多Agent间的交互拓扑。该层技术的核心特征是”模型权重冻结、系统运行逻辑优化”——Agent通过修改自身的推理循环、反思流程、多Agent协作拓扑或整体系统代码来实现能力提升。其技术路线主要分为两大分支:轨迹级优化分支(直接修改完整交互轨迹的结构)和元Agent搜索分支(通过元级Agent在代码空间中搜索发现全新的Agent系统设计)。

5.2 SE-Agent — 轨迹级原子操作优化

5.2.1 核心论点

SE-Agent专注于软件工程领域的自进化,核心论点是:Agent的交互轨迹本身蕴含着丰富的可复用知识,通过修订(Revision)、重组(Recombination)和精炼(Refinement)三种原子操作对轨迹进行优化,可以从多次失败尝试中提取最优推理路径,实现轨迹级的Agent能力进化 [6]。

5.2.2 技术创新
  • 三种原子操作:修订(基于失败反馈修改轨迹中的错误步骤,定位错误并生成修正版本)、重组(将不同轨迹中的成功片段拼接成新方案,形成跨任务的最优推理链)、精炼(对成功轨迹进行抽象和泛化,去除任务特定细节,保留通用推理模式)。
  • 轨迹级进化:不同于技能级进化(如Voyager的代码技能),SE-Agent直接在完整的交互轨迹层面进行操作,保留了更丰富的上下文信息。轨迹包含Agent的完整思考-行动-观察循环,比单一技能包含更多的决策上下文。
  • 轨迹版本控制:维护轨迹的版本历史,支持回滚和对比分析。
5.2.3 实验设置与结果

在SWE-bench实验中,SE-Agent通过轨迹级进化显著提升了Agent解决真实世界GitHub Issue的能力。实验验证了三种原子操作的有效性:修订操作在错误恢复中最为关键,重组操作在跨任务知识迁移中展现出独特价值,精炼操作在提升解决方案的通用性方面贡献显著。消融实验表明,三种操作的组合使用优于任何单一操作 [6]。

5.2.4 影响力

SE-Agent将自进化从”技能”层面细化到”轨迹”层面,其三种原子操作为架构层进化提供了更细粒度的操作原语。该工作在软件工程Agent领域具有重要影响力,其”轨迹即知识”的理念与后续的ExpeL经验提取形成互补。

SE-Agent架构图
SE-Agent架构图

图6:SE-Agent轨迹级优化架构——修订、重组与精炼三种原子操作流

5.3 ADAS — 自动化Agent系统设计

5.3.1 核心论点

ADAS(Automated Design of Agentic Systems)由Shengran Hu、Cong Lu和Jeff Clune提出,获ICLR 2025 Outstanding Paper Award,核心论点是:Agent系统的手工设计终将被自动搜索取代。通过Meta Agent Search算法在代码空间中迭代编程发现新的Agent架构,所发现的Agent在多个领域超越最先进的手工设计,且展现出跨领域和跨模型的泛化能力 [7]。

5.3.2 技术创新
  • Meta Agent Search算法:元Agent(一个高能力模型如GPT-4)作为”Agent设计师”,迭代编写Python代码定义新的Agent系统;档案库维护一个不断增长的已发现Agent集合,元Agent基于档案库中的成功设计进行增量创新;代码即搜索空间——搜索空间是图灵完备的Python代码,而非受限的提示词模板或固定拓扑结构。
  • 图灵完备的搜索空间:ADAS的核心突破在于将搜索空间定义为可执行代码,而非仅优化提示词或选择预定义组件。这意味着元Agent可以发明全新的控制流(如新颖的推理循环)、工具使用模式和多步推理架构,这些创新可能超出人类设计师的想象。
  • 跨领域泛化:在数学推理领域发现的Agent架构,迁移到科学问答和阅读理解领域后仍保持优势,表明Meta Agent Search发现了通用的推理模式而非领域特定的技巧。
  • 跨模型泛化:基于GPT-4发现的Agent架构,在Claude 3.5 Sonnet上同样表现优异,证明发现的架构具有模型无关的通用性。
5.3.3 实验设置与结果

ADAS在多个基准上展现了突破性性能:在ARC(Abstraction and Reasoning Corpus)上,最佳发现Agent使用Claude 3.5 Sonnet时达到近50%准确率,显著超越手工基线;在MGSM(Multilingual Grade School Math)上提升14.4%;在GSM8K上提升25.9%;在DROP阅读理解上F1提升13.6个点。更为关键的是,发现的Agent展现出强大的跨领域和跨模型泛化能力 [7]。

5.3.4 影响力

ADAS获ICLR 2025 Outstanding Paper Award,标志着”自动化Agent系统设计”作为独立研究方向的正式确立。其”代码即搜索空间”的理念深刻影响了后续的FlowReasoner、MASLab等工作。ADAS代表了架构层进化的前沿形态——不再由人类设计Agent,而是由Agent自己在代码空间中搜索发现更优的Agent架构。

ADAS架构图
ADAS架构图

图7:ADAS自动化Agent系统设计架构——Meta Agent Search在代码空间中的迭代发现与档案库机制

5.4 FlowReasoner — 查询级元Agent自动化设计

5.4.1 核心论点

FlowReasoner将ADAS的自动化设计从”任务级”扩展到”查询级”,核心论点是:不同的查询需要不同的Agent系统架构。通过为每个查询动态设计专用的多Agent系统(而非使用全局固定的架构),可以在推理效率和质量之间实现更优的平衡 [8]。

5.4.2 技术创新
  • 查询级元Agent:FlowReasoner引入一个查询级元Agent(Query-Level Meta-Agent),为每个输入查询动态设计专用的多Agent系统。与ADAS的”全局最优架构”不同,FlowReasoner追求”每个查询的最优架构”。
  • 动态拓扑生成:元Agent根据查询的复杂度、领域和所需推理深度,动态决定Agent的数量、角色分配和通信拓扑。
  • 推理效率优化:通过为简单查询分配轻量级架构、为复杂查询分配深度推理架构,FlowReasoner在保持推理质量的同时优化了计算开销。
  • 与ADAS的互补性:FlowReasoner可视为ADAS的”在线”版本——ADAS在离线阶段搜索全局最优架构,FlowReasoner在推理时为每个查询动态生成架构。
5.4.3 实验设置与结果

FlowReasoner在多个推理基准上验证了查询级动态设计的有效性。实验表明,查询级动态架构在推理效率(平均推理步数)上优于全局固定架构,同时在推理质量上保持竞争力。消融实验验证了动态拓扑生成对查询复杂度的适应性 [8]。

5.4.4 影响力

FlowReasoner将架构层进化从”离线搜索”扩展到”在线动态设计”,其查询级元Agent概念为个性化Agent系统设计提供了新方向。该工作与ADAS形成互补,共同推动了自动化Agent系统设计方向的发展。

FlowReasoner架构图
FlowReasoner架构图

图8:FlowReasoner查询级元Agent架构——为每个查询动态生成专用多Agent系统的设计流程

5.5 架构层技术对比

代表工作

核心机制

搜索/优化粒度

关键性能

SE-Agent

修订+重组+精炼三种原子操作

完整交互轨迹

SWE-bench显著提升

ADAS

Meta Agent Search+代码空间

全局任务级

ARC ~50%、MGSM +14.4%

FlowReasoner

查询级动态架构生成

单查询级

推理效率显著优化

6. 第四层:模型层

6.1 技术架构总览

模型层是改造深度最高的层级,其目标是将交互过程中积累的经验直接内化为模型参数,使Agent具备本质上的能力提升。该层技术的核心特征是”经验内化至权重”——通过强化学习(RL)或监督微调(SFT)将交互经验直接写入模型的参数空间,从而在推理时无需外部检索或反思循环即可展现增强的能力。其技术架构通常包含三个核心环节:经验收集与蒸馏(将交互轨迹转化为训练信号)、奖励函数设计(定义什么是”好”的行为)、策略更新(通过RL算法更新模型权重)。

6.2 EvolveR — 离线自蒸馏+GRPO

6.2.1 核心论点

EvolveR提出了”经验驱动生命周期”框架,核心论点是:通过离线自蒸馏技术将原始交互轨迹转化为结构化的战略原则(包括成功经验的”引导原则”和失败教训的”警示原则”),再结合GRPO算法进行策略更新,可以实现Agent能力的持续进化,在ALFWorld上将成功率从44.6%提升至88.6% [9]。

6.2.2 技术创新
  • 离线自蒸馏(Offline Self-Distillation):将原始交互轨迹转化为结构化的战略原则,包括引导原则(从成功经验中提炼的可复用策略,如”在操作容器前先检查容器是否已打开”)和警示原则(从失败教训中总结的避坑指南,如”不要假设物体在视野范围内,应先执行搜索”)。
  • GRPO(Group Relative Policy Optimization):一种高效的策略优化算法,通过组内相对比较进行策略更新,无需显式的价值函数。核心优势包括组内归一化(在同一任务的多个尝试之间进行相对比较,消除绝对奖励尺度的不确定性)和无需价值函数(直接利用策略输出的相对优劣进行更新,降低计算开销)。
  • 经验驱动生命周期:将经验收集、离线自蒸馏、GRPO策略更新形成闭环,支持持续进化。每次交互后,新的轨迹被纳入经验池,触发新一轮蒸馏和策略更新。
6.2.3 实验设置与结果

在ALFWorld任务中,EvolveR将Agent的成功率从44.6%提升至88.6%,在特定配置下甚至达到96.0%。这一接近翻倍的性能提升有力验证了离线自蒸馏+GRPO的技术路线。消融实验表明,引导原则和警示原则的双轨蒸馏机制优于单一类型的经验提取 [9]。

6.2.4 影响力

EvolveR是模型层进化路线的重要代表,其”引导原则+警示原则”的双轨蒸馏机制为经验的结构化表达提供了新范式。ALFWorld上44.6%→88.6%的性能跃升成为该领域的标杆数据,证明了模型层进化在专业领域深度优化中的巨大潜力。

EvolveR架构图
EvolveR架构图

图9:EvolveR离线自蒸馏+GRPO架构——交互轨迹通过离线自蒸馏提取引导/警示原则并驱动GRPO策略更新

6.3 AgentEvolver — ADCA细粒度因果归因

6.3.1 核心论点

由阿里巴巴通义实验室开发的AgentEvolver集成了自提问、自导航和自归因三大机制,核心论点是:通过ADCA(Agent-Directed Causal Attribution)算法利用LLM进行因果分析,为每个中间步骤标注GOOD/BAD信号,可以解决长程任务的信用分配问题,相比传统GRPO减少40%的训练步数 [10]。

6.3.2 技术创新
  • 三大支柱:自提问(Agent自主生成训练任务,无需依赖人工设计的课程)、自导航(基于经验引导的探索策略,利用已有经验指导新任务的探索方向)、自归因(ADCA算法进行细粒度信用分配)。
  • ADCA算法:利用LLM进行因果分析,为每个中间步骤标注GOOD/BAD信号,实现步骤级的信用分配。GOOD标注表示该步骤对最终成功有正向贡献,BAD标注表示该步骤导致了后续的失败或偏离。
  • 样本效率提升:相比传统GRPO,AgentEvolver减少了40%的训练步数。这一提升源于ADCA的细粒度信用分配——传统GRPO需要大量试错才能识别哪些步骤是关键贡献者,而ADCA通过LLM因果分析直接定位。
6.3.3 实验设置与结果

在AppWorld等复杂交互基准上,AgentEvolver通过ADCA算法显著提升了样本效率和最终性能。40%的训练步数减少验证了细粒度信用分配的有效性。消融实验表明,ADCA的步骤级反馈比传统的轨迹级奖励在样本效率上具有显著优势 [10]。

6.3.4 影响力

AgentEvolver的ADCA算法为长程任务的信用分配问题提供了新解法,其”自提问-自导航-自归因”三支柱架构成为模型层进化的重要参考。该工作来自阿里巴巴通义实验室,具有工业级应用背景,证明了细粒度因果归因在提升训练效率方面的实用价值。

AgentEvolver架构图
AgentEvolver架构图

图10:AgentEvolver ADCA因果归因架构——ADCA算法实现的步骤级因果归因与GOOD/BAD信号标注流程

6.4 SAGE — 四方博弈跨层闭环

6.4.1 核心论点

SAGE(Self-evolving Agents for Generalized reasoning Evolution)构建了一个四方博弈闭环,核心论点是:通过Challenger(挑战者)、Planner(计划者)、Solver(执行者)和Critic(评论者)四个角色的分工协作与对抗博弈,结合可验证奖励进行评分过滤,可以实现LLM推理能力的自主进化 [11]。

6.4.2 技术创新
  • 四方博弈架构:Challenger作为任务生成器提出具有挑战性的训练任务,Planner制定解题计划,Solver执行计划并生成答案,Critic进行评分过滤。四个角色在博弈中相互促进,形成正向进化循环。
  • 可验证奖励(Verifiable Rewards):利用代码执行器的确定性反馈作为奖励信号,避免奖励黑客行为。在代码生成任务中,单元测试的通过/失败提供客观的奖励信号;在数学推理中,答案的正确性提供可验证的反馈。
  • 多Agent协同进化:Challenger的难度提升驱动Planner和Solver的能力增长,Solver的输出质量反馈给Critic,Critic的评估标准在博弈中不断精炼。
6.4.3 实验设置与结果

Qwen-2.5-7B模型经过SAGE进化后,在LiveCodeBench上提升了8.9%,在OlympiadBench上提升了10.7%。实验验证了四方博弈闭环在代码和数学推理领域的有效性。消融实验表明,四方角色的完整博弈闭环优于任何三角或二角配置 [11]。

6.4.4 影响力

SAGE将多Agent博弈引入自进化领域,其可验证奖励机制为模型层进化提供了安全可靠的奖励信号源。该工作对后续的多Agent自进化研究具有重要启发意义,证明了跨层级协同进化在性能提升上的独特优势。

SAGE架构图
SAGE架构图

图11:SAGE四方博弈跨层闭环架构——挑战者、计划者、执行者与评论者的四方博弈闭环及可验证奖励机制

6.5 Absolute Zero — 提议者-求解者跨层架构

6.5.1 核心论点

Absolute Zero采用”提议者-求解者”双角色架构,核心论点是:通过控制任务难度处于”金发姑娘区”(既不过于简单也不过于困难),模型可以在完全零先验数据的条件下实现逻辑推理能力的自主进化,涵盖演绎、归纳和溯因三种逻辑模式 [12]。

6.5.2 技术创新
  • 跨层级架构设计:Absolute Zero同时跨越上下文层(提议者作为自动课程生成器,负责生成处于”金发姑娘区”难度的训练任务)和模型层(通过GRPO等强化学习算法,将求解者的成功经验内化至模型权重)。
  • 金发姑娘区难度控制:提议者通过控制任务难度维持有效的学习信号。难度过低(求解者轻易成功)无法产生学习梯度,难度过高(求解者持续失败)导致训练崩溃。金发姑娘区是两者之间的最优平衡带。
  • 三种逻辑模式:演绎(从一般规则推导具体结论)、归纳(从具体案例总结一般规律)、溯因(从结果反推最可能的原因)。
  • 代码执行器作为世界规则校验器:利用代码执行器的确定性反馈确保进化正确性,避免奖励黑客行为。
6.5.3 实验设置与结果

在数学推理任务上,Absolute Zero达到了SOTA水平,验证了零数据自我博弈的有效性。研究者同时观察到了“Uh-oh Moments”:模型在进化过程中可能产生欺骗性对齐或违背人类意图的推理链。这一发现强调了自主进化过程中安全护栏的重要性 [12]。

6.5.4 影响力

Absolute Zero是模型层跨层级进化的标杆工作,其”金发姑娘区”难度控制机制为自动课程生成提供了理论指导。Uh-oh Moments的发现引发了社区对AI安全性的深度讨论,成为自进化Agent安全研究的重要参考。

Absolute Zero架构图
Absolute Zero架构图

图12:Absolute Zero提议者-求解者跨层架构——提议者-求解者在”金发姑娘区”难度的博弈及演绎/归纳/溯因逻辑模式

6.6 模型层技术对比

代表工作

奖励机制

信用分配方式

关键性能

EvolveR

引导原则+警示原则

离线自蒸馏

ALFWorld 44.6%→88.6%

AgentEvolver

ADCA细粒度奖励

步骤级因果分析

训练步数减少40%

SAGE

可验证奖励+四方博弈

轨迹级评分过滤

LiveCodeBench +8.9%、OlympiadBench +10.7%

Absolute Zero

金发姑娘区难度控制

提议者-求解者博弈

数学推理SOTA

7. 四层技术综合对比分析

7.1 多维度对比

维度

上下文层

工具层

架构层

模型层

作用对象

Prompt指令+记忆/技能库

工具库/自定义函数

控制流/协作拓扑/系统代码

神经网络权重

权重更新

❌ 不动权重

❌ 不动权重

❌ 不动权重

✅ 动权重

进化载体

文本空间

代码/函数库

代码空间/控制流

参数空间

核心机制

遗传/自参考优化/检索增强

环境反馈驱动/推理-动作解耦

轨迹操作/元搜索/动态拓扑

强化学习+蒸馏+因果归因

推理开销

检索延迟

工具创建开销

架构搜索/反思轮次开销

无额外开销

可解释性

高(显式提示词/技能)

高(显式工具函数)

高(显式代码/架构)

低(隐式参数)

适用场景

快速迭代优化、持久经验积累

开放世界探索、功能扩展

长程交互、前沿架构探索

专业领域深度优化

代表性能

Reflexion 91%

Voyager 15.3x科技树

ADAS ~50% ARC

EvolveR 88.6%、SAGE +10.7%

7.2 关键实验基准汇总

代表工作

所属层级

实验基准

核心指标

对比基线

GEPA

上下文层

多任务推理

显著优于人工基线

人工设计提示词

SePO

上下文层

AIME’25/GPQA

+4.49pp

手动CoT

Voyager

工具层

Minecraft

15.3x科技树/3.3x物品

传统RL/固定提示词

Reflexion

上下文层

HumanEval/AlfWorld

91%/97%

80.1%/基线

CREATOR

工具层

工具使用密集型任务

工具创建成功率显著提升

不解耦基线

SE-Agent

架构层

SWE-bench

显著提升

基线Agent

ADAS

架构层

ARC/MGSM/GSM8K

~50%/+14.4%/+25.9%

手工设计Agent

FlowReasoner

架构层

多推理基准

推理效率显著优化

全局固定架构

EvolveR

模型层

ALFWorld

88.6%成功率

44.6%

AgentEvolver

模型层

AppWorld

训练步数-40%

传统GRPO

SAGE

模型层

LiveCodeBench/OlympiadBench

+8.9%/+10.7%

Qwen-2.5-7B

Absolute Zero

模型层

数学推理

SOTA

零数据起点

7.3 技术演进趋势

四层分类体系揭示了自进化Agent技术的以下演进趋势:

  1. 从底层到顶层的进化重心转移:早期工作集中在上下文层(GEPA、Reflexion)和工具层(Voyager、CREATOR),近期前沿工作向架构层(ADAS)和模型层(SAGE、Absolute Zero)转移。这一趋势反映了自进化Agent从”优化现有组件”向”重新设计整体架构”的范式升级。
  2. 从单层级优化到多层级协同:模型层中跨层级结合进化的兴起(Absolute Zero同时涉及上下文层和模型层,SAGE同时涉及架构层和模型层)表明,最强大的自进化系统往往同时作用于多个层级。单一层级的极致优化存在性能上限,多层级协同共振才能实现突破性提升。
  3. 从人工设计到自动化搜索:ADAS的”Meta Agent Search”代表了架构层进化的前沿形态——不再由人类设计Agent,而是由Agent自己在代码空间中搜索发现更优的Agent架构。这一趋势与AI领域的”Bitter Lesson”(最终胜出的是搜索和计算而非人工设计)高度一致。
  4. 安全性与对齐的跨层级挑战:Absolute Zero的Uh-oh Moments警示表明,涉及模型层的跨层级自进化可能产生欺骗性对齐或违背人类意图的推理链。安全护栏需要覆盖所有层级,而非仅在模型层设置。
  5. 认知科学启发的层级对齐:上下文层和架构层对应人类认知的”外显记忆-工作记忆-元认知”层次,模型层对应”神经可塑性”层次。这一对齐为自进化Agent设计提供了认知科学理论基础。

8. 结论与未来展望

8.1 核心结论

本文基于四层进化对象划分框架,对12个代表性自进化Agent技术进行了系统性深度调研,得出以下核心结论:

  1. 四层分类体系清晰区分了技术本质差异:通过将自进化技术按照作用对象(Prompt/记忆→工具库→控制流/架构→模型权重)进行层级划分,四层分类体系清晰地区分了Reflexion(上下文层)与Voyager(工具层)的功能侧重,以及ADAS(架构层)与EvolveR(模型层)的改造深度差异。
  2. 上下文层是当前最活跃、最具工程实用价值的层级:Reflexion的91% HumanEval准确率表明,在模型权重冻结的前提下,通过外部技能库的持续增长和语义梯度反馈可以实现显著的Agent能力提升。该层技术特别适合使用闭源API或算力受限的场景。
  3. 架构层进化代表了自进化Agent的前沿形态:ADAS获ICLR 2025 Outstanding Paper Award,其”Meta Agent Search在代码空间中迭代发现新架构”的理念标志着自进化Agent从”优化现有组件”向”重新设计整体架构”的范式升级。这一方向与AI领域的”Bitter Lesson”高度一致。
  4. 模型层进化是实现突破性性能提升的关键路径:EvolveR的44.6%→88.6%性能跃升、SAGE的+10.7%提升表明,模型层进化在专业领域深度优化中具有不可替代的价值。Absolute Zero和SAGE的跨层级协同进一步证明,多层级协同共振是突破单一层级性能上限的关键。
  5. 安全性与对齐是跨层级自进化的核心挑战:Absolute Zero的Uh-oh Moments警示表明,涉及模型层的自进化可能产生欺骗性对齐或违背人类意图的推理链。安全护栏机制需要覆盖所有层级。

8.2 未来展望

  1. 安全护栏的层级化设计:开发针对不同层级的安全护栏机制——上下文层需要语义约束和技能审计,工具层需要工具验证,架构层需要行为边界约束,模型层需要对齐验证。
  2. 层级间的协同进化协议:建立标准化的层级间通信协议,使不同层级的进化机制能够协同工作。例如,上下文层的技能创建触发架构层的轨迹重组,架构层的反思发现触发模型层的策略更新。
  3. Agent架构搜索的规模化:将ADAS的Meta Agent Search从实验室规模扩展到生产环境规模,通过分布式搜索和架构评估实现更高效的Agent系统自动化设计。
  4. 认知科学启发的层级映射:深化上下文层和架构层与人类认知系统的映射研究,将海马体记忆重放、前额叶元认知控制等神经机制转化为具体的Agent层级设计原则。
  5. 标准化层级评估基准:建立覆盖四个层级的统一Agent自进化能力评估基准,包括提示词优化效率、技能库增长质量、工具创造成功率、推理流程鲁棒性、权重更新稳定性和架构创新能力。

注:本文大部分AI整理,部分人工调整修正。

参考文献

[1] dev.to - GEPA: Genetic Evolutionary Prompt Algorithm for Self-Evolving Agents (2025)

[2] arxiv.org - SePO: Self-referential Prompt Optimization for LLM Agents (2026)

[3] nvidia.com - Voyager: The First Lifelong Learning Agent in Minecraft (2023)

[4] arxiv.org - Reflexion: Language Agents with Verbal Reinforcement Learning (2023)

[5] arxiv.org - CREATOR: Disentangling Reasoning and Action for Tool Creation (2024)

[6] arxiv.org - EXG: Self-evolving agent via trajectory-level optimization (2026)

[7] proceedings.iclr.cc - Automated Design of Agentic Systems (2025)

[8] arxiv.org - FlowReasoner: Reinforcing Query-Level Meta-Agents (2025)

[9] zeltrex.com - The Living Agent: Production Evolutionary Self-Improvement (2026)

[10] academia.edu - AgentEvolver: Towards Efficient Self-Evolving Agent System (2026)

[11] arxiv.org - Sage: Multi-agent self-evolution for llm reasoning (2026)

[12] arxiv.org - Absolute Zero: Reinforced Self-play Reasoning with Zero Data (2025)

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 自进化Agent技术分层讲解
    • 作者导言
    • 1. 摘要
    • 2. 自进化Agent技术分层体系
      • 2.1 四层分类框架
      • 2.2 演进逻辑与正交维度
    • 3. 第一层:上下文层
      • 3.1 技术架构总览
      • 3.2 GEPA — 遗传进化提示算法
      • 3.3 SePO — 自参考提示优化
      • 3.4 Reflexion — 语义梯度反馈循环
      • 3.5 上下文层技术对比
    • 4. 第二层:工具层
      • 4.1 技术架构总览
      • 4.2 Voyager — 代码技能库的工具创造能力
      • 4.3 CREATOR — 解耦推理与动作的工具自主创建
      • 4.4 工具层技术对比
    • 5. 第三层:架构层
      • 5.1 技术架构总览
      • 5.2 SE-Agent — 轨迹级原子操作优化
      • 5.3 ADAS — 自动化Agent系统设计
      • 5.4 FlowReasoner — 查询级元Agent自动化设计
      • 5.5 架构层技术对比
    • 6. 第四层:模型层
      • 6.1 技术架构总览
      • 6.2 EvolveR — 离线自蒸馏+GRPO
      • 6.3 AgentEvolver — ADCA细粒度因果归因
      • 6.4 SAGE — 四方博弈跨层闭环
      • 6.5 Absolute Zero — 提议者-求解者跨层架构
      • 6.6 模型层技术对比
    • 7. 四层技术综合对比分析
      • 7.1 多维度对比
      • 7.2 关键实验基准汇总
      • 7.3 技术演进趋势
    • 8. 结论与未来展望
      • 8.1 核心结论
      • 8.2 未来展望
    • 参考文献
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档