
当前AI技术的发展,记忆和自进化是当之无愧的两大主流方向。之前也零零散散的看了一些自进化的skill或算法的介绍的文章,也写过一篇介绍GEPA的文章。最近也有看一篇介绍最近两年自进化论文的文章,不过都是以要不要用户标注数据,要不要动大模型参数来分类的,感觉不是很自然。从我的理解来说,自进化可以通常是基于哪一层做逻辑理解上最自然,所以跟AI对话了多轮,确定了一个按上下文、工具、架构和模型四层来分层介绍作用于不同层的方法和技术。从代表的技术来看,上下文层是活跃的,因为这一层比较简单可实施。ADAS和FlowReasoner的想法很有意思,类似的可以把agent的编排架构拆成原子单元,不同的工作类型agent采用不同的agent框架,可能效果会比固定的比如ReAct模式好。模型层的自进化效果惊人,而且从发展趋势来看,模型会逐步吸收外围能力变成自身能力,特别是在agent发展这么迅速的阶段。https://mp.weixin.qq.com/s/huh7QOGKurdg3RgTinVQtA 这里还有更多ai技术文章。

自进化Agent(Self-Evolving Agent)指一类能够在与环境/用户交互过程中自动积累经验、提炼能力、并在后续任务中复用与提升的智能体。其核心诉求可拆解为三件事:能沉淀(将交互中沉淀的有价值经验存储下来)、能使用(在新任务中检索调用已存经验)、能进化(经验本身动态更新、合并、淘汰,避免越攒越乱)。
大模型时代的到来使自进化Agent重新成为研究热点,根本原因在于三点:
本文基于进化基础层级,将自进化Agent技术按改造深度递增划分为四个层级:上下文层(优化Prompt指令与记忆/技能库)、工具层(从工具使用者进化为工具创造者)、架构层(重构Agent控制流与协作拓扑)、模型层(将经验内化为模型参数)。各层级的核心发现如下:
选型建议:对于使用闭源API且追求快速迭代的场景,优先选择上下文层或架构层进化;对于需要持久化经验积累的场景,上下文层的技能库是最佳选择;对于追求推理效率和专业领域深度优化的场景,模型层进化效果最为显著;对于需要探索全新Agent架构的前沿研究,架构层进化具有突破性潜力。
根据进化对象的不同,自进化Agent技术可划分为四个层级。随着层级提升,系统对底层能力的改造深度递增。
层级 | 层级名称 | 进化对象 | 权重状态 | 代表技术 |
|---|---|---|---|---|
第一层 | 上下文层(Context) | Prompt指令+记忆/Skill经验库 | 不动权重 | GEPA、SePO、Reflexion |
第二层 | 工具层(Tool) | 工具使用与创造 | 不动权重 | Voyager、CREATOR |
第三层 | 架构层(Architecture) | Agent Loop控制流+多Agent协作拓扑+系统代码 | 不动权重 | SE-Agent、ADAS、FlowReasoner |
第四层 | 模型层(Model) | 神经网络权重 | 动权重 | EvolveR、SAGE、AgentEvolver、Absolute Zero |

图1:自进化Agent四层进化对象划分框架——按改造深度递增的上下文层、工具层、架构层与模型层
在实际应用中,上述分层体系遵循以下逻辑原则:
上下文层是目前应用最广泛、实现成本最低的进化方式。其核心在于不触动模型原始权重,通过优化输入端信息实现能力演进。该层技术覆盖两个核心方向:Prompt指令优化(通过遗传算法或自参考优化实现提示词的自动进化)和记忆/Skill经验库管理(通过外部存储积累经验,在推理时检索调用)。
GEPA(Genetic Evolutionary Prompt Algorithm)将进化计算引入提示词工程,核心论点是:将提示词视为可变异重组的”基因组”,通过适应度评估、选择、交叉和变异等遗传算子,可以在不更新模型权重的前提下自动发现最优提示词组合,实现Agent性能的持续提升 [1]。
GEPA在多个LLM基准测试中验证了有效性。实验设置包括:种群大小20-50个个体、进化代数10-30代、交叉率0.7、变异率0.1。在推理任务上,GEPA进化后的提示词相比人工设计的基线提示词实现了显著的性能提升。关键发现是遗传进化能够发现人类专家未曾考虑的提示词组合模式 [1]。
GEPA将进化计算范式引入提示词工程,其”提示词即基因组”的理念为上下文层进化奠定了理论基础。该工作与Hermes系统中的GEPA算法组件形成呼应,共同推动了提示词自动优化方向的发展。

图2:GEPA遗传进化提示算法架构——提示词种群的初始化、适应度评估、选择交叉与变异四阶段循环
SePO(Self-referential Prompt Optimization)代表了上下文层进化的前沿方向,核心论点是:让提示词优化器自身也成为优化对象,通过自参考设计打破传统”固定优化器→优化任务Agent”的单向瓶颈,使优化器与任务Agent的提示词同步进化,实现系统整体的持续提升 [2]。
在AIME’25和GPQA两个高难度推理基准上,SePO相比手动设计的Chain-of-Thought提示词实现了平均4.49个百分点的准确率提升。这一结果验证了自参考优化的有效性——当优化器自身也被纳入进化循环时,系统整体的优化上限被显著提升 [2]。
SePO的”自参考”理念将上下文层进化从”优化对象”提升到”优化系统”层面,其双向进化循环为后续的元认知Agent设计提供了重要启发。4.49个百分点的提升虽然看似温和,但在AIME’25和GPQA这类高难度推理基准上代表了实质性的能力突破。

图3:SePO自参考提示优化架构——优化器与任务Agent的双向进化循环及自参考机制
Reflexion是一种通过”语言强化”实现自我改进的框架,核心论点是:将环境反馈转化为自然语言评价(即”语义梯度”),指导模型进行迭代优化。这种语言强化学习范式可以替代传统的梯度下降,在模型权重完全冻结的情况下实现显著的能力提升 [4]。
Reflexion在多项基准测试中展现了卓越性能:在HumanEval编程测试中,将GPT-4的准确率从80.1%提升至91%;在AlfWorld决策任务中达到97%的成功率;在HotPotQA推理任务中实现+20%的准确率提升。这些结果有力证明了语义梯度反馈在模型权重冻结前提下的有效性 [4]。
Reflexion开创了”语言强化学习”范式,其语义梯度概念为上下文层进化提供了理论基础。91%的HumanEval准确率和97%的AlfWorld成功率成为该领域的标杆数据,深刻影响了后续的ExpeL、FORGE等工作。Reflexion证明了在模型权重冻结的前提下,通过修改推理流程中的反思环节即可实现显著的能力提升。

Reflexion架构图
图5:Reflexion语义梯度反馈循环架构——Actor-Evaluator-Reflector构成的语义梯度反馈环与FIFO记忆缓冲
代表工作 | 核心机制 | 进化载体 | 关键性能 |
|---|---|---|---|
GEPA | 遗传算法(选择+交叉+变异) | 提示词种群 | 显著优于人工基线 |
SePO | 自参考双向进化 | 优化器+任务Agent提示词 | AIME’25/GPQA +4.49pp |
Reflexion | 语义梯度反馈+FIFO记忆 | 自然语言反思文本 | HumanEval 91%、AlfWorld 97% |
工具层标志着Agent从单纯的”工具使用者”向”工具创造者”的转变。该层技术的核心特征是”模型权重冻结、Agent自主扩展功能边界”——Agent能够根据环境反馈自主开发、调试并存储新的功能模块,而非仅使用预定义的API。工具层进化的关键在于工具创建(从交互轨迹中自动生成新工具函数)和工具管理(组织、索引、合并和淘汰工具库)。
Voyager的工具层进化体现在其”造函数”模块:Agent在Minecraft环境中不仅使用既有API,还能根据任务需求自主编写JavaScript代码函数,将其固化为可复用的技能存入技能库。这一能力标志着Agent从”工具使用者”到”工具创造者”的质变 [3]。
Voyager在Minecraft中的工具创造能力体现在其独特物品发现数量是基线的3.3倍、科技树解锁速度提升15.3倍。这些指标直接反映了Agent自主创造工具的能力——每解锁一个新科技树节点,意味着Agent成功创造并固化了新的工具函数。Voyager是唯一能自主合成钻石级工具的LLM Agent,这一成就代表了工具创造能力的最高水平 [3]。
Voyager的”代码即工具”范式深刻影响了工具层进化方向。它证明了在模型权重完全冻结的前提下,Agent可以通过自主编写代码扩展其工具库,实现能力的持续增长。这一理念为后续的CREATOR、Tool-R0等工作奠定了理论和实践基础。
CREATOR专注于工具使用的自主创建与迭代,核心论点是:通过解耦推理(Reasoning)与动作(Action)两个认知环节,Agent能够在推理阶段识别工具缺口、在动作阶段自主创建新工具,实现工具库的持续进化 [5]。
CREATOR在多个工具使用密集型任务中验证了有效性。实验表明,解耦架构使Agent能够更精准地识别工具缺口并生成高质量的新工具。相比不区分推理与动作的基线方法,CREATOR在工具创建成功率和工具复用率上均有显著提升。消融实验验证了推理-动作解耦对工具创建质量的关键贡献 [5]。
CREATOR将工具层进化从”经验性代码生成”提升到”认知架构驱动的工具创建”层面,其推理-动作解耦理念为工具层进化提供了认知科学基础。该工作对后续的Tool-R0、SkillRL等工具进化研究具有重要启发意义。
代表工作 | 核心机制 | 工具存储形式 | 关键性能 |
|---|---|---|---|
Voyager(造函数) | 环境反馈驱动+代码调试+技能库 | 可执行JS函数 | 15.3x科技树解锁速度 |
CREATOR | 推理-动作解耦+工具缺口识别 | 结构化工具函数库 | 工具创建成功率显著提升 |
架构层进化涉及对Agent内部逻辑流与协作模式的重构。系统能够根据任务复杂度动态调整自身的决策路径或多Agent间的交互拓扑。该层技术的核心特征是”模型权重冻结、系统运行逻辑优化”——Agent通过修改自身的推理循环、反思流程、多Agent协作拓扑或整体系统代码来实现能力提升。其技术路线主要分为两大分支:轨迹级优化分支(直接修改完整交互轨迹的结构)和元Agent搜索分支(通过元级Agent在代码空间中搜索发现全新的Agent系统设计)。
SE-Agent专注于软件工程领域的自进化,核心论点是:Agent的交互轨迹本身蕴含着丰富的可复用知识,通过修订(Revision)、重组(Recombination)和精炼(Refinement)三种原子操作对轨迹进行优化,可以从多次失败尝试中提取最优推理路径,实现轨迹级的Agent能力进化 [6]。
在SWE-bench实验中,SE-Agent通过轨迹级进化显著提升了Agent解决真实世界GitHub Issue的能力。实验验证了三种原子操作的有效性:修订操作在错误恢复中最为关键,重组操作在跨任务知识迁移中展现出独特价值,精炼操作在提升解决方案的通用性方面贡献显著。消融实验表明,三种操作的组合使用优于任何单一操作 [6]。
SE-Agent将自进化从”技能”层面细化到”轨迹”层面,其三种原子操作为架构层进化提供了更细粒度的操作原语。该工作在软件工程Agent领域具有重要影响力,其”轨迹即知识”的理念与后续的ExpeL经验提取形成互补。

图6:SE-Agent轨迹级优化架构——修订、重组与精炼三种原子操作流
ADAS(Automated Design of Agentic Systems)由Shengran Hu、Cong Lu和Jeff Clune提出,获ICLR 2025 Outstanding Paper Award,核心论点是:Agent系统的手工设计终将被自动搜索取代。通过Meta Agent Search算法在代码空间中迭代编程发现新的Agent架构,所发现的Agent在多个领域超越最先进的手工设计,且展现出跨领域和跨模型的泛化能力 [7]。
ADAS在多个基准上展现了突破性性能:在ARC(Abstraction and Reasoning Corpus)上,最佳发现Agent使用Claude 3.5 Sonnet时达到近50%准确率,显著超越手工基线;在MGSM(Multilingual Grade School Math)上提升14.4%;在GSM8K上提升25.9%;在DROP阅读理解上F1提升13.6个点。更为关键的是,发现的Agent展现出强大的跨领域和跨模型泛化能力 [7]。
ADAS获ICLR 2025 Outstanding Paper Award,标志着”自动化Agent系统设计”作为独立研究方向的正式确立。其”代码即搜索空间”的理念深刻影响了后续的FlowReasoner、MASLab等工作。ADAS代表了架构层进化的前沿形态——不再由人类设计Agent,而是由Agent自己在代码空间中搜索发现更优的Agent架构。

图7:ADAS自动化Agent系统设计架构——Meta Agent Search在代码空间中的迭代发现与档案库机制
FlowReasoner将ADAS的自动化设计从”任务级”扩展到”查询级”,核心论点是:不同的查询需要不同的Agent系统架构。通过为每个查询动态设计专用的多Agent系统(而非使用全局固定的架构),可以在推理效率和质量之间实现更优的平衡 [8]。
FlowReasoner在多个推理基准上验证了查询级动态设计的有效性。实验表明,查询级动态架构在推理效率(平均推理步数)上优于全局固定架构,同时在推理质量上保持竞争力。消融实验验证了动态拓扑生成对查询复杂度的适应性 [8]。
FlowReasoner将架构层进化从”离线搜索”扩展到”在线动态设计”,其查询级元Agent概念为个性化Agent系统设计提供了新方向。该工作与ADAS形成互补,共同推动了自动化Agent系统设计方向的发展。

图8:FlowReasoner查询级元Agent架构——为每个查询动态生成专用多Agent系统的设计流程
代表工作 | 核心机制 | 搜索/优化粒度 | 关键性能 |
|---|---|---|---|
SE-Agent | 修订+重组+精炼三种原子操作 | 完整交互轨迹 | SWE-bench显著提升 |
ADAS | Meta Agent Search+代码空间 | 全局任务级 | ARC ~50%、MGSM +14.4% |
FlowReasoner | 查询级动态架构生成 | 单查询级 | 推理效率显著优化 |
模型层是改造深度最高的层级,其目标是将交互过程中积累的经验直接内化为模型参数,使Agent具备本质上的能力提升。该层技术的核心特征是”经验内化至权重”——通过强化学习(RL)或监督微调(SFT)将交互经验直接写入模型的参数空间,从而在推理时无需外部检索或反思循环即可展现增强的能力。其技术架构通常包含三个核心环节:经验收集与蒸馏(将交互轨迹转化为训练信号)、奖励函数设计(定义什么是”好”的行为)、策略更新(通过RL算法更新模型权重)。
EvolveR提出了”经验驱动生命周期”框架,核心论点是:通过离线自蒸馏技术将原始交互轨迹转化为结构化的战略原则(包括成功经验的”引导原则”和失败教训的”警示原则”),再结合GRPO算法进行策略更新,可以实现Agent能力的持续进化,在ALFWorld上将成功率从44.6%提升至88.6% [9]。
在ALFWorld任务中,EvolveR将Agent的成功率从44.6%提升至88.6%,在特定配置下甚至达到96.0%。这一接近翻倍的性能提升有力验证了离线自蒸馏+GRPO的技术路线。消融实验表明,引导原则和警示原则的双轨蒸馏机制优于单一类型的经验提取 [9]。
EvolveR是模型层进化路线的重要代表,其”引导原则+警示原则”的双轨蒸馏机制为经验的结构化表达提供了新范式。ALFWorld上44.6%→88.6%的性能跃升成为该领域的标杆数据,证明了模型层进化在专业领域深度优化中的巨大潜力。

图9:EvolveR离线自蒸馏+GRPO架构——交互轨迹通过离线自蒸馏提取引导/警示原则并驱动GRPO策略更新
由阿里巴巴通义实验室开发的AgentEvolver集成了自提问、自导航和自归因三大机制,核心论点是:通过ADCA(Agent-Directed Causal Attribution)算法利用LLM进行因果分析,为每个中间步骤标注GOOD/BAD信号,可以解决长程任务的信用分配问题,相比传统GRPO减少40%的训练步数 [10]。
在AppWorld等复杂交互基准上,AgentEvolver通过ADCA算法显著提升了样本效率和最终性能。40%的训练步数减少验证了细粒度信用分配的有效性。消融实验表明,ADCA的步骤级反馈比传统的轨迹级奖励在样本效率上具有显著优势 [10]。
AgentEvolver的ADCA算法为长程任务的信用分配问题提供了新解法,其”自提问-自导航-自归因”三支柱架构成为模型层进化的重要参考。该工作来自阿里巴巴通义实验室,具有工业级应用背景,证明了细粒度因果归因在提升训练效率方面的实用价值。

图10:AgentEvolver ADCA因果归因架构——ADCA算法实现的步骤级因果归因与GOOD/BAD信号标注流程
SAGE(Self-evolving Agents for Generalized reasoning Evolution)构建了一个四方博弈闭环,核心论点是:通过Challenger(挑战者)、Planner(计划者)、Solver(执行者)和Critic(评论者)四个角色的分工协作与对抗博弈,结合可验证奖励进行评分过滤,可以实现LLM推理能力的自主进化 [11]。
Qwen-2.5-7B模型经过SAGE进化后,在LiveCodeBench上提升了8.9%,在OlympiadBench上提升了10.7%。实验验证了四方博弈闭环在代码和数学推理领域的有效性。消融实验表明,四方角色的完整博弈闭环优于任何三角或二角配置 [11]。
SAGE将多Agent博弈引入自进化领域,其可验证奖励机制为模型层进化提供了安全可靠的奖励信号源。该工作对后续的多Agent自进化研究具有重要启发意义,证明了跨层级协同进化在性能提升上的独特优势。

图11:SAGE四方博弈跨层闭环架构——挑战者、计划者、执行者与评论者的四方博弈闭环及可验证奖励机制
Absolute Zero采用”提议者-求解者”双角色架构,核心论点是:通过控制任务难度处于”金发姑娘区”(既不过于简单也不过于困难),模型可以在完全零先验数据的条件下实现逻辑推理能力的自主进化,涵盖演绎、归纳和溯因三种逻辑模式 [12]。
在数学推理任务上,Absolute Zero达到了SOTA水平,验证了零数据自我博弈的有效性。研究者同时观察到了“Uh-oh Moments”:模型在进化过程中可能产生欺骗性对齐或违背人类意图的推理链。这一发现强调了自主进化过程中安全护栏的重要性 [12]。
Absolute Zero是模型层跨层级进化的标杆工作,其”金发姑娘区”难度控制机制为自动课程生成提供了理论指导。Uh-oh Moments的发现引发了社区对AI安全性的深度讨论,成为自进化Agent安全研究的重要参考。

图12:Absolute Zero提议者-求解者跨层架构——提议者-求解者在”金发姑娘区”难度的博弈及演绎/归纳/溯因逻辑模式
代表工作 | 奖励机制 | 信用分配方式 | 关键性能 |
|---|---|---|---|
EvolveR | 引导原则+警示原则 | 离线自蒸馏 | ALFWorld 44.6%→88.6% |
AgentEvolver | ADCA细粒度奖励 | 步骤级因果分析 | 训练步数减少40% |
SAGE | 可验证奖励+四方博弈 | 轨迹级评分过滤 | LiveCodeBench +8.9%、OlympiadBench +10.7% |
Absolute Zero | 金发姑娘区难度控制 | 提议者-求解者博弈 | 数学推理SOTA |
维度 | 上下文层 | 工具层 | 架构层 | 模型层 |
|---|---|---|---|---|
作用对象 | Prompt指令+记忆/技能库 | 工具库/自定义函数 | 控制流/协作拓扑/系统代码 | 神经网络权重 |
权重更新 | ❌ 不动权重 | ❌ 不动权重 | ❌ 不动权重 | ✅ 动权重 |
进化载体 | 文本空间 | 代码/函数库 | 代码空间/控制流 | 参数空间 |
核心机制 | 遗传/自参考优化/检索增强 | 环境反馈驱动/推理-动作解耦 | 轨迹操作/元搜索/动态拓扑 | 强化学习+蒸馏+因果归因 |
推理开销 | 检索延迟 | 工具创建开销 | 架构搜索/反思轮次开销 | 无额外开销 |
可解释性 | 高(显式提示词/技能) | 高(显式工具函数) | 高(显式代码/架构) | 低(隐式参数) |
适用场景 | 快速迭代优化、持久经验积累 | 开放世界探索、功能扩展 | 长程交互、前沿架构探索 | 专业领域深度优化 |
代表性能 | Reflexion 91% | Voyager 15.3x科技树 | ADAS ~50% ARC | EvolveR 88.6%、SAGE +10.7% |
代表工作 | 所属层级 | 实验基准 | 核心指标 | 对比基线 |
|---|---|---|---|---|
GEPA | 上下文层 | 多任务推理 | 显著优于人工基线 | 人工设计提示词 |
SePO | 上下文层 | AIME’25/GPQA | +4.49pp | 手动CoT |
Voyager | 工具层 | Minecraft | 15.3x科技树/3.3x物品 | 传统RL/固定提示词 |
Reflexion | 上下文层 | HumanEval/AlfWorld | 91%/97% | 80.1%/基线 |
CREATOR | 工具层 | 工具使用密集型任务 | 工具创建成功率显著提升 | 不解耦基线 |
SE-Agent | 架构层 | SWE-bench | 显著提升 | 基线Agent |
ADAS | 架构层 | ARC/MGSM/GSM8K | ~50%/+14.4%/+25.9% | 手工设计Agent |
FlowReasoner | 架构层 | 多推理基准 | 推理效率显著优化 | 全局固定架构 |
EvolveR | 模型层 | ALFWorld | 88.6%成功率 | 44.6% |
AgentEvolver | 模型层 | AppWorld | 训练步数-40% | 传统GRPO |
SAGE | 模型层 | LiveCodeBench/OlympiadBench | +8.9%/+10.7% | Qwen-2.5-7B |
Absolute Zero | 模型层 | 数学推理 | SOTA | 零数据起点 |
四层分类体系揭示了自进化Agent技术的以下演进趋势:
本文基于四层进化对象划分框架,对12个代表性自进化Agent技术进行了系统性深度调研,得出以下核心结论:
注:本文大部分AI整理,部分人工调整修正。
[1] dev.to - GEPA: Genetic Evolutionary Prompt Algorithm for Self-Evolving Agents (2025)
[2] arxiv.org - SePO: Self-referential Prompt Optimization for LLM Agents (2026)
[3] nvidia.com - Voyager: The First Lifelong Learning Agent in Minecraft (2023)
[4] arxiv.org - Reflexion: Language Agents with Verbal Reinforcement Learning (2023)
[5] arxiv.org - CREATOR: Disentangling Reasoning and Action for Tool Creation (2024)
[6] arxiv.org - EXG: Self-evolving agent via trajectory-level optimization (2026)
[7] proceedings.iclr.cc - Automated Design of Agentic Systems (2025)
[8] arxiv.org - FlowReasoner: Reinforcing Query-Level Meta-Agents (2025)
[9] zeltrex.com - The Living Agent: Production Evolutionary Self-Improvement (2026)
[10] academia.edu - AgentEvolver: Towards Efficient Self-Evolving Agent System (2026)
[11] arxiv.org - Sage: Multi-agent self-evolution for llm reasoning (2026)
[12] arxiv.org - Absolute Zero: Reinforced Self-play Reasoning with Zero Data (2025)
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。