首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >反思式推理 >多智能体反思框架如何通过多个 Agent 互相批评提升效果?

多智能体反思框架如何通过多个 Agent 互相批评提升效果?

词条归属:反思式推理

1. 单 Agent 反思的固有局限

MAR(Multi-Agent Reflexion)框架的研究表明,单个 Agent 在执行、评估和反思三个环节中由同一模型承担所有角色,容易产生以下系统性缺陷:

  • 重复推理错误:同一模型倾向于在不同轮次中重复相同的错误推理模式
  • 确认偏误:模型对自己先前生成的内容有天然偏好,难以客观批判
  • 反思多样性不足:单一推理风格无法覆盖多维度的潜在问题

实验数据显示,在困难样本上,单 Agent Reflexion 的反思往往会重复先前的误解,无法引入新的推理路径。

2. MAR 的多角色辩论架构

MAR 框架通过引入多个具有不同推理人格的批评者 Agent 来解决上述问题:

  • Actor:负责执行任务并生成初始解决方案
  • 多元 Persona 批评者:每个批评者具有不同的推理倾向和分析视角,从多个角度诊断失败原因
  • Judge 协调者:汇总各批评者的诊断,引导辩论并合成最终的共识反思

当 Actor 失败后,系统启动结构化辩论流程:每个 Persona 独立撰写诊断报告,随后进行交叉质询和完善,最终由 Judge 综合成可操作的共识反思注入 Actor 记忆。

3. 性能提升与实际代价

在 HumanEval 代码生成基准上,MAR 将 pass@1 从 Reflexion 的 76.4% 进一步提升至 82.6%,HotPotQA 多跳问答准确率也提升了 3 个百分点。更重要的是,MAR 显著减少了单 Agent Reflexion 中常见的思维停滞现象。

不过,这种提升伴随着约 3 倍的 API 调用量和延迟增加。因此在实际部署中,MAR 更适合企业级高风险决策场景,而非对延迟敏感的常规任务。

相关文章
CrewAI vs AutoGen:多AI智能体(AI Agent)协作框架该如何选型?(2026终极对比指南)
核心思想:模拟人类团队协作,每个 Agent 扮演固定角色,拥有专属技能和明确职责
jack.yang
2026-04-23
1.3K0
【Harness&Hermes】多智能体开发特训营——从概念到落地的完整指南
2024-2025年,多智能体系统(Multi-Agent Systems, MAS)成为AI工程化领域最受关注的方向。而在这一波浪潮中,Harness 与 Hermes 作为两个代表性框架,正在重新定义“如何用AI开发软件”。
ctrl加滚轮
2026-06-10
7280
每日论文速递 | Agent-Pro:通过策略级反思和优化学习进化
摘要:大型语言模型对不同的任务表现出强大的解决问题的能力。然而,大多数基于LLM的代理都被设计为具有复杂提示工程的特定任务求解器,而不是能够通过交互学习和进化的代理。这些任务求解器需要手动制作的提示来告知任务规则并调节LLM行为,固有地使其无法解决复杂的动态场景,例如,大型互动游戏。有鉴于此,我们提出了Agent-Pro:一个基于LLM的Agent,具有策略级反射和优化,可以从交互式体验中学习丰富的专业知识,并逐步提升其行为策略。具体而言,它涉及到一个动态的信念生成和反思过程的政策演变。Agent-Pro不是行动层面的反思,而是迭代地反思过去的轨迹和信念,微调其非理性信念,以制定更好的政策。此外,深度优先搜索用于策略优化,确保策略收益的持续增强。代理专业评估两个游戏:二十一点和德州扑克,优于香草LLM和专业模型。我们的研究结果表明,Agent-Pro可以在复杂和动态的场景中学习和发展,这也有利于许多基于LLM的应用程序。
zenRRan
2024-03-02
8930
AI时代新风口!吴恩达亲授智能体四大设计模式
最近在工作之余,吴恩达连续分享了很多关于智能体的见解,并定义了AI Agent的四大设计模式,
新智元
2024-04-19
1.1K0
AI 智能体分类体系:从大模型到自主智能体的完整图谱
关于智能体的分类,心里一直是比较困惑的,于是想系统地了解下智能体应该如何分类。基于这个背景,笔者花了比较多的时间去调研学术界和工业界对智能体的分类方式,综合了多篇调研报告以及 Anthropic、OpenAI 的官方文档和 LangGraph、AutoGen、CrewAI、Dify 等主流框架的实践,梳理出了一套笔者认为比较合理的分类体系。这篇文章就是这段调研过程的一个系统性整理。
Wangzy
2026-06-22
4260
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券