MAR(Multi-Agent Reflexion)框架的研究表明,单个 Agent 在执行、评估和反思三个环节中由同一模型承担所有角色,容易产生以下系统性缺陷:
实验数据显示,在困难样本上,单 Agent Reflexion 的反思往往会重复先前的误解,无法引入新的推理路径。
MAR 框架通过引入多个具有不同推理人格的批评者 Agent 来解决上述问题:
当 Actor 失败后,系统启动结构化辩论流程:每个 Persona 独立撰写诊断报告,随后进行交叉质询和完善,最终由 Judge 综合成可操作的共识反思注入 Actor 记忆。
在 HumanEval 代码生成基准上,MAR 将 pass@1 从 Reflexion 的 76.4% 进一步提升至 82.6%,HotPotQA 多跳问答准确率也提升了 3 个百分点。更重要的是,MAR 显著减少了单 Agent Reflexion 中常见的思维停滞现象。
不过,这种提升伴随着约 3 倍的 API 调用量和延迟增加。因此在实际部署中,MAR 更适合企业级高风险决策场景,而非对延迟敏感的常规任务。