清华大学等单位提出的多智能体辩论框架,让三个 AI 共同讨论问题,相互质疑、交叉验证,筛选出最可靠的结论。阿里 Qwen 应用业务团队与香港中文大学(深圳)联合提出的 MARCH 框架采用三智能体协作机制——解题者生成响应、分解者原子化拆解、检查者在"信息隔离舱"内盲审,通过多智能体强化学习联合优化,仅用文档训练的 8B 参数模型经 MARCH 优化后幻觉率大幅降低,达到与顶级闭源模型相当的水平。
多智能体系统中的对抗性辩论让不同角色的 AI(如"乐观派""悲观派""数据专家")围绕问题展开多轮讨论,互相挑刺暴露逻辑漏洞。哈工大和鹏城实验室的 PSRD 框架专门对付视觉幻觉,通过"侦查-投影"策略将 AI 描述中"无中生有"的物体比例从 46.3% 降至 10.1%。投票式方法让多个 AI 独立回答后采用多数决,利用群体的统计优势提升准确性。
模拟出版社"三审三校"流程,让 AI 依次扮演初审、复审、终审角色。据报道,达观数据在金融、能源等严苛场景下采用类似的评审式多智能体架构,将关键任务错误率控制在极低水平。阿里的通义千问上线"引证"功能后,对新闻、政策类问题逐字核对信源,可信内容标记为绿色,存疑内容标红提示,事实类问题的可信度显著提升。
多智能体并非万能。研究表明其性能提升很大程度上依赖于初始独立投票的统计优势,而非辩论过程中的自我修正。如果一群 AI 的"初始偏见"都一样,它们也可能在辩论中集体跑偏。此外,多智能体方案的计算成本显著高于单模型方案,需要在精度和效率之间权衡。