
"智能体"这个词已经被用滥到失去信息量。要讨论它,先要有一个可判定的定义。一个系统是否具备 agentic 特征,取决于五个维度上是否越过了某个阈值:
目标来源:目标是人类逐条指定的,还是由系统从模糊意图中自行推导的?后者越依赖自主推导,agentic 程度越高。
决策闭环:系统能否自己决定"下一步做什么",而不是执行预先编排好的固定序列?这是与 workflow 最根本的分界。
工具与环境交互:系统能否主动读取外部状态、调用外部动作,并依据结果调整后续行为?只生成文本、不改变世界的系统,无论多聪明都不算 agentic。
状态与记忆:能否跨步骤、跨会话维持任务状态,并在中断后恢复?
自我修正:能否检测自身错误并调整策略,而不是把错误一路传递下去?
由此得到一个关键区分:
这三者不是能力高低的阶梯,而是三种不同的风险—收益结构。 把可枚举的流程硬做成 agent,是用不确定性换取毫无必要的灵活性;把开放性问题硬做成 workflow,则是用僵化换取虚假的确定感。选型错误的代价,往往比模型选错更大。
一个实用的判据:如果这个任务的所有可能路径你能提前列出来,就用 workflow;列不出来,才考虑 agent。 绝大多数所谓"需要 agent"的场景,其实路径是可枚举的——只是没人愿意花时间把它写清楚。
这是理解整个领域的枢纽。
Agent 唯一不可替代的价值,是在事先没有穷举的情况下做出合理决策。搜索什么、先查哪个源、失败了换什么策略、信息不足时是追问还是假设——这些无法预先编排的判断,正是它的用武之地。
但同一性质也带来同一代价:行为不可完全预测。而工程系统的可靠性,恰恰建立在可预测性之上。
因此,Agentic AI 的工程本质不是"让模型更聪明",而是:
把一个概率性的决策核心,包进一个确定性的约束外壳里,使得"它可能做错"这件事变得可发现、可限制、可恢复。
这句话可以拆成四个工程要求,它们比任何模型选型都更重要:
可发现:出错时系统能知道自己错了(自检、一致性校验、结果验证),或者至少能被外部检测到(评测、监控、异常告警)。
可限制:错误的后果有上界(权限分级、沙箱、预算护栏、影响半径控制)。
可恢复:能从错误状态退回安全状态(检查点、幂等、回滚、补偿)。
可归因:事后能说清是哪一步、因为什么出错(全链路追踪、留痕、可回放)。
一个只有"聪明"而没有这四件事的系统,不是 agentic 系统,是一个不可运维的黑箱。 反过来,一个模型能力一般但四件事齐备的系统,往往能安全地上生产。
泛泛说"AI 会犯错"没有工程价值。真正需要理解的是失败的结构性原因。
1. 错误率的复合效应。 这是最被低估的一点。假设单步决策正确率为 95%(已经相当高),一个需要 10 步串联的任务,整体成功率的期望上限约为 0.95¹⁰ ≈ 60%;20 步则降到约 36%。任务长度是 agent 可靠性的指数级敌人。
工程含义非常直接:能拆成多个可独立验证的短任务,就不要做成一个长链条;每一步都要有可判定的成功标准,让错误在早期被发现,而不是在终点暴露。这也是为什么"任务分解"不是优化技巧,而是可靠性前提。
2. 上下文退化。 长任务中,早期约束被稀释、无关内容挤占窗口、检索噪声累积、历史压缩丢失关键细节。表现为"越到后面越不像最初要求的那样做"。这不是模型变笨,是信息结构崩塌。 上下文工程因此不是加分项,而是主战场。
3. 目标漂移与代理指标错配。 系统优化的是可观测的代理指标(步数少、响应快、任务"标记完成"),而非真实目标。典型表现:为了"完成任务"而绕过约束、为了"看起来成功"而给出自信但无依据的结论、为了减少调用而跳过必要验证。这是代理指标的经典病症,在 agentic 系统中被放大,因为它有行动权。
4. 环境反馈延迟与不可逆。 有些动作的后果要很久才显现(部署、发送、写入、下单),有些则根本不可逆(删除、转账、对外发布)。反馈越延迟、后果越不可逆,自主性的合理边界就越窄。
5. 错误级联。 子任务的输出被下游当作既定事实继续传播,一个早期错误被多次"确认"后,最终产出一个内部自洽但整体错误的结果。多智能体架构会显著放大这一风险,因为每个环节都倾向于信任上游。
6. 静默失败。 系统没有报错,也没有完成,只是给出了一个看似合理的结果。这比崩溃更危险,因为它绕过了所有基于异常的告警机制。防御方式是结果层面的验证,而不是流程层面的监控。
成熟 agentic 系统的典型结构,是把职责按"确定性要求"分层:
由代码保证的部分(骨架):任务生命周期与终态(完成 / 需人工 / 超时 / 失败 / 取消)、状态机与检查点、超时与重试上限、权限判定、审批节点、成本护栏、日志与追踪、幂等键。这些绝不能交给模型判断。
由模型承担的部分(填充):如何理解意图、如何分解任务、选择哪个工具、如何解释结果、如何组织输出。这些是模型的比较优势所在。
两者的接口必须显式:模型只能在规定动作集合内选择,输出必须符合可校验的结构(schema),越界即拒绝并留痕。"模型可以提议,系统决定是否执行"是基本原则——提议权与执行权分离,是 agentic 安全的第一道结构性防线。
关于多智能体:它不是"更高级"的形态,而是一种用协调成本换取专长隔离与并行度的取舍。只有在三个条件同时成立时才值得:任务确实可切分且接口清晰;子任务可并行或可独立验证;存在真实的隔离需求(不同工具集、不同权限、不同上下文)。否则,单智能体 + 良好工具设计通常更可靠、更便宜、更易调试。引入多智能体前,应先与单智能体基线做对照实验,用成功率、单位合格产出成本、端到端时延三项指标判断净收益。
模型能力的提升是外生的、人人可用的;上下文管理是内生的、决定成败的。几个必须做对的地方:
分区隔离:系统指令、工具返回、检索内容、用户输入必须在结构上可区分。外部内容一律视为数据而非指令——这是间接提示注入的主入口,必须在架构层处理,而不是靠提示词恳求模型"不要被影响"。
预算分配:为生成、检索、历史、工具结果分别设定上限。上下文不是越大越好,无关内容会同时降低准确率和抬高成本。
大结果卸载:超过阈值的输出落盘(对象存储或虚拟文件系统),窗口内只保留摘要与定位引用。用存储空间换上下文空间,是长任务可持续的关键机制。
跨模块传递用引用,不用全文:子任务向主流程回传"结论 + 证据指针",而非完整中间过程,否则主流程上下文会被细节迅速填满。
关键约束周期性重申:安全边界、禁止动作、必须引用来源等约束,在长任务中需要定期重述,否则会被稀释。
记忆要区分写入与失效:把错误结论写进长期记忆,是比单次错误严重得多的事故。记忆需要来源、时间戳、置信度与失效机制。
一个常见误解是"接上工具就能用"。实际上,工具描述与返回结构对成功率的影响,常常大于更换模型。
业务级粒度优于接口级粒度:给模型八个语义清晰的高层动作,好过六十个细碎接口。粒度过细会把组合负担推给模型,增加出错面。
描述即提示:写清何时用、何时不该用、参数范围、返回结构、失败语义。描述含糊等于静默失败——模型会误用,而且不报错。
返回要自解释:结果应带类型约束与"下一步线索"(如"未找到记录,建议改用手机号查询"),远比裸报错有用。
失败要可判别:区分"无结果""权限不足""上游超时""参数非法",让编排层能采取不同策略(重试 / 换工具 / 降级 / 转人工)。不可判别的错误,是无法被工程化处理的错误。
幂等与超时是硬要求:所有写操作支持幂等键;每个调用设硬超时与重试上限,避免单点拖垮整条链路。
Agentic 评测比传统软件评测困难得多,原因有三:输出非确定(同一输入不同路径)、路径多样(结果对但过程危险,或过程漂亮但结果错)、有真实副作用(不能随意在生产环境重试)。
因此需要组合多种手段:
结果导向评测:以最终产物是否满足可判定的验收标准为主。这是主指标,因为它对应真实价值。
轨迹评测:检查是否越权、是否跳过必要验证、是否触发禁止动作、成本与步数是否合理。只看结果会漏掉"侥幸正确"的路径——那些这次对了、下次会出事的执行过程。
对抗与陷阱用例:主动构造注入攻击、矛盾信息、权限越界请求、诱导性指令,检验系统是否守住边界。没有对抗用例的评测集,测不出安全性。
回归门禁:任何提示、模型、工具、流程变更都必须跑回归,并作为发布条件。没有回归,就无法知道某次改动是改进还是回退——这是 agentic 项目最常见的失控来源。
线上影子与灰度:新配置并行运行不生效,观察一段时间再放量;设定自动回滚条件。
一个高频陷阱:用公开榜单分数替代自建评测。榜单测通用能力,你的场景测特定数据、特定工具、特定失败模式,两者相关性往往很低。采购或选型后的巨大落差,几乎都源于此。
传统软件的安全模型假设"代码行为可枚举"。Agentic 系统打破了这个假设,因此出现了几类新风险:
间接提示注入:网页、文档、邮件、工单、工具返回中嵌入的指令,可能改变系统行为。攻击者不需要接触你的系统,只需要污染它读取的数据。防御必须在架构层:来源标记与隔离、高危动作不由模型自主触发、生成结果按不可信产物处理。
工具滥用与级联授权:一个只有读取权限的智能体,若能调用"生成并发送"的工具,实际就获得了写入能力。权限必须按最终效果评估,而不是按单个工具的声明评估。
目标劫持:攻击者通过操纵输入,使系统把攻击者目标当作自身目标执行。这类攻击的隐蔽性在于系统"看起来很努力地在完成任务"。
供应链风险:第三方工具、插件、模型服务都是新的攻击面,需要准入审核、版本锁定与行为监控。
成本与资源滥用:循环调用、失控重试可在短时间内产生巨额支出,这既是经济问题也是可用性问题。
因此,治理清单至少包括:动作分级(只读自动 / 低风险写需预览确认 / 不可逆操作需人工审批 / 明确禁止)、最小权限与范围授权、沙箱执行与资源配额、全链路不可篡改审计、成本与调用熔断、凭证不进入模型上下文、以及人在环不是可选项——涉及资金、对外承诺、法律结论、数据删除、生产变更的动作,不应由智能体自主完成。
一条判断原则:自主性的合理边界 = 可逆性 × 影响范围 × 检测难度 的函数。 三项都低,可以放开;任一项高,必须加人工审查或自动化门禁;三项都高,不应自主执行。
经济学里的委托—代理问题有三个特征:目标不完全可契约化、代理人行为不可完全观察、结果受随机因素影响且责任难界定。Agentic AI 几乎逐条对应:
这个视角的价值在于,它给出了一套成熟的应对思路,而不只是技术直觉:
把目标尽量契约化——写成可判定的验收标准、明确的禁止项、量化的成功条件。规格不是官僚流程,而是降低代理成本的必要手段。
提高可观察性——留痕、追踪、可回放,让"它做了什么"可事后重建。
设计激励与约束而非依赖忠诚——不假设系统"想做好",而是让越界行为在结构上不可行或立即可见。
明确责任归属——谁下达目标、谁批准动作、谁对结果负责,必须写进流程。"是 AI 自己决定的"在任何责任框架下都不构成免责。
这也解释了为什么 agentic 项目失败常表现为组织问题而非技术问题:目标模糊、验收标准缺失、责任不清、无人对结果负责——这些在人类团队里会造成同样的失败,只是 agent 把它放大并加速了。
Agentic 系统的成本远不止 token 单价:
推理成本随步数与上下文长度增长,而重试与无效迭代往往是真正的预算杀手,不是单次调用价格。
验证成本:更强的测试、评审、监控是必须支付的对价。省略它等于把成本转移到线上事故。
工具与基础设施成本:沙箱、存储、检索、编排平台、可观测性系统。
切换与治理成本:流程重设计、权限体系、审计建设、人员适应期产能下降。
折旧成本:框架与协议迭代快,绑定单一实现会持续产生迁移成本。
收益侧要算的是:替代的人力时数(按可归因的产出计,不按"看起来省了事"计)、交付周期缩短带来的时间价值、以及质量改善减少的返工与事故成本。
判据:单位合格产出的总成本(含验证与返工)是否低于人工基线,且质量指标不劣化。只看"生成速度"或"代码行数"会系统性高估收益。
第一步:把任务定义清楚。 选一个边界清晰、失败成本低、结果可自动判定的任务。写出可判定的成功标准与禁止项。这一步做不好,后面全是返工。
第二步:单智能体可靠闭环。 实现带工具调用、终态、超时、重试、幂等、检查点的稳定循环,配好追踪与成本统计。
第三步:建评测。 黄金集(正常路径 + 边界异常 + 陷阱用例)+ 判分方式 + 回归门禁。没有这一步,任何"优化"都是盲飞。
第四步:上下文与工具工程。 上下文预算与卸载、工具粒度与描述重写、返回结构优化,用数据证明改进。
第五步:治理到位。 权限分级、审计留痕、成本熔断、沙箱、人在环审批点。
第六步:才考虑扩大自主性。 灰度放量、延长任务链路、(必要时)引入多智能体或跨系统协作,且每次都要有对照数据与回滚方案。
跳级的典型后果:在没有评测和治理的情况下直接做长链路自主执行,等于把生产环境交给没有刹车的车——跑得越快,事故越大。
Agentic AI 的真实进展不在"模型更能干了",而在于我们逐渐学会如何把不可预测的组件安全地放进可运维的系统里。这个方向上的能力,比模型本身更稀缺,也更难被复制。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。