“帮我点一杯冰美式。”对很多人来说,这只是一句随口的话。但对越来越常见的 AI 智能体而言,从这句话到咖啡真正被下单,背后其实走完了一整套“想—做—再想”的循环。今天这篇不讲玄乎的概念,只拆三件事:智能体到底是什么、它怎么一步步把事办成、以及为什么“让它会想”不难,难的是一整套工程。
可以把智能体理解成三个零件的组合——大模型(负责思考)+ 上下文(负责记住)+ 工具(负责行动)。缺了任何一个,它都做不成“事”。
大模型像大脑,能理解你说的话、能推理;上下文像“即时备忘录”,装着目标、进度、刚查到的事实、安全边界;工具像“手脚”,让它真正去查门店、看菜单、下单。没有工具,它只能和你聊天,什么都做不了。瑞幸咖啡为例:它不会自带“瑞幸知识”,但通过工具接口去调用,就能真正把单下出去。
很多人以为智能体是一次性问答,其实它是反复循环。一次最小循环大致有八个环节:接收目标 → 构建上下文 → 选择行动 → 解析工具 → 调用执行 → 记录观察 → 更新状态 → 判断是否结束,然后回到开头,直到任务完成。
以点咖啡为例:你说“来杯冰美式”,它先建上下文,判断出“得先找到附近营业的门店”;于是调用“查门店”工具,拿到结果后更新状态;再判断“下一步该选商品”;查到商品后创建订单;最后到了支付这一环,它会停住,把决定权交还给你。一次循环只推进一步,多轮循环才拼成一个完整任务。
智能体手里的“手脚”也有等级之分。只读工具(查门店、看菜单)可以自动跑;写入工具(创建订单)会产生实际变化,需要审查;高风险工具(支付付款)涉及真金白银,必须由用户亲自确认。这一步设计对不对,决定了产品安不安全。
这也是为什么点咖啡时,下单和支付会被拆成两步:先下单成功,再单独确认支付。哪怕一次点好几杯,也只需一次确认。人工介入被放在最该放的地方。
同样是点咖啡,瑞幸这样的服务商会同时提供 CLI、MCP、Skill 三种接入方式。它们不重复,而是给不同的人、不同的场景设计的。
方式 | 适合谁 | 特点 |
|---|---|---|
CLI | 工程师、运维、数据人员 | 命令行里一条条敲,每步清晰可见,参数和权限能精确控制;但门槛高,要记命令、流程繁琐。 |
MCP | 通用智能体、现代应用 | 一套标准协议,把工具“即插即用”地接进任意 AI;规范清晰,越来越多企业愿意提供。 |
Skill | 普通用户、面向业务 | 把“点咖啡”的标准流程封装成能力,一句话就能触发,最贴近用户、最省交互。 |
打个比方:CLI 是给会开车的人手动挡,MCP 是标准化的“插口”,Skill 则是把整套流程做成“一键按钮”。三种方式背后往往还是同一套服务,只是封装程度不同。
很多人以为智能体天生专业,其实不是。拿 Codex 这类通用智能体来说,它本身只是个“通用代理”,会理解上下文、会调用工具、能记住当前状态。但它并不知道怎么点咖啡、怎么做 PPT。这些专业能力,是靠“安装技能(Skill)”获得的。
装上“点咖啡”技能,它就懂先搜附近门店、再选商品、再下单支付的完整流程;装上“做 PPT”技能,它就能按主题、风格、页数自动产出成品。它的每一步,都是根据最终目标自动拆出来的,过程中几乎不需要你干预。这也说明:让一个智能体“会想”不难,真正花功夫的,是把一个业务流程抽象成它里面一步步可执行的步骤。
把话题拉远一点:真正让智能体在真实场景里站稳的,往往是一堆不那么酷、但决定成败的工程问题——上下文给得对不对、会不会跑偏、会不会死循环、工具调用错没错、成本高不高、安全合不合规。
上下文错了,很多 AI 就会“翻车”;上下文太长,成本上升、注意力被稀释;任务一多还可能“目标漂移”,只顾中间过程忘了最终目的;没有步数上限还可能陷入死循环。更别提评测——不能只看“答得好不好”,要看它有没有真正完成任务、有没有安全地把事做对。
所以以后再看到“某某智能体”,不必急着问它有多聪明,可以先看三件事:它有没有真正做事的工具?它把动作分成了几级风险、人工把关放在哪?它在真实场景里是不是稳定、可复用?能持续稳定解决真实问题的,才真正有价值。
智能体不会取代你思考,但它会替你把很多“跑腿”的活干完——前提是,得有人把背后的每一步都想清楚。