电商售后客服里,发票类咨询是出了名的"看着简单、做起来头大":
我们当时要在 AI agent 平台上搭建一个售后客服机器人,第一优先级就是吃下发票咨询。本文记录我们整个调试过程,以及 WorkBuddy 在其中扮演的角色——从意图分类设计,到逐版迭代调优,再到 Agent 上线和接口对接。
动手写 prompt 之前,先做了意图分类设计。这一步直接决定后面所有工作的地基,宁可多花时间也不能省。
我们最终把发票咨询拆成 8 个意图类别:
序号 | 意图 | 典型用户问法 |
|---|---|---|
1 | 发票开具流程 | "发票怎么开?" |
2 | 发票类型(电子/纸质) | "可以开电子发票吗?" |
3 | 抬头与税号 | "发票抬头能写公司吗?" |
4 | 开票时效 | "发票多久能到?" |
5 | 补开/重开 | "上个月买的能补开发票吗?" |
6 | 发票金额核对 | "发票金额和订单对不上" |
7 | 报销凭证需求 | "要报销用的发票" |
8 | 其他发票问题 | 兜底类别 |
设计原则就一条:意图之间要互斥、可穷尽。两个意图定义重叠,模型就会"左右横跳";漏掉常见场景,用户就会被兜底类别打回去,体验断崖式下跌。
WorkBuddy 在这里的用法:把客服历史聊天记录(Excel 导出)直接丢给 WorkBuddy 做聚类分析,让它先自动归纳出高频问法,我们再人工复核、合并、去重,最终定稿 8 类。比起纯人工翻聊天记录,这一步至少省了 2 个小时,而且不会漏掉低频但关键的问法。
意图分类定了,真正的硬仗才刚开始——prompt 怎么写,优先级怎么排,回复质量怎么保证。
我们的调试方法很朴素,但非常有效,核心流程是:
这套流程看着简单,但每一步都有讲究:
优先级匹配是最大的坑。 8 个意图不是平等的——比如"发票怎么开"和"发票抬头写什么",用户可能一句"我要开发票,抬头写公司"同时命中两个意图。如果匹配顺序错了,模型可能只答开票流程,漏掉抬头信息。我们的解法是:在 workflow 里显式配置意图优先级,把"具体操作类"排在"流程咨询类"前面,并用多条冲突问法专门测试边界情况。
统计口径不能乱。 调试过程中发现,不同版本之间对比效果时,如果测试集变了、或者人工判断标准变了,得出的"改善"结论就是假的。后来定死规矩:测试集固定、判断标准固定,只允许改 prompt,数据才有可比性。这件事上吃过亏,深有体会。
WorkBuddy 在这里的用法:每次改 prompt 后,把"改前话术 + 错误 case + 期望输出"一起贴给 WorkBuddy,让它先给出修改建议,人工确认后再落到 workflow 里。它特别擅长从模糊的业务描述里抓出「这句话哪里会让模型误判」这种问题,等于多了个免费的 prompt 评审。
prompt 调得差不多了,接下来是上线,这一步我们把坑踩了个遍。
WorkBuddy 在这里的用法:接口对接时,把接口文档 PDF 丢给它,让它把字段清单、必填项、校验规则整理成结构化表格,对照着逐项联调,比人肉翻文档靠谱得多。
(示例数据,请按你的真实数据替换后发布)
指标 | 上线前(纯人工) | 上线后(AI 客服) |
|---|---|---|
发票咨询平均响应时长 | X 分钟 | X 秒 |
意图识别准确率 | — | X% |
人工转接率 | 100% | X% |
发票相关投诉量 | X 件/周 | X 件/周 |
复盘下来,几个最重要的经验:
如果你也在搭客服机器人,我的建议排序是:
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。