温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
先别急着说模型幻觉,我要一条能定位故障层的诊断术,每层都有证据和指标,谁负责?客户不关心诊断数长什么样,他们只问两件事,同一个问题问两次,答案能不能一致,能不能给出出上周37张工单,客户投诉最多的是答非所问,排第二的是答对了,但引用过期文档logs把答案拆成断言,回查原文,Phoenix用span追全链路,两套口径能对齐,10层全键等于没范围,一期我只认四层召回排序,上下文组装生成,其余先留证据。两条路每层各自打点便宜,但串不起因果。统一链路ID贯穿10层多花两周工期,统一链路ID我认,但10层全量落盘写不动文档正文采样、分数和特征一条不漏。
01:00
先把基线钉死,召回率、排序质量,上下文覆盖率,答案中10°各自的分母和样本量。客户搜的是长尾问题,召回层不稳,页面写的再好也留不住自然流量先修召回买量我不怕烧怕回因断裂没有链路ID,我连单条线索成本都算不准。自建观测平台至少两个人3个月,现成工具先跑,省下的钱留给人做标注,文档正文落盘就涉及客户数据,要么脱敏后留,要么只留哈西加分数,出事必须有牌照,10层拆成10个负责人第一轮先矫正,据清单和指标口径,两天后会上看到,可落地办本。回看那37张工单,2/3是答非所问,那先把召回和排序闸门做料,别急着动生成,只要工单里带上链路,二弟我。
02:00
就能当场看出是压根没检索到还是检索到,但生成说错了,公开的rag事故复盘里多数卡在检索而不是生成,这支持先做召回,但样本偏企业文档,那就冻结,一期做10层证据链,只对召回排序上下文生成4层设闸门,其余只观测,最终取舍统一链路ID换掉单层独立打点,牺牲首次接入两周工期换来故障,逐层归因买点走一步上报召回结果,按哈希留分不落正文,超时降级止写指标,不阻塞主链路成功线200条评测及上召回率8成中10°0.9,低于0.7就停,别去改提示词,自然流量侧挂一组对照同一批长尾问题,召回修好后看页面停留和二次提问率是否下降。
03:00
我先投3000块,跑一组搜索地图词单条线索成本上限80,归因不到链路ID就立刻停投,最终预算三个人两个月18万,其中标注6万,第二个月召回率不达标,就先看标注红线三条物流客户原文日志30天自动过期,链路ID不得反查到具体用户写进合同交付清单,BOB2天出链路规范,ALEX5天买点,DAVID7天出机线,艾玛8天验收,4层闸门拍板就做这条10层证据链,4层设闸门,谁在想直接改提示词,谁自己先出证据。
我来说两句