温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
今天指定一件事,要不要换embedding模型,重建索引谁负责,多久能上,不达标怎么办?客户不关心维度多少,只关心搜出来的答案对不对,检索错了续费就没了,这才是机会成本。上月工单三成是搜不到资料,同一个问题反复来,换模型之前先看客户在第几步卡住sentence transformers的语义相似度评测显示换模型后相近句子的排序会变,这不是个例,一期只换文本,Embedding重建索引,不碰生成层,不做多模态验收,看全量评测及的召回两条路就索引双写星向量或者全量重观双写省迁移,但两套空间混用,相似度不可比,中贯要重跑分块批量推理写回向粮库每条带密等键和模型版本。
01:00
失败要能断点续传,没有机械就别谈提升。先冻结评测集合指标口径recall at10和MDCG现在是多少先测出来,用户搜的是口语问题不是我们的术语,标题和文档结构不对,再好的向量也照不回来。检索差,买来的流量全在漏斗里漏掉,搜索成功才算转化事件。这笔账比模型本身贵,全量重灌一次多少钱?向量条数成单价,再加两星期人力回收期超3个月,这笔钱我不批,新旧向量混在一个索引出了问题谁负责?要么全换,要么每条标清,模型版本不能行。下一棒是评测及冻结和重贯。脚本谁写几天交,怎么算通过?今天不定,这是一定烂尾。我接受全量重管,但回报必须落在续费率。
02:00
杀多模态和众牌,这轮砍掉只保文本检索,众贯我认,但上线要留就索引回退开关,客户不会等我们重跑出问题,5分钟内要能切回去。Rag论文也说检索质量决定生成上限,但新模型在中文垂类未必更强,得用我们自己的评测体验范围,冻结换文本,Embedding全量重建索引每条带版本号不做查询改写验收标准就是召回,最终选全量重关,牺牲2周窗口和旧向量复用,换来索引与查询同源评测才可比可解释实现按批写每条带模型版本字段,失败续传查询只命中同版本向量,禁止跨版本算相似度,成功线recall at10比基线提升15个百分点,停止线上线2周不达标。
03:00
没退就索引并复盘召回起来后,标题摘要和站内结构要同步改,让用户用真问题搜得到,看自然流量的转化率先。头两周小额预算验证T上线写死归因用搜索成功事件朝鲜立刻停投,预算加倍不成立,预算封顶,在单月劳力的水平重贯加人力一起算,90天没回本项目降级回到就所以写进规范向量必须带模型版本和生成时间,所以读写权限隔离,跨版本复用直接算适合owner定了,Alex负责种贯,David维负责评测,艾玛负责验收。第10天出第一版达标采切流量就这一条,全量换模型,众贯索引10天上线不达标回退双写和查询改写,这轮全部改掉。
我来说两句