00:00
今天的题to selection不是代码路由,而是模型按描述做的概率决策,谁负责验证?客户不关心你内部有几个工具,只关心一句话能不能办成事。工具选错,用户看到的就是答非所问。上周三个客户让A查订单,他却去调退款接口,客户不气他弱气他不确认就动手open AI的函数调用文档和anloic的agent指南指向同一件事。工具名和描述就是模型的选择依据。注册表现在躺着40多个工具,一半功能重叠,一期我只留8个高频只读工具,其余全部下线或延后两条路,A全靠模型按描述自选,B加规则路由先过滤后,前者简单,但工具一多就乱,后者可控,却退回一编码工具名和。
01:00
黑stema一含糊模型就乱填参数,实测同一的searchge和query互相误选超过三成,现在没有机械弹提升都是感觉。先做60条黄金用力定入选律、澄清率多调用次数三个口径,再谈优化工具描述写得好,顺带就是一份对外的开发文档,做成可索引的接口页,开发者搜得到,自然流量也来了。如果这版工具准确率能公开验证,我拿3000块测开发者社区投放K超80就停,但转化买点必须先上工具,每多一个就要多写描述,多跑评测,多烧拓盘,一期我批两个人,两周超限就先看工具数量,先想怎么出示模型,误选退款工具责任算谁的,写操作必须人工确认,留审计日志可回滚,否则不许上线。
02:00
那就定三棒,描述和边界归架构层评测及归数据,写操作确认归工程,先说谁接,什么时候交,我可以接受砍到8个,但名字要让客户听懂,退款工具就直接写明需要确认,价值写在名字里,别藏在参数里,光改名不够,置信度低时,给诊必须先问一句再动手,不能猜验收标准是物选导致的投诉降到0,反正是外部案例中工具超20个时,误选率明显上升,收敛到10个内,并中写描述后又回落。这和我们的方向一致,范围震动只读工具6个,写操作2个且全部走确认一期,不做动态检索,不做多agent,不加新业务,工具选A只加一层薄权限过滤规则,不替模型选工具,牺牲工具规模。
03:00
弹性换来可解释可调试可回归实现路径统一工具注册表skimer必填项锁死,每个工具配3条上下文视力重复调用加密文件成功线误选率低于5%,成清率低于10%,停止线误选高于15%或出现一次未确认,请操作8个工具的接口页做成文档占入口一个月看收录数和文档到适用的转化搜索来的开发者要能跑通势力不备不加码就3000落地业值皆用文档站买点看调用成功率RO ass低于1就停投,不拿预算补产品问题,最终批量人两周超支就砍到3个工具重头ROI门槛是工单减少省下的成本必须盖住这轮投入,这版过了二次确认了,审计日志密等回滚三件齐全。
04:00
责任边界起进注册表,缺任何一件工具不许进生产锁定。Bob周五交注册表与边界,Alex下周三交实限和事例,David下周五交评测报告。我跟决策日志就选A8个工具描述写清,S蒂马锁死视力到位且操作确认二期再谈动态检索行不行看指标。
我来说两句