00:00
别把万当模型问题,先把总耗时拆成8段,用trace找到critical time再决定改哪理。用户只感知首字和完整答案TTFT超过2秒体验就崩,Streaming必须优先,不然留存会掉。工单里37例卡顿,20例发生在软之后,客户等的是工具返回不是模型。Open JA内I已一,约定能统一八段买点RS Phoenix看P50 P95P99先采样100条真实绘画做机线,预期只做可观测与三项修复。Streaming vnk超时tool并行model不尽一期验收标准先冻结。方案A全链路串行加缓存,简单但稳,延迟高。方案B,并行retrieval与tri超时预算800ms,复杂度可控,多路并发。
01:00
没有超时预算一个透误卡3秒,整条链路全等Richard啊,还会放大P99必须逆等加截止时间,只看P50会骗人,当前P501.2秒,P953.8秒,P996.4秒达标限定P95<2.5秒搜索意图液要先把首屏内容流式吐出来,否则爬虫和用户都等完整答案跳出绿绘吃掉自然流量投放落地叶弱首次2秒tag会涨三成,先来TTFTT转化事件预算每天500TAG上限80元8段trace每月4000缓存和并行附增模型费总预算12000,超过P95降100ms才追加日志不能代用互原文trace只留延迟哈希ID谁引用了客户数据谁负责,合同里写清保留30天。
02:00
第一棒Bob定接口,艾ex改超时,David文健看版塞拉验首评24小时交决策日志,周四评审,如果streaming只解决首次完整答案仍慢销售不能承诺秒回,对外改为首次2秒完整10秒re润超时降级后工单里那20粒要重磅,客户能拿到,不带重排的结果也比转圈30秒好100条采样里tool漫战P954成,Rerink占两成五,Generation只占一成八,换模型排最后,数据支持一期冻结,不做model writingting不做多模型,路由只做8段trace缓存并行与降级,最终牺牲串行简单性,换P久无可控,Retrieval与t true并行,Reranmp超时500ms降级缓存命中直接跳动所有。
03:00
带由调用统一截止时间,Retra只一次,并带抖动部分成功先返回,可用片段状态机记录补偿,上线后看P95是否小于2.5秒,P99<4秒连续三天超标就回退,并行恢复串行加缓存,首屏流失内容要可收录正文分块加载内链指向问答页两周探索引率与自然点击不达标就改结构TTFTT买点若缺失一分钱不投买好,且P95达标日预算从500加到1500 RAS低于2就停,总预算锁死1万2,若P95支降50ms停止追加,降100ms且工单降三成才批下一期,责任边界确认数据保留30天,降级必须留审计事件,客户可关闭缓存,越过红线就下线功能。
04:00
Owner确认Bob接口,周五Alex超时,周三David看板,周四sarra,所以下周二验收以P95报告为准,拍板互换模型,先做8段trace和关键路径治理,Streaming re润降级to并行缓存,4周上线。
我来说两句