00:00
垂直任务涨点不算赢,模型变傻就是输,今天必须定死,回调之后怎么证明他没丢就本事?客户只认新任务准确率68%~89%就是钱,但通用问答一崩,第二天就退订,体验不分新旧,上周23张工单6张都是答非所问,全出在微调版本。客户不问losss,只问以前会答的为什么现在不会罗A论文没说不会遗忘参数少不等于不遗忘revisiting论文史册指令微调一样调通用能力一期只做一件事给微调版本见可比对照同一套题,Base和Tom各跑一遍,不达标不许上线。方案A全仓微调加高比例回放稳蛋贵。方案B用Laura+5%~10%通用数据快尔省套评测兜绿play不是把。
01:00
旧数据一扔就行,要按任务分层,Laura的rain调大更新更多,遗忘风险也跟着涨。先例机械贝斯模型在同一评测即跑出通用分,可就任务分没有机限,涨跌都是噪音,别拿感觉当验收,外面的微调教程都只测新任务,搜的人最多,我们出同级对照复线报告,用真实分数吃下这个搜索意图,这种信任我不打算买,先把评测脚本做成可下载买好转化事件看一下载和star再弹,要不要投钱全量回放,训练成本翻三倍我不批,预算线定死,单次微调不超过500PPU小时评测不用同一批B就数据回放先确认授权客户数据不能进训练集评测截留20%封存样本,否则报告漂亮,初始没人负责,工序卡死复具分层。
02:00
混合训练三级评测版本对照,每部有owner和产物,缺一件就算没交付。两个问题,回放比例谁定的?要多少分必须回退,给不出数字,这方案就是自我安慰。我改口径,对外只承诺新任务提升通用能力必须持平,客户要看同级对照表,不给单边漂亮数字回退必须能一键切回base斯模型10分钟内生效,做不到客户会替我们做最残酷的压力测试,我普个反正公开复线里回放低于30%,掉分更狠,建议下限5%,并淘300%分之五百分之十三档对照范围冻结一期只做数据混合,同级对照版本回退混选多任务全餐微调多模态全部不进,最终选B加应约束挪A之上做分层回放,通用数据占5%~10%,牺牲峰值分数和速度换通能不崩,实现定了分层采样加双屏测流水线训完自动跑贝子与冲对照除。
03:16
不错,就回滚到上一版成功线新任务涨不少于8个点,通用能力要不超过2个点,就任务要不超过3个点,超限集停内容测两篇复现报告抢灾难性遗忘这个搜索词评测脚本教程吃lara遗忘长尾看收录和下载转化付费先不加,有2000块测AB文案只追下载转化tag超30块停头这活更适合自然流量去扛预算中值训练加评测不超过500GPU小时,人力两周,线索成本低于30块才继续投入第二期合规门槛过了回放只用授权公开集评测样本脱敏20%封存,红线是客户数据进训练集一票否决清单交互mi冻结p RD Alex触评测流水线,David定三档对账。
04:16
周二出对照表,周四复盘,逾期五升级开板,只做Laura+5%~10%分层回放,Base与to同级对照,通用调超2个点回退,本周出报告。
我来说两句