我做日报流水线快一年,中间换过好几个模型。真正让产出变稳的,一次都不是换模型那次。
有两次印象很深。一次是把「写稿」和「审稿」拆成两个不共享上下文的步骤,一次是把每天踩到的坑写成一份会累积的清单文件。模型一直是同一个。
所以今天看到两条新闻,我的反应不是「又有新东西了」,而是「对,就是这个」。
AI 提效的那部分,几乎全长在模型之外。
Shopify 创始人托比·吕特克近日在一档播客里披露了内部 agent 的实践,数字很扎眼。
他们有个叫 River 的内部 agent,住在 Slack 里,能读全部代码,能提变更请求。单 30 天内,5,938 名员工在 4,450 个公开频道里跟它协作,它提交了主仓库大约 1/8 的已合入变更。合并率在两个月里从 36% 涨到 77%。
关键在这句话:Shopify 把这次提升归因于组织学习,而不是换模型。
他们做的三件事,没有一件跟模型有关。
第一,River 拒绝私信。你想让它干活,必须建一个公开频道。吕特克自己的频道有一百多个观察者。他有句话说得很准:让年轻员工看到资深员工怎么用 AI,是把办公室里耳濡目染那套复制过来。
第二,开会话之外没有秘密。私信里的对话结束就蒸发了,公开频道里的每一段都留成了可搜索的范本。
第三,每天深夜,系统把 River 一整天的交互打包丢回给它复盘:哪些处理得当,哪些卡住了,哪个预置指令在执行中偏了。而复盘的直接产物是文本文件,也就是一套套持续更新的指令集。 一个团队为结账数仓写的指令包,后来被另外 12 个团队复用。
我最在意的是最后这条。
把学到的东西写成文件而不是留在会话里,决定了它能不能被复用。
我那份每天累积的坑清单就是这个逻辑。会话关掉就没了,文件会一直在,还能被 diff、被回滚、被交给别人。
这里有个可以直接搬走的模式:规范要写在系统里,不要写在文档里。 「请在公开频道提问」写进文档,几周后就没人记得;agent 直接拒绝私信,规则才成立。
第二条来自具身智能,结论对软件系统同样成立。
银河通用团队近日发布了一组仿真测评,任务是十项双臂操作。他们比了两种架构:一种让 GPT-6 Astra 直接控制机械臂,另一种让专门的动作模型 π0.5 先出 50 步候选动作,再由 Astra 决定是沿用还是修正。
差距很大。直控模式成功率 26%,平均分 37.81;混合模式成功率 48%,平均分 62.60,比第二名高出约 64%。报告为第三方匿名发布,未经独立复现。
但真正让我坐直的数字是另一个:混合模式里,Astra 只对 14.4% 的执行控制步作了修正,其余 85.6% 直接沿用 π0.5 的动作。
贵模型只碰了不到六分之一的步骤,正确率就翻了将近一倍。
这条对我做过的工业现场系统太熟了。变电站巡检、生产安监这类系统,误报和漏报的代价不对称,我们从来不会让一套模型管住每一个判断点。真正管用的是:大量常规判断交给便宜、确定的规则,只在几个真正模糊、代价又高的岔路口上,请人或者请强模型来定。
决定质量的从来不是每一步都用了最强的那个,而是哪几步值得用最强的那个。
报告里另一个数据也印证了边界:直控模式下,搭塔、麻将杠牌这类需要精细接触的任务接近 0 分。通用模型能判断东西在哪、该送到哪,但处理不了接触之后会发生什么。
这跟我一直说的那件事对上了:模型擅长判断,不擅长承担副作用。 凡是会真的改动系统的那一步,仍然需要确定性的执行体。