首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI 提效不在模型那一侧:Shopify 合并率翻倍,银河通用只改 14.4% 的步骤

AI 提效不在模型那一侧:Shopify 合并率翻倍,银河通用只改 14.4% 的步骤

作者头像
海风自语
发布2026-09-18 08:44:03
发布2026-09-18 08:44:03
580
举报

我做日报流水线快一年,中间换过好几个模型。真正让产出变稳的,一次都不是换模型那次。

有两次印象很深。一次是把「写稿」和「审稿」拆成两个不共享上下文的步骤,一次是把每天踩到的坑写成一份会累积的清单文件。模型一直是同一个。

所以今天看到两条新闻,我的反应不是「又有新东西了」,而是「对,就是这个」。

AI 提效的那部分,几乎全长在模型之外。

一、agent 变好用的那部分,长在流程上

Shopify 创始人托比·吕特克近日在一档播客里披露了内部 agent 的实践,数字很扎眼。

他们有个叫 River 的内部 agent,住在 Slack 里,能读全部代码,能提变更请求。单 30 天内,5,938 名员工在 4,450 个公开频道里跟它协作,它提交了主仓库大约 1/8 的已合入变更。合并率在两个月里从 36% 涨到 77%。

关键在这句话:Shopify 把这次提升归因于组织学习,而不是换模型。

他们做的三件事,没有一件跟模型有关。

第一,River 拒绝私信。你想让它干活,必须建一个公开频道。吕特克自己的频道有一百多个观察者。他有句话说得很准:让年轻员工看到资深员工怎么用 AI,是把办公室里耳濡目染那套复制过来。

第二,开会话之外没有秘密。私信里的对话结束就蒸发了,公开频道里的每一段都留成了可搜索的范本。

第三,每天深夜,系统把 River 一整天的交互打包丢回给它复盘:哪些处理得当,哪些卡住了,哪个预置指令在执行中偏了。而复盘的直接产物是文本文件,也就是一套套持续更新的指令集。 一个团队为结账数仓写的指令包,后来被另外 12 个团队复用。

我最在意的是最后这条。

把学到的东西写成文件而不是留在会话里,决定了它能不能被复用。

我那份每天累积的坑清单就是这个逻辑。会话关掉就没了,文件会一直在,还能被 diff、被回滚、被交给别人。

这里有个可以直接搬走的模式:规范要写在系统里,不要写在文档里。 「请在公开频道提问」写进文档,几周后就没人记得;agent 直接拒绝私信,规则才成立。

二、贵模型的正确用法,是当少数几个岔路口的判官

第二条来自具身智能,结论对软件系统同样成立。

银河通用团队近日发布了一组仿真测评,任务是十项双臂操作。他们比了两种架构:一种让 GPT-6 Astra 直接控制机械臂,另一种让专门的动作模型 π0.5 先出 50 步候选动作,再由 Astra 决定是沿用还是修正。

差距很大。直控模式成功率 26%,平均分 37.81;混合模式成功率 48%,平均分 62.60,比第二名高出约 64%。报告为第三方匿名发布,未经独立复现。

但真正让我坐直的数字是另一个:混合模式里,Astra 只对 14.4% 的执行控制步作了修正,其余 85.6% 直接沿用 π0.5 的动作。

贵模型只碰了不到六分之一的步骤,正确率就翻了将近一倍。

这条对我做过的工业现场系统太熟了。变电站巡检、生产安监这类系统,误报和漏报的代价不对称,我们从来不会让一套模型管住每一个判断点。真正管用的是:大量常规判断交给便宜、确定的规则,只在几个真正模糊、代价又高的岔路口上,请人或者请强模型来定。

决定质量的从来不是每一步都用了最强的那个,而是哪几步值得用最强的那个。

报告里另一个数据也印证了边界:直控模式下,搭塔、麻将杠牌这类需要精细接触的任务接近 0 分。通用模型能判断东西在哪、该送到哪,但处理不了接触之后会发生什么。

这跟我一直说的那件事对上了:模型擅长判断,不擅长承担副作用。 凡是会真的改动系统的那一步,仍然需要确定性的执行体。

今晚可以动手的三件事

  1. 数一下你的评测集里,有多少条是换掉模型就不成立的。 把主模型换成备选,重跑一遍,看通过率的排序还稳不稳。稳,说明你测的是业务;全乱,说明你测的是模型的脾气。
  2. 检查系统里所有靠文档约束的规则。 挑一条最常被违反的,把它从文档搬进代码,让违反直接报错,而不是靠人提醒。
  3. 把 agent 的执行记录改成能回放的格式。 中间状态、判据、结果分字段存。只存最终结论的记录不叫可观测性,那叫讣告。

今日其他信号速览

  • 小米把 MiMo-V2.6 的强化学习训练全程直播,看板实时公开成本与采样状态:两个模型已花掉约 108 万美元、累计 60 亿 token,并发活跃沙箱超过 6 万个,DeepSWE 分数 62.24 与 60.77,明显落后于同期头部。厂商愿意把落后过程摊开,这件事本身罕见。
  • Cloudflare 上线「Disallow AI Training」,把爬虫拆成搜索、训练、智能体三类独立控制。混合用途爬虫占其已验证爬虫流量的 36.6%,苹果、谷歌、微软已承诺遵守。
  • OpenAI 把 ChatGPT 广告位改造成「赞助智能体」,点广告后可与企业的 AI 对话,官方强调与用户原有对话完全隔离。
  • 纳德拉在 All-In 峰会给出一条验收测试:抽掉一个模型,看你的评测还能不能保留。保得住才叫架构,保不住说明已经绑死了。
  • PS5 Linux 核心开发者宣布退出,起因是 AI 辅助的破解者找到他刻意保留的关键漏洞,并提前提交给索尼。产出变便宜之后,谁来决定什么时候兑现,成了新的问题。
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-17,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一、agent 变好用的那部分,长在流程上
  • 二、贵模型的正确用法,是当少数几个岔路口的判官
  • 今晚可以动手的三件事
  • 今日其他信号速览
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档