首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Anthropic 950 个 agent 跑完普查,卡点落在分诊:AI 的瓶颈从生成转向淘汰

Anthropic 950 个 agent 跑完普查,卡点落在分诊:AI 的瓶颈从生成转向淘汰

作者头像
海风自语
发布于 2026-09-25 08:26:58
发布于 2026-09-25 08:26:58
140
举报

我去某省级电网做设备缺陷普查那阵子,最累的从来不是跑数据。

系统半小时能吐出一份上万条记录的清单。然后我们有六个人,轮着看三天。大部分是重复的、已知的、误报的,真正要报上去处理的,一晚上可能就两条。能生成一万条的系统,和能处理二十条的人,从来不是同一套设计。

Anthropic 昨天把这件事推到了极限(官方公告,2026-09-23):约 950 个 Claude agent 跑了 21 小时,消耗 2.1 亿 token,从 20 多万个逆转录酶里筛出 3500 个新候选,最后只提交 20 份值得读的报告。人类做的事只有两件,给出最初的那句提示,然后进实验室验证。他们发现的是一套带类 CRISPR 重复阵列的新型酶系统。

生成能力早就不是瓶颈了,卡在分诊上,而分诊这一层今天几乎全靠人扛。

一、AI 现在的问题不是想不出来,是想得太多

Anthropic 自己在公告里写了一句我认为比发现本身更有价值的话:因为 Claude 产生假设的效率太高,假设本身已经成了他们的研究对象。 他们要回答的是,什么让一个提案值得测试,什么该被搁置。

这句话翻译成工程语言就是:他们只用了 21 小时生成,然后把剩下的时间拿去研究怎么扔。

我做缺陷筛查那几年,最想要而没有的正是这个东西。一份清单交上来,没有理由,没有排序,没有「它比别的候选强在哪」,那人就只能从头看到尾,看三天和看三小时没区别。所有自动化的努力,都在最后一公里被这一层缺失吃干净了。

现在大部分 agent 系统也有同一个毛病。它们设计了产出环节,没设计淘汰环节。有人会说淘汰就是加个过滤器,这是把问题看轻了。淘汰规则真正的难点不在过滤本身,在理由:系统必须能说出「为什么留下这一条」。 说不出这句话,人就得把所有东西重看一遍。

我在四层架构改造里定过一条规矩,业务层里不许出现框架的上下文对象。我给的理由不是那个对象危险,而是不该出现的依赖,一旦允许它出现,就再也收不回来。 淘汰理由也是同一种东西。生成的那一刻如果不写下来,这条理由以后就再也补不回来了。

二、砍在哪里必须写下来,不然它就是在丢东西

AWS 前天开源了他们自己的 agent harness(官方 blog,2026-09-21),给了一组数字:同样的 Claude 或 GPT 模型,换用这个 harness,六项基准上成本低 28%;换成 Fable 5,比 Claude Code 便宜 77%,而 Terminal Bench 2.1 的分数还更高。

这说明 harness 是第二个价格标签,选型表要加一列。但更该记的是它给出的默认值:工具返回结果超过约 1500 token 就截断,上下文占用超过 85% 触发压缩,溢出了在循环里做恢复。官方明说,效率提升主要来自这三条。

1500 这个数字背后的判断是反直觉的。在 agent 里,把东西读全不是保险,是风险。 上下文塞满了,模型只是在噪音里找信号,越读越差。

但砍的位置一旦选错,代价就完全换了一种性质。Claude Code 前两天的更新说明里藏着一条修了很久的 bug:记忆写冲突时,超过约 10800 字符的记忆文件只把首尾交给模型看,重试写入时把中间部分丢了。三个决策分开看都合理,为了控制上下文只给首尾、写入冲突就重试、重试用整篇覆盖。合起来是静默的数据丢失,而且没有任何报错。

读可以截断,写必须全量,这两件事不能共用一条策略。

我在老系统改造里给自己定过一条类似的:任何「我只处理一部分」的优化,必须同时定义「剩下那部分去哪了」。定义不出来的,一律不做。这条规矩替我挡掉的坑,比它省下来的时间值钱得多。

今晚可以动手的三件事

一、数一下你 agent 里「产出条数」和「淘汰规则」的比例。如果只有产出没有淘汰,先加最简单的一条:每次产出附一句它比同类候选强在哪。这句话就是以后排序的全部依据。

二、给工具返回结果定一个显式截断阈值,1500 token 是个能用的起点。但别停在这里,同一次改动里把被截断内容的落盘位置也写上。截断不可怕,截断后不存在才可怕。

三、检查你的记忆和状态写入路径。凡是读取时做了截断、压缩、只取首尾的地方,写入必须走全量,绝不允许把读到的片段写回去覆盖全文。

今日其他信号速览

阿里云云栖大会发布 Qwen-Audio-3.1,全线语音模型降价,ASR 降幅 95%,同时开源了面向实时语音 Agent 的框架 Qwen-Audio-Agent。

OpenRouter 上出现新的匿名模型 Space Bunny Alpha,1M 上下文、免费,但近三天可用性只有 76.22%,约每四次请求有一次失败。前两个同系列的匿名模型后来都揭了盅。

OpenAI、智谱、阿里在同一天把同一个权重的不同档位拆成独立 SKU 出售,其中 GPT-6 Luna 的批处理通道价格是标准通道的一半。

Claude Code 修掉一批静默失效,包括子会话没有继承父会话的限制、含 NUL 字节的权限规则原本会被放大成通配匹配。

Google 发布 Gemini 3.8 Flash TTS,30 秒样本即可复刻一个声音。但 TTS 的上下文窗口只有 8K,它吃的是脚本,不是文档。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-24,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一、AI 现在的问题不是想不出来,是想得太多
  • 二、砍在哪里必须写下来,不然它就是在丢东西
  • 今晚可以动手的三件事
  • 今日其他信号速览
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档