我去某省级电网做设备缺陷普查那阵子,最累的从来不是跑数据。
系统半小时能吐出一份上万条记录的清单。然后我们有六个人,轮着看三天。大部分是重复的、已知的、误报的,真正要报上去处理的,一晚上可能就两条。能生成一万条的系统,和能处理二十条的人,从来不是同一套设计。
Anthropic 昨天把这件事推到了极限(官方公告,2026-09-23):约 950 个 Claude agent 跑了 21 小时,消耗 2.1 亿 token,从 20 多万个逆转录酶里筛出 3500 个新候选,最后只提交 20 份值得读的报告。人类做的事只有两件,给出最初的那句提示,然后进实验室验证。他们发现的是一套带类 CRISPR 重复阵列的新型酶系统。
生成能力早就不是瓶颈了,卡在分诊上,而分诊这一层今天几乎全靠人扛。
Anthropic 自己在公告里写了一句我认为比发现本身更有价值的话:因为 Claude 产生假设的效率太高,假设本身已经成了他们的研究对象。 他们要回答的是,什么让一个提案值得测试,什么该被搁置。
这句话翻译成工程语言就是:他们只用了 21 小时生成,然后把剩下的时间拿去研究怎么扔。
我做缺陷筛查那几年,最想要而没有的正是这个东西。一份清单交上来,没有理由,没有排序,没有「它比别的候选强在哪」,那人就只能从头看到尾,看三天和看三小时没区别。所有自动化的努力,都在最后一公里被这一层缺失吃干净了。
现在大部分 agent 系统也有同一个毛病。它们设计了产出环节,没设计淘汰环节。有人会说淘汰就是加个过滤器,这是把问题看轻了。淘汰规则真正的难点不在过滤本身,在理由:系统必须能说出「为什么留下这一条」。 说不出这句话,人就得把所有东西重看一遍。
我在四层架构改造里定过一条规矩,业务层里不许出现框架的上下文对象。我给的理由不是那个对象危险,而是不该出现的依赖,一旦允许它出现,就再也收不回来。 淘汰理由也是同一种东西。生成的那一刻如果不写下来,这条理由以后就再也补不回来了。
AWS 前天开源了他们自己的 agent harness(官方 blog,2026-09-21),给了一组数字:同样的 Claude 或 GPT 模型,换用这个 harness,六项基准上成本低 28%;换成 Fable 5,比 Claude Code 便宜 77%,而 Terminal Bench 2.1 的分数还更高。
这说明 harness 是第二个价格标签,选型表要加一列。但更该记的是它给出的默认值:工具返回结果超过约 1500 token 就截断,上下文占用超过 85% 触发压缩,溢出了在循环里做恢复。官方明说,效率提升主要来自这三条。
1500 这个数字背后的判断是反直觉的。在 agent 里,把东西读全不是保险,是风险。 上下文塞满了,模型只是在噪音里找信号,越读越差。
但砍的位置一旦选错,代价就完全换了一种性质。Claude Code 前两天的更新说明里藏着一条修了很久的 bug:记忆写冲突时,超过约 10800 字符的记忆文件只把首尾交给模型看,重试写入时把中间部分丢了。三个决策分开看都合理,为了控制上下文只给首尾、写入冲突就重试、重试用整篇覆盖。合起来是静默的数据丢失,而且没有任何报错。
读可以截断,写必须全量,这两件事不能共用一条策略。
我在老系统改造里给自己定过一条类似的:任何「我只处理一部分」的优化,必须同时定义「剩下那部分去哪了」。定义不出来的,一律不做。这条规矩替我挡掉的坑,比它省下来的时间值钱得多。
一、数一下你 agent 里「产出条数」和「淘汰规则」的比例。如果只有产出没有淘汰,先加最简单的一条:每次产出附一句它比同类候选强在哪。这句话就是以后排序的全部依据。
二、给工具返回结果定一个显式截断阈值,1500 token 是个能用的起点。但别停在这里,同一次改动里把被截断内容的落盘位置也写上。截断不可怕,截断后不存在才可怕。
三、检查你的记忆和状态写入路径。凡是读取时做了截断、压缩、只取首尾的地方,写入必须走全量,绝不允许把读到的片段写回去覆盖全文。
阿里云云栖大会发布 Qwen-Audio-3.1,全线语音模型降价,ASR 降幅 95%,同时开源了面向实时语音 Agent 的框架 Qwen-Audio-Agent。
OpenRouter 上出现新的匿名模型 Space Bunny Alpha,1M 上下文、免费,但近三天可用性只有 76.22%,约每四次请求有一次失败。前两个同系列的匿名模型后来都揭了盅。
OpenAI、智谱、阿里在同一天把同一个权重的不同档位拆成独立 SKU 出售,其中 GPT-6 Luna 的批处理通道价格是标准通道的一半。
Claude Code 修掉一批静默失效,包括子会话没有继承父会话的限制、含 NUL 字节的权限规则原本会被放大成通配匹配。
Google 发布 Gemini 3.8 Flash TTS,30 秒样本即可复刻一个声音。但 TTS 的上下文窗口只有 8K,它吃的是脚本,不是文档。