2026 年 9 月,大概是 AI 行业有史以来最拥挤的一个发布季:三周之内,Anthropic、OpenAI、Google、DeepSeek、xAI、阿里、讯飞、阶跃星辰接连交出新一代模型。但比「谁又刷了榜」更值得看的,是评价标准的悄然换轨——从裸跑分,转向单位成本下的交付能力。我把这一个月的大事按时间线捋了一遍,聊聊我的观察。
一、旗舰时间线:三周三连发,谁都没敢缺席
这个 9 月的节奏,密集到有些反常:
- 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1。亮点除了性能提升,更实际的是成本:官方口径下典型工作负载成本下降约 25%,高智能体任务成本下降约 45%,同时补上了企业数据合规(Enterprise Frontier Safeguards)这块拼图。
- 9 月 2 日,Google 放出 Gemini 3.8 Flash。走的是「快与便宜」路线:吞吐 300+ tokens/秒,定价约 $1.5/百万 token,卡位中端生产负载。
- 9 月 3 日,OpenAI 正式推出 GPT-6 Astra。这是其史上最大规模的训练项目,据报道用了超过 10 万块 GPU;产品定位明确锚定「具备自主执行能力」,主打自主操作电脑、执行多步工作流。
- 9 月 10 日,DeepSeek V4.1-Flash 上线。全新 Causal Encoder-Decoder 架构,总参数 552B 的 MoE(输入激活 8B、输出激活 16B),支持 100 万 token 上下文,KV cache 占用下降约 75%。官方同时宣布退役 V4-Flash 系列,9 月 14 日起 V4-Pro 的 API 请求也路由到 V4.1-Flash——一个模型吃下整条产品线的打法。
- 9 月 12 日,xAI 推出 Grok4.7,参数规模约 2.1 万亿,较上一代 Grok4.6 的 1.5 万亿增长约 40%。
- 阿里 Qwen3.8-Max-0902 也在同期跟进:2.4T 参数、1M 上下文,主打代码方向,发布即登上 Code Arena: WebDev 榜首(1691 分),API 定价 $2/$6 每百万 token(输入/输出)。
| | | |
|---|
| | Claude Fable 5.1 / Mythos 5.1 | |
| | | 300+ tokens/秒,$1.5/M token |
| | | |
| | | 552B MoE,1M 上下文,KV cache -75% |
| | | |
| | | |
一个值得注意的背景:GPT-6 Astra 的训练首次用上了十万卡级别的集群。Scaling Law 这条定律目前看还没有被打破——但正如业内分析指出的,越往后,同样一个百分点的能力提升,需要付出的成本是指数级上涨的。
二、价格战开打:便宜正在变成新的竞争力
如果说旗舰发布是「明线」,那成本下探就是这轮竞赛的「暗线」:
- 9 月 7 日,科大讯飞发布星火 X2.5:293B-A30B 的 MoE 架构,重点提升代码与智能体能力。更关键的一句话是——基于全国产算力完成全流程训练及推理。这件事的战略意义不亚于模型本身的性能。
- 9 月 20 日,阶跃星辰发布 Step 5 Preview,跻身 AA 综合智能指数全球开源前三。真正扎眼的数字是:单任务成本约为 Claude Opus 5 的 1/8,官方预告 10 月 15 日正式开源。
- 端侧开源潮同步提速:面壁智能开源 MiniCPM5-2B,紫东太初开源 9B 多模态模型,讯飞把星火 X2.5 的 4B/1.7B 端侧版本也放了出来——最长支持 100 万 token 上下文,瞄准车载和智能硬件。
国产旗舰正在集体采用稀疏 MoE 架构,把推理成本压到「九成能力、一成价格」。模型竞争的第一性原理,正在从「谁更强」切换为「谁更划算」。
三、生态与落地:模型趋同之后,卷的是工程能力
模型之外,这个月还有几件事值得单独拎出来:
- 微软把 Grok 接入了 Microsoft 365 Copilot(Word/Excel/PowerPoint),面向 Frontier 计划企业客户先行推送。第三方模型进生产力套件,这在全球主流办公生态里还是头一遭。
- Cursor 推出 Projects(beta):由一个协调者 Agent 统筹多个子 Agent 处理复杂任务,跨设备同步共享记忆与产物,还支持事件驱动订阅——比如盯 Slack 消息、盯着 PR 自动修 CI。官方数据称重度用户的 PR 合并量提升了 6 倍。
- 音乐生成双发:Suno 发布 v6 模型家族(v6 / v6-wild / v6-mini 三档,与音乐人合作共建);Google 跟进 Lyria 3.5,支持 44.1kHz 立体声整曲生成、自定义歌词与时间轴结构控制,并带 SynthID 水印。
- Perplexity 用 WANDR 基准测了 GPT-6 Astra:0.682 分,单任务成本 $11.98,是目前测过的最高分。对比 Fable 5.1:高 13.5%,成本低 6.1%。「按任务计费」的评测口径,本身就说明评价标准在换轨。
四、具身智能:从「能跳舞」到「自己走下产线」
- 9 月 8 日,小鹏机器人生产线正式启用:全球首位高阶通用人形机器人完成自动化总装并自主走下产线,核心制程自动化率超 80%。搭载 3 颗自研 AI 芯片(有效算力 2250 TOPS),端侧部署物理 AI 大模型,无需遥操作即可自主完成复杂任务。计划年底进入规模量产,2027 年面向全球交付。
- 特斯拉机器人量产也在提速:9 月 16 日团队落地宁波开启新一轮量产审厂,按计划 2026 年下线约 5 万台 Optimus,部署至旗下全球超级工厂。
- 供应链端,智身科技完成数亿元 B 轮融资,其机器人累计量产突破 15000 台;领益智造多地机器人基地组装产线投产。
从「能跳舞」到「自己走下产线干活」,中间隔了不到两年。这个速度,比多数人的预期都快。
五、我的三点观察
1. 裸跑分时代正在结束,「单位成本下的交付能力」成了新指挥棒。
Perplexity 的按任务计费评测、阶跃的「1/8 成本」话术、Fable 的「负载成本 -45%」——厂商开始用同一个句式说话:同样的活,我比你便宜多少。这不是营销话术的巧合,是客户采购逻辑倒逼的结果。
2. 开源与端侧在抢「最后一公里」。
100 万 token 上下文从旗舰下放到 2B/4B 的端侧模型,意味着很多原本必须上云的场景(车载、手机、IoT)可以本地闭环。配合国产算力全流程跑通,这条线的长期影响可能比旗舰榜单一时的先后更重要。
3. Agent 平台化是下一个战场。
模型能力趋同之后,差异会出现在协调、记忆、事件驱动这些「工程能力」上。Cursor Projects 的协调者-子代理架构、Grok 接入 Copilot,都是同一个趋势的不同切面:模型在变成基础设施,产品竞争上移到编排层。
结语
回头看这一个月:旗舰三周三连发,价格一路下探,机器人自己走下产线。跑分依然会发布,但已经不再决定什么。
对普通开发者来说,这个阶段的实操建议反而简单了:别急着追旗舰,先算清楚自己场景下的单位任务成本,再决定用哪家的 API——按这个标准,这个 9 月,可选项比去年多了不止一倍。
数据与时间线综合自各厂商官方发布及公开报道(2026 年 9 月),个别数字以官方口径为准。