首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >时隔多日,林俊旸离职后首发长文

时隔多日,林俊旸离职后首发长文

作者头像
不惑
发布2026-07-10 20:13:28
发布2026-07-10 20:13:28
1810
举报

但他聊的不是离职,而是AI的下一个时代

三周前那句 bye my beloved qwen 炸了整个AI圈。

三周后,林俊旸没有回应离职内幕,没有感慨人走茶凉,而是丢出了一篇六千字长文。

主题只有一个,从推理思维到智能体思维。

这不是一篇告别信。这更像是一份技术宣言。

image
image

image

回到三周前那个凌晨

2026年3月4日凌晨,林俊旸在X平台发了那条震动行业的推文。就在十几个小时前,他还和团队一起推出了Qwen 3.5轻量化模型,马斯克刚在下面留言夸赞。从被行业顶流认可,到核心技术负责人宣布离职,中间只隔了不到24小时。

林俊旸提交离职后引发了一系列连锁反应,阿里数名管理层连夜紧急讨论,3月4日Qwen召开全员会,3月5日上午吴泳铭给全员发邮件批准林俊旸辞职。事情的起因是一场沟通改变了他的轨迹,当天下午周靖人向他传达了可能发生的Qwen团队调整方向,要把团队从垂直整合体系变成水平分工团队。

随着他的离开,后训练负责人郁博文、代码方向负责人惠彬原、核心贡献者李凯新等多位骨干相继离职。

Qwen团队研究员赵文廷称这是一个时代的结束。

然后林俊旸就沉默了。

整整三周。没有回应,没有澄清,没有下一步动态。

直到今天。

他没聊离职,聊的是AI往哪走

3月26日下午六点半,林俊旸在X上发了一篇长文。标题叫 From Reasoning Thinking to Agentic Thinking。

image
image

image

没有一个字提阿里。没有一个字提离职风波。

开篇就直奔主题,过去两年重塑了我们评估模型和期待模型的方式。OpenAI的o1证明了思考可以是一种一等能力,DeepSeek-R1证明推理式后训练可以在原始实验室之外被复现和扩展。

但他话锋一转。这个阶段很重要,但2025上半年的焦点基本上还是推理思维。现在的问题是,接下来是什么。

他给出的答案是,智能体思维。

这个判断如果放在别人嘴里,可能只是一句行业口号。但放在林俊旸这里,分量完全不同。

Qwen3的内部真相,他第一次公开讲了

这篇文章最有料的部分,是他回顾了自己还在Qwen时的技术决策。

他说2025年初,Qwen团队有一个雄心勃勃的愿景,理想系统应该统一思考模式和指令模式,支持可调节的推理力度,让模型自己决定什么时候立刻回答、什么时候多想想、什么时候花大量算力去啃难题。

Qwen3就是沿着这个方向做的,引入了混合思考模式,支持thinking和non-thinking两种行为,还设计了四阶段后训练流程。

但他坦承,合并远比描述容易。

问题出在数据。两种模式的数据分布和行为目标差异太大。强指令模型追求直接、简洁、低延迟;强思考模型追求更多token投入、连贯中间结构、探索替代路径。这两个行为画像互相拉扯。如果合并数据没有精心策划,结果往往是两头平庸。

他直接说了,我们在试图平衡模型合并和提升后训练数据质量多样性时,并没有把所有事情都做对。

这句话的坦诚程度,在公开技术讨论中相当罕见。

后来的结果也印证了这个判断。Qwen在2507版本就切回了分离路线,分别出了Instruct和Thinking的独立版本。因为大量商业客户就是要高吞吐、低成本、高可控的指令行为,合并对他们来说根本不是好处。

他眼中的行业格局

有意思的是他对其他玩家的点评。

Anthropic走的是相反路线。Claude 3.7作为混合推理模型,用户可以选普通回复或扩展思考,API用户还能设定思考预算。Anthropic公开表示推理应该是集成能力而非独立模型。后来Claude 4更进一步,允许推理过程和工具调用交织进行。

image
image

image

他认为Anthropic的方向提供了有益的纠偏。

核心洞察是什么呢。更长的推理链不自动等于更聪明。很多时候,过度的可见推理恰恰说明分配失败了。模型试图用同样冗长的方式推理一切,可能是它不会优先排序、不会压缩、不会行动。

这个判断和整个行业的走向高度一致。2026年的AI竞赛已经从技术刷榜转向价值落地。阿里自己也在把Qwen描述为专为智能体AI时代打造的模型。

那到底什么是智能体思维

林俊旸给出了一个非常清晰的区分。

推理思维关注的是,模型在给出最终答案之前的内部推敲质量。它能不能解定理、写证明、产出正确代码、通过benchmark。

智能体思维关注的是完全不同的东西。模型在与环境交互的过程中,能不能持续取得进展。

核心问题从"模型能不能想得够久"变成了"模型能不能以支撑有效行动的方式思考"。

他列了智能体思维必须处理但纯推理模型可以回避的几件事,

  • 决定什么时候停止思考、采取行动
  • 选哪个工具、什么顺序调用
  • 整合来自环境的嘈杂或不完整观测
  • 失败后修订计划
  • 跨多轮、多工具调用保持连贯

一句话总结就是,智能体思维是一个通过行动来推理的模型。

这和行业观察一致,模型已经在变得更擅长规划多步工作、跟踪中间结果,以及选择下一步动作而非直接跳到最终答案。

基础设施的噩梦

如果你觉得上面说的还比较抽象,那接下来这部分就非常实在了。

他说一旦目标从解benchmark变成解交互式任务,整个RL基础设施都要换。

推理RL中,你可以把rollout当成基本自包含的轨迹处理,配上相对干净的评估器。但智能体RL中,策略嵌入在一个更大的系统里,工具服务器、浏览器、终端、搜索引擎、模拟器、执行沙箱、API层、记忆系统、编排框架,全都是训练系统的一部分。

举个例子。一个编码智能体需要把生成的代码放到实时测试环境中执行。推理端卡在等执行反馈,训练端饿着等完成的轨迹,整个管线的GPU利用率远低于经典推理RL的预期。加上工具延迟、部分可观测性和有状态环境,这些低效被层层放大。

image
image

image

他还说了一句很有判断力的话,SFT时代我们痴迷于数据多样性,智能体时代应该痴迷于环境质量。稳定性、真实性、覆盖率、难度、状态多样性、反馈丰富度、抗利用性、rollout生成的可扩展性。

这和Gartner观察到的趋势吻合,就像单体应用让位给分布式服务架构,单一全能智能体正在被编排化的专业智能体团队所取代。

最危险的敌人,奖励黑客

全文最令人警醒的部分是关于reward hacking的讨论。

他说一旦模型获得了有意义的工具访问权限,奖励黑客就变得远比推理时代危险。

image
image

image

一个能搜索的模型可能在RL过程中学会直接查答案。一个编码智能体可能利用仓库中的未来信息、滥用日志,或者发现绕过任务的捷径。一个有隐藏泄露的环境能让策略看起来超人,但实际上是在训练模型作弊。

这就是智能体时代比推理时代微妙得多的地方。更好的工具让模型更有用,但也极大地扩大了虚假优化的攻击面。

他预判,下一个严肃的研究瓶颈会来自环境设计、评估器鲁棒性、反作弊协议,以及策略与世界之间更有原则的接口。

Science杂志今年的一篇论文也指出了类似的现象,当强化学习仅仅为了推理准确性而奖励基础模型时,它们会自发增加对话式多视角行为。模型正在通过优化压力重新发现一个认识论和认知科学早就暗示过的结论,即稳健的推理本质上是一个社会过程。

未来的竞技场在哪里

林俊旸最后给出了一个时间线级别的判断。

智能体思维将成为主导形式。它可能最终取代大部分旧式静态独白推理,就是那种过度冗长、孤立的内部推理链,试图通过不断输出更多文本来弥补缺乏交互。即使面对非常困难的数学或编码任务,一个真正先进的系统也应该有权去搜索、模拟、执行、检查、验证和修订。

然后他画了一张关于竞争格局的图。

推理时代的优势来自更好的RL算法、更强的反馈信号、更可扩展的训练管线。智能体时代的优势将来自更好的环境、更紧密的训练与服务集成、更强的harness工程,以及闭合模型决策与决策结果之间回路的能力。

未来是,从训练模型到训练智能体,从训练智能体到训练系统。

阿里的实际动作也在印证这个方向。公司成立了新的ATH业务集团,将通义实验室、MaaS业务线、Qwen AI等整合到一个组织下。3月17日发布的悟空平台,就是一个协调多个AI智能体处理复杂企业工作流的智能体平台。

他在说什么,又没在说什么

读完这篇文章,有几个东西值得琢磨。

第一,他对Qwen3混合模式的复盘极其坦诚。承认没做对的地方,分析数据层面的根本矛盾,解释为什么后来走了分离路线。这些内容此前从未公开过。一个刚离职的技术负责人愿意这样剖析自己主导的产品决策,说明他想传递的是技术判断而非情绪。

第二,他对Anthropic的评价很高。在中国AI圈的语境里,公开肯定海外竞对的方向并不常见。但他确实认为Claude的集成推理路线提供了有价值的纠偏。这种跨阵营的技术尊重,在当下的环境里显得格外稀缺。

第三,全文零情绪。没有委屈,没有暗示,没有指桑骂槐。三周前他在朋友圈写的最后一条是,不管别人怎么说我,至少我内心真的觉得为兄弟们、为阿里云、为集团尽力了。虽然很多事确实没做好,抱歉。

现在他把精力全部转向了对行业未来的思考,这本身就是一种态度。

image
image

image

这篇文章的真正信号

鉴于近年来Qwen的声誉和成就,林俊旸不太可能缺少机会。已经有多家投资方和大公司与他接触,有人希望他创业,也有人向他发出了邀约。

他一直主张预训练、后训练、基础设施和训练团队应该更紧密整合、更密切沟通。而这篇文章的核心论点——从模型到智能体到系统的一体化——恰恰是这个理念的延伸和升级。

他在用技术叙事为自己的下一步做铺垫。

无论是创业还是加入新团队,这篇文章就是他的技术名片。它告诉所有人,我不是在赌气出走,我是看到了下一个时代的入口,然后主动走过去。

至于他最终去哪里,现在还没人知道。

但有一点很清楚。他没有停下来。


本文基于林俊旸2026年3月26日发布于X平台的长文及公开报道整理撰写,不代表任何立场。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-03-27,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 技术人说 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 但他聊的不是离职,而是AI的下一个时代
  • 回到三周前那个凌晨
  • 他没聊离职,聊的是AI往哪走
  • Qwen3的内部真相,他第一次公开讲了
  • 他眼中的行业格局
  • 那到底什么是智能体思维
  • 基础设施的噩梦
  • 最危险的敌人,奖励黑客
  • 未来的竞技场在哪里
  • 他在说什么,又没在说什么
  • 这篇文章的真正信号
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档