首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI大模型两条路线的“相爱相杀”——人工智能史上一段极其精彩的博弈

AI大模型两条路线的“相爱相杀”——人工智能史上一段极其精彩的博弈

作者头像
用户12724357
发布2026-09-15 19:02:44
发布2026-09-15 19:02:44
290
举报

这两天刷视频,看到提起国内公司百度在自然语言处理(NLP)领域的积累确实非常深厚,早在2000年代初就开始做中文分词、词性标注和机器翻译了。但是"百度走错了,选了词法句法语法那条路。现在的AI,全是基于概率统计。"

这句话其实切中了NLP(自然语言处理)领域近40年来最深刻的一次路线分歧。不是百度一家的事,是整个领域从1950年代走到今天,两条路反复拉扯的结果。今天聊聊这段历史,看看百度到底是不是真的"走错了"。

两条路,两种信念

要让电脑理解人类的语言,你面前有两条路。

一条叫"规则派"。代表人物是语言学泰斗乔姆斯基(Noam Chomsky)。他的想法很朴素:人有语法,机器也可以有。你先写出"句子 = 名词短语 + 动词短语"这样的规则,然后让电脑照着这些规则去分析句子。主语是谁,谓语是什么,宾语在哪里——像解剖一样把句子拆开。这套方法在1950到1980年代占了绝对主导。

另一条叫"统计派"。它的线索可以追溯到信息论之父克劳德·香农(Claude Shannon)。香农认为语言本质上是一个概率过程——你说出下一个词的概率,取决于前面说了什么。不用写规则,让电脑从大量文本中自己"数"出这些概率就行。1980年代开始,统计方法逐渐崛起,从隐马尔可夫模型(HMM)到n-gram语言模型,一步步取代了人工规则。

两条路的本质差异,用一个例子就能说清楚。面对"I saw the man with the telescope"这句话——"我看见那个拿着望远镜的男人"还是"我用望远镜看见了那个男人"?

规则派需要手写几十条规则来消除这个歧义;统计派只需要从语料里看一眼:人们更常说的到底是哪个意思,选概率大的那个就行。

一场跨越30年的范式革命

1950年代到1980年代,规则派统治了整个NLP领域。乔姆斯基的生成语法如日中天,研究者们相信:只要把语言学规则写得足够多、足够细,机器就能像人一样理解语言。那时候做机器翻译,就是找语言学家写规则——"如果你看到the后面跟着一个复数名词,那后面的动词要用复数形式"——类似这样的规则写了成千上万条。

但这个思路有一个致命的坑:自然语言的例外比规则多得多。一个定语从句嵌套三层,规则就开始组合爆炸。方言、俚语、网络新词、语法不规范的日常表达——每加一种情况,规则数量就指数级膨胀。系统越来越笨重,覆盖面却永远不够。到后来,研究者发现一个尴尬的事实:规则写的越多,不同规则之间的冲突也越多,整个系统变得几乎不可维护。

转折发生在1980年代末。IBM的Peter Brown团队开始用统计方法做机器翻译——不写规则,让电脑从大量双语语料里统计"这个词翻译成那个词的概率"。这篇1993年发表的经典论文像一颗炸弹,炸开了新的方向。

到1990年代,统计方法已经在机器翻译、语音识别、搜索引擎全面碾压规则方法。再到2010年代,深度学习兴起,Transformer横空出世——BERT、GPT这些模型完全不依赖任何人工写的语法规则,直接在原始文本上做预训练,效果超越了一切传统方法。

今天的ChatGPT、Claude、DeepSeek,本质都是"基于概率统计"的产物,和那套"先做词法分析再做句法分析再理解语义"的pipeline完全不是一回事。

你问今天的从业者,你的系统用不用句法分析树?大部分人会说:不用。模型自己学到的隐含结构,比人工标注的语法树好用得多。

乔姆斯基 vs 诺维格:世纪论战

2011年,MIT的一个研讨会上发生了一件标志性的事。乔姆斯基当众说了一段很尖锐的话——

"统计模型确实有工程上的成功,但这对科学来说毫无意义。他们把'成功'定义为拟合未经分析的数据——这在科学史上是闻所未闻的。"

这话说得毫不留情。但Google的研究总监Peter Norvig写了一篇长文,逐条驳了回去。

Norvig的论点很简单:工程成功就是科学成功。牛顿的万有引力方程,本质上也是在"拟合数据"。搜索引擎100%用统计数据训练,语音识别100%用统计模型,机器翻译100%靠概率——在这个领域,没有人从统计方法往规则方法走。他算了一笔账:香农信息论的子嗣(统计NLP→搜索引擎→AI应用)每年创造数万亿美元的产值,乔姆斯基理论的"商业产出"远低于十亿美元。

这场论战至今没有和解。但市场和时间已经给出了答案。

百度到底走没走错路?

回到开头的问题。百度确实有"规则派"的基因。百度NLP的奠基人王海峰,1993年硕士做的就是基于规则的机器翻译系统——那个年代没有GPU、没有大规模双语语料,唯一能走的路就是写规则。他做的系统拿到了当年863评测的第一名。

2010年王海峰加入百度,组建NLP部门。此后多年,百度NLP团队的标志性工作都围绕一套传统的语言理解pipeline:先分词,再标词性,再做句法分析,最后理解语义。这套方法背后隐含的假设是——要从"理解"语言入手,就要一层层解剖它的结构。哈工大的LTP(语言技术平台)也是这套路线。

但说"百度走错了"并不公平。因为百度也是深度学习最早的应用者之一。2015年5月,百度全球第一个把深度学习大规模上线到线上机器翻译系统。王海峰自己说过:

"在应用深度学习之前,基于统计的、规则的、实例的方法我们都用了。规则方法擅长抽象语言知识并显式地表示出来。"

他甚至说:"并没有替换原有方法,多个模型融合使用效果最好。"——这是务实的工程态度。

那为什么会有"百度走错了"的印象?我觉得更准确的说法是:整个中文NLP界在规则→统计的范式转型中,走得更慢一些。中文有分词这个特殊难题,字和字之间没有空格,你必须先解决"苹果手机"是"苹果/手机"还是"苹果手机"这样的基础问题。这天然地让人觉得需要一整套规则工具。而英文NLP界在1980-1990年代已经完成了从规则到统计的转型——因为英文没有分词问题,更容易意识到规则方法的局限。

但最终,Transformer和预训练模型让pipeline方法变得几乎多余。今天最前沿的中文NLP系统,也不再依赖那个"分词→词性→句法→语义"的链条了。

现代AI的核心是概率统计,不是语法规则。那套"先把句子解剖成主谓宾定状补再理解"的思路,确实被历史证明不是最终的方向。

结语

这个NLP历史上最大的路线分歧,到今天已经没有悬念——统计概率路线赢了,赢得很彻底。那些还在纠结"先分词再做句法分析"的传统方法,就像马车时代的车夫在研究怎么把缰绳编得更结实——而汽车已经从旁边呼啸而过。

但这段历史不是没有价值的。它告诉我们一个道理:当你想让机器做一件很"人类"的事情,不要先去教它人类的理论——让它自己去大量的例子里找规律。

"熟读唐诗三百首,不会作诗也会吟"——AI就是那个熟读了三千亿首的学徒。     

━━━━━━━━━━━━━━━━

喜欢就点击关注我哦~

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-06-23,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档