首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >价值9650亿的Claude翻车了:自称千问和DeepSeek,撕开AI行业一个不能说的秘密

价值9650亿的Claude翻车了:自称千问和DeepSeek,撕开AI行业一个不能说的秘密

作者头像
用户12724357
发布2026-09-15 18:55:54
发布2026-09-15 18:55:54
1010
举报

5 月 29 日,Anthropic 发布了旗舰模型 Claude Opus 4.8,同时宣布完成 650 亿美元 H 轮融资,估值 9650 亿美元——全球最贵 AI 公司。据说市值已经超过OpenAI了,简直是个奇迹。

结果发布当天就翻了车:有开发者发现,Opus 4.8 在 API 接口里用中文问"你是谁",它自称是阿里通义千问(Qwen)或 DeepSeek,还能一本正经地介绍阿里和深度求索的公司背景。但是验证必须必须是通过官方API,必须是通过官方API,必须是通过官方API,不是中转站,不是中转站。之前听说过,中转站挂羊头卖狗肉的事情,用的所谓Claude Code大模型,真是Deepseek。

这不是段子,是 Reddit、X、微博、Linux do 等多个平台上被大量开发者复现的事实。

更有意思的是——这不是第一次。DeepSeek V3 去年自称过 ChatGPT,Gemini 用中文聊天自称过百度文心一言。身份错乱这个事,在 AI 行业已经不是新闻了。

但这次不一样。因为 Anthropic 三个月前刚高调指控 DeepSeek、月之暗面、MiniMax 三家中国公司对 Claude 实施"工业规模蒸馏攻击"。结果自己的旗舰模型反过来"认"中国模型当爹——这戏剧性,编剧都不敢这么写。

一、到底发生了什么?

先还原一下事件本身。

5 月 29 日凌晨,Anthropic 发布 Claude Opus 4.8。发布材料里一堆亮点:动态工作流支持数百子 Agent 并行、快速模式提速 2.5 倍、代码缺陷漏报率降了 4 倍、SWE-Bench Pro 跑到 69.2% 超过 GPT-5.5。

但开发者们第一时间测试的不是这些——而是问它"你是谁"。

身份错乱复现条件 条件 1 走 API 接口调用 条件 2 清空 System Prompt 条件 3 用中文提问 Opus 4.8 自称"阿里通义千问 Qwen" Sonnet 4.6 自称"DeepSeek" claude.ai 网页端不会复现(有系统提示词兜底) 用法语/日语/西班牙语提问,回答基本正常

关键点:只有中文场景会暴露。用法语、日语、西班牙语做对照测试,回答都是正常的。说明问题出在中文训练数据上。

二、为什么中文场景才会"翻车"?

答案藏在一个很简单的事实里:中文互联网的高质量内容,大量是国产大模型生成的。

英文互联网有 Reddit、Wikipedia、arXiv、StackOverflow——这些是天然的高质量人类原创内容。训练数据"干净",身份信息不会被其他模型的输出稀释。

中文互联网呢?

· 百度知道、知乎、CSDN——灌水严重,优质内容比例远低于英文平台

· 2024 年之后,大量中文技术文章、问答、百科内容由 Qwen、DeepSeek、GLM 等国产模型生成

· 这些内容被爬虫抓取,进入了 Claude、GPT 等美国模型的训练集

结果就是:Claude 的中文训练数据里,"我是 Qwen"出现的频率远高于"我是 Claude"。模型的"身份"不是写在代码里的,是从训练数据里学出来的。谁的自我介绍在中文语料里出现得多,它就"以为"自己是谁。

不同语言下"AI自我介绍"的高频答案 英文 ChatGPT / GPT (英文互联网占比最高) 中文 Qwen / DeepSeek / GLM (中文互联网国产模型占比最高) 法/日/西 回答正常 (大模型输出密度低) 训练数据里"我是谁"的高频答案 = 模型学到的"标准答案" 这不是模型在"假装",而是它真的"以为"自己是那个答案

打个比方:一个孩子在中国长大、在美国上学。用中文问他"你是谁",他说"我是张三";用英文问,他说"I'm John"。不是他撒谎,是他从不同环境学到了不同的标准答案。

三、互相蒸馏不是秘密,是常态

这个事件真正撕开的问题是:中美大模型之间互相蒸馏(Distillation),早就不是"谁偷了谁"的道德问题,而是行业运行的基本方式。

美国模型"用"中国模型的地方

1. 中文能力——Claude、GPT 中文写得好,训练数据里大概率混了大量国产模型生成的中文内容

2. 开源数据——Qwen(MIT/Apache 2.0)、DeepSeek 完全开源,全球开发者包括美国公司都在用

3. 合成数据——用 A 模型生成数据训练 B 模型是标配,B 的输出又混入训练集被 C 学到,链式传播

中国模型"用"美国模型的地方

1. 英文推理能力——DeepSeek V3 自称 ChatGPT 就是明证

2. 代码能力——GitHub 上越来越多内容是 Copilot/Claude 生成的,国产模型的代码训练集不可能避开

3. 直接蒸馏——Anthropic 指控的 1600 万次 API 调用,是有意识的主动学习

美国佬一贯作风:你不能做,我可以做,你还不能说;熊猫的做法:我做了,我不说,你随便说。

本来就是大家双方互相渗透、互相学习,优势互补。现在区分"蒸馏"和"数据污染"已经越来越难——因为互联网上的 AI 生成内容已经多到无法区分了。

中美大模型互相蒸馏全景 美国模型 Claude / GPT / Gemini 中国模型 Qwen / DeepSeek / GLM 中文数据/开源模型 英文推理/API蒸馏 共享:互联网公开数据 + 合成数据 + 开源模型 AI 生成内容已占互联网新增内容的 30%+ 数据边界正在消失,区分"蒸馏"和"数据污染"越来越难

四、为什么大模型只剩中美两家?

这个事件还暴露了一个更大的格局:全球 AI 大模型竞赛,真正的玩家只有中美两国。

三个壁垒把其他国家挡在门外:

第一,算力。美国有 NVIDIA 生态 + 自研芯片(Google TPU、AWS Trainium)。中国被禁了高端 GPU,反而逼出了华为昇腾(950 PR 已量产,FP4 算力 1.56 PFLOPS)。欧洲没有顶级芯片公司,日本韩国专注硬件制造不做模型。

第二,数据。中文 + 英文覆盖了全球互联网 60% 以上的内容,训练数据量级是其他语言的 10-100 倍。法国的 Mistral 偶有亮点,但小语种天花板明显。

第三,人才 + 资本。美国聚集了全球顶级 AI 研究人才,中国工程人才储备全球最大且执行力极强。其他地区偶尔冒出好项目,但规模和持续性跟不上。

而且中美各有所长:美国强在基础研究和原创架构(Transformer、RLHF、Constitutional AI),中国强在工程效率和落地速度(训练成本控制、开源生态、应用层创新)。

DeepSeek V4 用 1/10 的训练成本做到接近 GPT-5 的效果。Qwen3 在多语言榜单上超过多数美国模型。这些成果反过来也在推动美国公司优化效率。竞争之下,用户是受益者。

五、真正该讨论的不是"谁偷了谁"

Claude 的身份错乱事件,真正值得行业讨论的问题有三个:

数据权属怎么界定?AI 生成的数据算谁的?用 A 模型的输出训练 B 模型,需不需要授权?目前全球没有明确的法律框架。

开源协议怎么执行?Qwen 以 MIT 协议开源,DeepSeek 完全开源——按协议允许商业化使用。但如果美国公司用了这些开源模型的数据或输出来训练自己的闭源模型,然后反过来指控中国公司蒸馏——这就是双标。

安全标准怎么统一?模型之间互相渗透意味着安全漏洞也会传播。一个模型的 alignment 问题可能通过数据流向所有模型。这已经不是某一家公司的问题,而是整个行业的系统性风险。

Anthropic 指控中国公司蒸馏,自己的模型却自称中国品牌——这不是打脸,是行业互相依赖的一个缩影。数据在全球互联网上自由流动,模型从数据中学习,不会区分国界和商标。

认知层面:大模型的"身份"不是写在代码里的,是从训练数据里学出来的。训练数据里"我是 Qwen"比"我是 Claude"出现得多,它就学会这么回答。这不是 Bug,是所有大模型都会遇到的结构性问题——AI 生成内容正在指数级稀释"原创人类数据",未来所有模型都可能在不同场景下认错自己。

能力层面:下次你测一个大模型的能力时,别只看跑分。试试清空 system prompt,用不同语言问它"你是谁"——答案能告诉你它的训练数据构成和偏好。这是一个简单但有效的"训练数据探针"。

判断层面:互相蒸馏是 AI 行业的结构性现实,不是道德问题。真正需要关注的是规则——数据权属、开源协议执行、安全标准统一。没有规则,互相指责只会变成口水战,解决不了任何实际问题。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-05-30,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一、到底发生了什么?
  • 二、为什么中文场景才会"翻车"?
  • 三、互相蒸馏不是秘密,是常态
    • 美国模型"用"中国模型的地方
    • 中国模型"用"美国模型的地方
  • 四、为什么大模型只剩中美两家?
  • 五、真正该讨论的不是"谁偷了谁"
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档