首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >企业里做 AI 应用,最难的从来不是模型,是数据

企业里做 AI 应用,最难的从来不是模型,是数据

原创
作者头像
KylenReview
发布2026-09-16 21:36:05
发布2026-09-16 21:36:05
470
举报

过去两年,AI 应用成了企业数字化转型的"新风口"。老板们张口闭口"我们要上大模型""我们要做智能体",技术团队忙着选模型、搭平台、调 Prompt,一片热火朝天。

但我观察到一个被严重低估的事实:企业里做 AI 应用,最难的从来不是模型,是数据。

模型可以买,可以调 API,可以开源部署,可以微调——这些都有成熟路径。但数据不行。你的数据质量、数据口径、数据治理水平,决定了你的 AI 应用是"真智能"还是"高级玩具"。

这篇文章聊聊为什么。


一、模型是别人的,数据才是你的

先想一个问题:大模型的能力,是你的吗?

不是。GPT、Claude、文心、通义,这些模型的训练数据、算法、算力,跟你一毛钱关系都没有。你调 API,用的是别人的能力;你开源部署,用的是别人训好的权重;你微调,也只是在别人的模型上做点小改动。

模型是通用能力,谁都能用。真正属于你的、别人拿不走的,是你的数据。

你的客户数据、交易数据、业务知识、行业 Know-how,这些是 AI 应用能产生差异化价值的根基。同样是做一个"智能客服",A 公司用通用大模型 + 自己的客服对话历史,B 公司只用通用大模型。谁的效果好?一定是 A——因为 A 的模型"懂"自己的业务,B 的模型只会说套话。

所以,企业做 AI 应用的竞争壁垒,不在模型,在数据。 而数据恰恰是大多数企业最薄弱的环节。


二、数据质量差,AI 应用就是"垃圾进垃圾出"

大模型有一个特点:它不会告诉你"我不知道",它会一本正经地胡说八道。

你喂给它的数据是错的,它输出的结果就是错的,而且错得理直气壮。

举个真实场景。某企业做了一个"销售数据问答"的 AI 应用,业务方问"上个月华东区的销售额是多少",AI 答了一个数。业务方拿去汇报,结果被领导发现数字不对——因为底层数据里,"华东区"这个维度在两个系统里定义不一致,一个系统把江苏算进华东,另一个系统把江苏算进华中。AI 只是忠实地把"错的数据"算出了"错的答案"。

这就是数据质量问题在 AI 时代的放大效应。 以前数据错了,最多是报表错一行,业务方自己还能发现。现在数据错了,AI 把它包装成"权威答案",业务方反而更信了——因为 AI 说得太像那么回事了。

数据质量差的后果,在 AI 应用里被放大了十倍。因为 AI 不仅会用错数据,还会用"自信"掩盖错误。


三、数据口径不统一,AI 应用就是"精神分裂"

比数据质量更隐蔽的问题,是数据口径不统一。

"营收"这个指标,财务部门按确认口径算,销售部门按回款口径算。以前两个部门各看各的报表,虽然数字对不上,但好歹各说各话,井水不犯河水。

现在你做一个 AI 应用,让业务方问"这个月的营收是多少"。AI 去数据里找"营收",结果发现有两个"营收"——财务口径的和销售口径的。它要么随机选一个,要么两个都给你,然后业务方懵了:"到底哪个是对的?"

数据口径不统一,在 AI 应用里会变成"AI 精神分裂"——同一个问题,问两次,答案不一样。

这不是 AI 的错,是数据的错。但用户不会怪数据,只会怪 AI"不靠谱"。最后 AI 应用上线三个月,没人用了,因为"它连个数都说不准"。


四、数据没治理,AI 应用就是"空中楼阁"

很多企业做 AI 应用,跳过了数据治理,直接上模型。结果就是"空中楼阁"——看起来漂亮,一碰就塌。

数据治理解决的是三个问题:数据在哪、数据是什么、数据可信吗。

  • 数据在哪:你的数据散落在几十个系统里,AI 应用要取数,得知道去哪取。没有数据资产目录,AI 应用连"去哪找数据"都不知道。
  • 数据是什么:一张表叫 t_order_2023,另一张叫 order_detail,它们是什么关系?字段 amount 是含税还是不含税?没有元数据管理,AI 应用"看不懂"你的数据。
  • 数据可信吗:这张表的数据质量怎么样?有没有缺失、有没有重复、有没有异常?没有数据质量监控,AI 应用"不敢用"你的数据。

这三个问题不解决,AI 应用就是无源之水。 你模型再强,取不到数、看不懂数、不敢用数,有什么用?


五、一个反直觉的判断:AI 时代,数据治理更重要了

很多人以为,AI 时代数据治理会变得不重要——"反正 AI 能自己理解数据,还要治理干嘛?"

这个判断大错特错。AI 时代,数据治理不仅没有变不重要,反而更重要了。

原因很简单:AI 把数据问题的后果放大了。

以前数据质量差,影响的是"人"——人看报表发现数字不对,会怀疑、会核对、会修正。人的容错能力很强,数据错了,人能用经验兜底。

现在数据质量差,影响的是"AI"——AI 不会怀疑、不会核对、不会修正,它只会"自信地"输出错误答案。AI 的容错能力是零,数据错了,AI 就错给你看,而且错得理直气壮。

数据治理的本质,是让数据"可信、可查、可用"。这三个词,在 AI 时代比任何时候都重要。 因为 AI 对数据的"信任"是无条件的——你给它什么,它信什么。所以你必须保证给它的数据是对的。


六、给企业做 AI 应用的三条建议

第一,先治理数据,再上 AI。

顺序不能反。数据治理是地基,AI 应用是楼。地基没打好,楼盖得越高塌得越快。如果你的数据质量、数据口径、数据资产盘点都还没做好,先把这些补上,再谈 AI。

第二,把数据质量当成 AI 应用的"前置门槛"。

AI 应用上线前,先问三个问题:取数的数据源可靠吗?数据口径统一了吗?数据质量达标了吗?三个问题有一个答不上来,先别上线。

第三,用 AI 倒逼数据治理。

这是个有意思的视角。AI 应用对数据质量的要求,其实是一个"倒逼"数据治理的机会。以前业务方对数据质量的要求是模糊的——"数据最好准一点"。现在 AI 应用把要求变成了刚性的——"数据不准,AI 就胡说八道"。你可以用 AI 应用的需求,去推动业务方重视数据治理。


最后说一句

企业做 AI 应用,大家的目光都盯着模型——选哪个大模型、怎么调 Prompt、怎么微调。但真正决定成败的,是模型背后那个被忽视的东西:数据。

模型是别人的,数据才是你的。模型决定了 AI 应用的"上限",数据决定了 AI 应用的"下限"。模型再强,数据一塌糊涂,AI 应用就是个"高级玩具"。

别把精力都花在模型上。回头看看你的数据,那才是你真正的护城河——也是你最大的短板。


本文基于作者在企业数据治理和 AI 应用实践中的观察写成。文中观点为个人经验总结,不同企业的数据成熟度差异巨大,请结合自身情况判断。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、模型是别人的,数据才是你的
  • 二、数据质量差,AI 应用就是"垃圾进垃圾出"
  • 三、数据口径不统一,AI 应用就是"精神分裂"
  • 四、数据没治理,AI 应用就是"空中楼阁"
  • 五、一个反直觉的判断:AI 时代,数据治理更重要了
  • 六、给企业做 AI 应用的三条建议
  • 最后说一句
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档