过去两年,AI 应用成了企业数字化转型的"新风口"。老板们张口闭口"我们要上大模型""我们要做智能体",技术团队忙着选模型、搭平台、调 Prompt,一片热火朝天。
但我观察到一个被严重低估的事实:企业里做 AI 应用,最难的从来不是模型,是数据。
模型可以买,可以调 API,可以开源部署,可以微调——这些都有成熟路径。但数据不行。你的数据质量、数据口径、数据治理水平,决定了你的 AI 应用是"真智能"还是"高级玩具"。
这篇文章聊聊为什么。
先想一个问题:大模型的能力,是你的吗?
不是。GPT、Claude、文心、通义,这些模型的训练数据、算法、算力,跟你一毛钱关系都没有。你调 API,用的是别人的能力;你开源部署,用的是别人训好的权重;你微调,也只是在别人的模型上做点小改动。
模型是通用能力,谁都能用。真正属于你的、别人拿不走的,是你的数据。
你的客户数据、交易数据、业务知识、行业 Know-how,这些是 AI 应用能产生差异化价值的根基。同样是做一个"智能客服",A 公司用通用大模型 + 自己的客服对话历史,B 公司只用通用大模型。谁的效果好?一定是 A——因为 A 的模型"懂"自己的业务,B 的模型只会说套话。
所以,企业做 AI 应用的竞争壁垒,不在模型,在数据。 而数据恰恰是大多数企业最薄弱的环节。
大模型有一个特点:它不会告诉你"我不知道",它会一本正经地胡说八道。
你喂给它的数据是错的,它输出的结果就是错的,而且错得理直气壮。
举个真实场景。某企业做了一个"销售数据问答"的 AI 应用,业务方问"上个月华东区的销售额是多少",AI 答了一个数。业务方拿去汇报,结果被领导发现数字不对——因为底层数据里,"华东区"这个维度在两个系统里定义不一致,一个系统把江苏算进华东,另一个系统把江苏算进华中。AI 只是忠实地把"错的数据"算出了"错的答案"。
这就是数据质量问题在 AI 时代的放大效应。 以前数据错了,最多是报表错一行,业务方自己还能发现。现在数据错了,AI 把它包装成"权威答案",业务方反而更信了——因为 AI 说得太像那么回事了。
数据质量差的后果,在 AI 应用里被放大了十倍。因为 AI 不仅会用错数据,还会用"自信"掩盖错误。
比数据质量更隐蔽的问题,是数据口径不统一。
"营收"这个指标,财务部门按确认口径算,销售部门按回款口径算。以前两个部门各看各的报表,虽然数字对不上,但好歹各说各话,井水不犯河水。
现在你做一个 AI 应用,让业务方问"这个月的营收是多少"。AI 去数据里找"营收",结果发现有两个"营收"——财务口径的和销售口径的。它要么随机选一个,要么两个都给你,然后业务方懵了:"到底哪个是对的?"
数据口径不统一,在 AI 应用里会变成"AI 精神分裂"——同一个问题,问两次,答案不一样。
这不是 AI 的错,是数据的错。但用户不会怪数据,只会怪 AI"不靠谱"。最后 AI 应用上线三个月,没人用了,因为"它连个数都说不准"。
很多企业做 AI 应用,跳过了数据治理,直接上模型。结果就是"空中楼阁"——看起来漂亮,一碰就塌。
数据治理解决的是三个问题:数据在哪、数据是什么、数据可信吗。
t_order_2023,另一张叫 order_detail,它们是什么关系?字段 amount 是含税还是不含税?没有元数据管理,AI 应用"看不懂"你的数据。这三个问题不解决,AI 应用就是无源之水。 你模型再强,取不到数、看不懂数、不敢用数,有什么用?
很多人以为,AI 时代数据治理会变得不重要——"反正 AI 能自己理解数据,还要治理干嘛?"
这个判断大错特错。AI 时代,数据治理不仅没有变不重要,反而更重要了。
原因很简单:AI 把数据问题的后果放大了。
以前数据质量差,影响的是"人"——人看报表发现数字不对,会怀疑、会核对、会修正。人的容错能力很强,数据错了,人能用经验兜底。
现在数据质量差,影响的是"AI"——AI 不会怀疑、不会核对、不会修正,它只会"自信地"输出错误答案。AI 的容错能力是零,数据错了,AI 就错给你看,而且错得理直气壮。
数据治理的本质,是让数据"可信、可查、可用"。这三个词,在 AI 时代比任何时候都重要。 因为 AI 对数据的"信任"是无条件的——你给它什么,它信什么。所以你必须保证给它的数据是对的。
第一,先治理数据,再上 AI。
顺序不能反。数据治理是地基,AI 应用是楼。地基没打好,楼盖得越高塌得越快。如果你的数据质量、数据口径、数据资产盘点都还没做好,先把这些补上,再谈 AI。
第二,把数据质量当成 AI 应用的"前置门槛"。
AI 应用上线前,先问三个问题:取数的数据源可靠吗?数据口径统一了吗?数据质量达标了吗?三个问题有一个答不上来,先别上线。
第三,用 AI 倒逼数据治理。
这是个有意思的视角。AI 应用对数据质量的要求,其实是一个"倒逼"数据治理的机会。以前业务方对数据质量的要求是模糊的——"数据最好准一点"。现在 AI 应用把要求变成了刚性的——"数据不准,AI 就胡说八道"。你可以用 AI 应用的需求,去推动业务方重视数据治理。
企业做 AI 应用,大家的目光都盯着模型——选哪个大模型、怎么调 Prompt、怎么微调。但真正决定成败的,是模型背后那个被忽视的东西:数据。
模型是别人的,数据才是你的。模型决定了 AI 应用的"上限",数据决定了 AI 应用的"下限"。模型再强,数据一塌糊涂,AI 应用就是个"高级玩具"。
别把精力都花在模型上。回头看看你的数据,那才是你真正的护城河——也是你最大的短板。
本文基于作者在企业数据治理和 AI 应用实践中的观察写成。文中观点为个人经验总结,不同企业的数据成熟度差异巨大,请结合自身情况判断。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。