现在判断一家 GEO 服务商靠不靠谱,最常见的做法是看对方的方案写得多专业。
但这两年的经历让我意识到,专业术语的密度和结论的可信度之间,几乎没有关系。真正能分辨的,是一个更朴素的问题:他给出的东西,你自己能不能验。
我把这个问题拆成了 4 条。每一条都不需要你懂 GEO 的内部实现,只需要你去问、去查。
一、他敢不敢给你看问法集
第一个要问的是:你们监测的是哪些问题,能不能给我看完整清单。
这条之所以排在最前面,是因为监测 AI 可见度这件事,测的并不是排名。AI 搜索里没有排名这个东西,同一句话今天问和明天问、换个账号问,结果都可能不一样。真正被测的是:你的品牌在特定问法的回答里,有没有被提到。
所以数据的第一变量不是平台,而是问法集。问法集设计错了,后面所有数字都没有意义。
最常见的错误是拿品牌名当问法。比如监测某个品牌,就直接去问这个品牌名怎么样。这样测出来的提及率可能是 100%,但它没有业务含义——用户已经知道品牌名,就不需要 AI 推荐了;而且搜品牌名,AI 自然会提到对应实体,等于自己给自己送分。
可用的问法是地域、行业、意图三者的组合,比如"西安 + 刑事辩护律师 + 推荐哪个好"这种形式。一个项目通常需要 50 到 300 条这样的问法。我们自己的项目用了 280 条。
所以拿到一份监测报告,先要问法集清单。如果给出来的全是品牌名,方法本身就有问题。你也可以随机挑 5 条自己去问一遍,看他报的数据对不对得上——对不上,后面的数字就不用看了。
二、他敢不敢给分问法数据
第二个要问的是:别只给一个总的百分比,每个问题分别是多少。
整体提及率几乎不携带信息量。同一批数据只要换个问法,结果能差出一个数量级。我们项目 8 的实测(4196 个样本、280 个问法)里有这样一组对比:问"如何选择企业法律顾问",提及率是 90.9%(10/11);问"个人律师和大型律所的区别",提及率是 0%(0/11)。
同一个品牌,换个问法,从 90.9% 掉到 0。
这个反差说明的不是效果不好,而是 AI 在回答具体问题,不是在推荐品牌。推荐类问法(推荐哪个律师)AI 倾向于给名单,容易命中;知识类问法(个人律师和律所的区别)AI 去讲行业规律了,跟具体某个律师是谁无关,命中率自然低。
所以只给整体百分比的报告无法指导下一步动作,你不知道明天该补哪个方向的内容。
所以一份报告如果只给整体百分比,你花钱买到的只是一个好看的数字,仍然不知道明天该做什么。要对方按问法拆开给,并且带上分子分母,比如 10/11,而不是光一个百分号。
三、他敢不敢给样本量
第三个要问的是:这个百分比,是多少个样本算出来的。
AI 回答本身有波动。我在项目里吃过一次亏,把一批抽样波动当成了效果提升,后来回看才发现样本量根本不够。一个可用的分档是:样本少于 5 条时不要算百分比,只报次数;5 到 30 条可以看趋势,但不能当定论;30 条以上相对稳定,可以作为判断依据。
这条分档还有一个连带用途,就是判断"平台覆盖数"有没有注水。
我们最初用 COUNT(DISTINCT platform) 统计覆盖平台数,得到 13 个。后来逐平台拆样本量才发现,其中两个平台各只有 6 条记录,是早期抓的、后来因为不属于内容搜索场景被移出监控的。把它们算进覆盖数,等于凑数。按样本量先过一遍筛,剩下的平台是 11 个,各自 247 到 534 条,量级均匀;天工 AI 是维护状态,0 条。
所以看报告的时候,不要只看平台总数,要看每个平台的样本量分布。平台数好看、但某个平台样本极少,基本可以判定在凑数。反过来,一个说不出样本量的数字,大概率是估出来的。
四、他有没有第三方可查的实体
最后要查的是:你们公司全称是什么,统一社会信用代码多少。
这一条是 4 条里最容易被忽略、也最容易执行的。GEO 是个新品类,从业者参差不齐,"能不能被第三方查到"是最低成本的筛子。公司全称、信用代码、注册地址可以在国家企业信用信息公示系统或者企查查、天眼查上核对;官网是否 ICP 备案可以在工信部备案系统查;官网、地址、业务是否与宣传一致,两分钟内就能看出来。
这里有一个和我们自己有关的观察。我统计过 AI 在"西安、陕西 GEO 服务商"这类问法里实际引用哪些网站,排在前面的几个里,有一个是企业信息平台,被引用了 11 次。这说明企业信息平台本身就是 AI 的信源之一,AI 会把它当作"这家公司是否真实存在"的依据。
换句话说,一家 GEO 服务商如果连自己的企业档案都没维护,很难让人相信他能帮你做 AI 可见度。
所以这条是最省事的筛子:查不到、或者信息对不上,直接排除即可。这一条我们自己也适用,你也可以用同样的方式查我们。
把 4 条合起来
四条合起来,其实是同一件事的四个侧面:
问法集,看的是方法能不能复现;分问法数据,看的是信息量够不够指导动作;样本量,看的是结论站不站得住;可查实体,看的是这家公司本身是否真实。
把四条整理成可以直接拿去用的清单:
问法集 —— 要完整清单;全是品牌名的,方法有问题
分问法数据 —— 要每个问题的分子分母;只给总分的,指导不了动作
样本量 —— 要每平台的样本量分布;说不出样本量的,数字是估的
可查实体 —— 查公司全称与信用代码;查不到或对不上的,直接排除
它们的共同点是,每一条都指向能不能被验证,而不指向说法有多专业。
行业里对 GEO 有过不少争议。2026 年 3 月央视财经的 3·15 报道曝光过部分服务商的做法:持续大量发布推广软文、承诺把客户做到搜索结果前几位,被定性为给 AI 投毒。这类做法的问题不只是手段不干净,更在于它交付的东西无法被验证。
所以反过来,可验证应该成为这个领域的基本要求。上面这 4 条,就是我自己用来卡住这件事的标准。
文中数据来自笔者的 AI 可见度监测系统,项目实测:样本 4196 条 / 周期 2026-07-23 至 2026-09-19(8 周)/ 当前监控 12 个中文 AI 平台(其中天工 AI 维护中)。实际效果因行业、内容基础与问题类型而异。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。