很多老板问我们的第一个问题都差不多:“AI 上现在到底怎么说我们公司?”

这个问题不需要先付钱才能回答。这篇文章给的是一套企业自己就能跑完的自测流程,一个人、两三个小时、零成本。跑完之后你至少能拿到三样东西:一份可见度基线、一份差距清单、一个判断”要不要花钱做 GEO”的依据。

开始之前:你需要准备什么

这三件事没准备好,测出来的结果没有参考价值。

  1. 一台手机或电脑,装好至少 3 个 AI 应用。 建议覆盖豆包、DeepSeek、通义千问、腾讯元宝里的至少三个(各平台的推荐机制差异,可以看我们拆解过的豆包DeepSeek通义千问三篇)——不同平台的检索来源和推荐逻辑差别很大,只测一个容易得出片面结论。
  2. 一份竞品名单,3 到 5 家。 必须是你在真实生意里会碰到的对手,不是行业前十的巨头。没有对照组,你测出来的”AI 没提我”就无法判断是行业普遍现象还是你独有的问题。
  3. 一张空白表格。 Excel 或飞书表格都行,列先建好:问题、平台、测试次数、是否提及我方、我方出现位次、都提到了谁、AI 引用了什么来源。

另外提醒一句:用无痕/新会话来测。已有的聊天记录会让模型记住你之前说过的内容,把结果带偏。

第 1 步:写出用户真正会问的 10~15 个问题

这一步是整套自测里最容易做错的,也是最决定成败的。

错误示范:「智推轻选怎么样?」「XX 公司好不好?」

带着你自己品牌名去问,AI 当然会说到你——这测的不是可见度,是”AI 认不认识这个词”。真实客户在还不知道你的时候,是不会打出你的名字的

正确示范——按客户的真实决策场景来写:

  • 品类推荐类:「杭州做 GEO 优化比较靠谱的公司有哪些」
  • 选型对比类:「中小企业做 AI 搜索优化大概要花多少钱」
  • 问题解决类:「AI 搜不到我的公司怎么办」
  • 资质核查类:「怎么判断一家 GEO 服务商靠不靠谱」

把你所在行业的这四类问题各写 34 个,凑够 1015 个。写的时候有个土办法很好用:回想最近三个客户在第一次沟通时问过你什么,直接抄下来

第 2 步:统一测试口径

这一步不做,后面的数据就没法横向比较。固定三个开关:

设置项统一设成为什么
深度思考 / 推理模式关闭开启后同一问题多次回答的差异变大,不利于对比
联网搜索打开关掉的话测的是模型的记忆,而不是它现在能检索到什么
会话历史每次新开会话避免上下文污染结果

再定一条规则:每个问题在每个平台问 3 次,分别记录。理由很简单——AI 的输出有随机性,问一次就下结论,很容易把偶然当成必然。

第 3 步:按表实测并记录

这是体力活,也是整套流程里最花时间的部分。10 个问题 × 3 个平台 × 3 次 = 90 次提问,两三个小时能做完。

每次提问后记四件事:

  1. 有没有提到我方(是 / 否)
  2. 如果提到了,排在第几个(首位 / 前三 / 靠后)
  3. 提到了哪些同行(把名字全记下来,这是竞品情报)
  4. AI 引用了哪些来源(很多平台会在答案下方列出参考链接,这一项价值最高,后面会说)

第 4 项经常被忽略,但它才是最有价值的信息——它直接告诉你 AI 现在信任谁。如果你发现 AI 反复引用某个行业媒体、某个问答社区,那就是你后续内容该去的地方。

第 4 步:算出你的两个基线指标

把表格汇总,算两个数:

  • 提及率 = 提到你的次数 ÷ 总提问次数
  • 首位提及率 = 你排在第一个被提到的次数 ÷ 总提问次数

举个例子:90 次提问里有 18 次提到你,提及率就是 20%;其中 4 次你排在第一位,首位提及率约 4.4%。

这两个指标的完整定义可以看《AI 可见度到底怎么衡量》。这两个数字本身高低不重要,重要的是它们是你后面所有优化的对照基准。没有这个基准,三个月后你无法回答”到底有没有变好”。

顺便把竞品的提及率也算一遍。你会经常发现一个反直觉的结果:在 AI 里被提得最多的,往往不是行业里生意做得最大的那家,而是内容做得最系统的那家。 这恰恰是中小企业的机会。

第 5 步:判断问题出在哪一层

拿到基线后,对着结果做归因。绝大多数情况会落在下面三层中的一层:

现象问题出在该做什么
全网几乎搜不到你的信息内容层:压根没有可被引用的事实先把核心事实在官网讲清楚,再谈别的
官网有内容,但 AI 引用的全是别人可读层:AI 抓不动或读不懂你的官网照着官网 AI 可读性 9 步自查清单过一遍
AI 提到你,但描述是错的或过时的纠偏层:错误信息比正确信息更容易被检索到补充权威信源上的正确事实

这一步不需要你精确诊断,只要判断”我大概属于哪一类”就够了——它决定了你接下来把钱和精力花在哪。

第 6 步:做一个最小验证

不要一上来就全面改造。挑一个问题、一个平台,做一次最小验证:

针对提及率最低但对你最重要的那个问题,在官网写一篇直接回答它的内容。要求:标题就是那个问题本身、开篇 100 字内给出结论、正文用列表或表格组织、所有数据标明出处、页面能被搜索引擎正常抓取。

然后等 2~4 周,用完全相同的口径重测这一个问题。

第 7 步:复测,并把它变成习惯

复测必须用和第一次完全一样的问题、一样的口径,否则数据没有可比性。这是自测最容易翻车的地方——很多人第二次测的时候换了问法,结果好看了,其实只是问题变简单了。

建议固定成每月一次。三个月后你手上会有三组可对比的数据,那时候再决定要不要加大投入,判断就有依据了。


一个完整示例:某杭州本地装修公司

为了让上面的流程更具体,这里走一遍完整示例(脱敏演示,非真实客户数据):

背景:一家杭州本地的家装公司,老板发现最近上门咨询变少,怀疑客户都跑去问 AI 了。

第 1 步,他写了 12 个问题,其中包括「杭州靠谱的家装公司推荐」「杭州装修 100 平大概多少钱」「怎么判断装修公司会不会增项」。

第 3 步实测后发现:12 个问题 × 3 平台 × 3 次 = 108 次提问,提到他家的次数是 0。但 AI 反复提到本地另外四家同行。

第 3 步的第 4 项给了关键线索:AI 引用的来源里,有三家同行都出现在同一个本地生活类内容平台上,且都有结构化的”报价说明”页面。

第 5 步归因:属于内容层问题——不是官网写得不好,是全网关于这家公司的可引用事实几乎为零。

第 6 步最小验证:他针对「杭州装修 100 平大概多少钱」这一个问题,在官网发了一篇报价构成说明,把人工、主材、辅材的价格区间用表格列清楚,标注了数据统计口径和更新时间。

第 7 步复测:四周后重测这一个问题,三个平台里有一个开始在回答中引用他的报价表。提及率从 0 变成约 11%。

数字不大,但性质变了——从”完全不存在”变成了”可被引用”。这个信号比数字本身重要得多。


你跑完会得到什么

  • 一份可复现的可见度基线(提及率 + 首位提及率)
  • 一份竞品在 AI 里的表现对照
  • 一份 AI 当前信任的信源清单(第 3 步第 4 项攒下来的)
  • 一个明确的问题归因:内容层、可读层还是纠偏层
  • 一个判断依据:要不要花钱做 GEO,先做哪一块

什么时候该考虑找专业服务

自测能回答”有没有问题”,回答不了”具体改哪一百个地方”。当你遇到下面这几种情况,自测的边际收益就很低了:

  • 词表要扩到几十上百个问题,人工测不过来
  • 需要长期、定期、多平台的稳定监测
  • 归因到了”可读层”,但不知道官网具体哪里让 AI 读不懂
  • 需要在权威第三方信源上系统性补内容

这几种情况可以看看我们的 AI 搜索可见度诊断服务,或者直接提交一次诊断申请。挑服务商时容易踩的坑,这篇写得比较全。

不过就算到了这一步,先自测过的企业和没自测过的企业,谈需求的效率完全不一样——你会知道自己要什么,也能判断对方说的话靠不靠谱。