做 GEO 的时候有个顺序问题经常被搞反:很多企业一上来就猛写内容,但 AI 压根抓不动他们的官网

这就像在一栋没通电的楼里装了一屋子家电。想先摸清自家现状的,可以配合《7 步自测 AI 可见度》一起做——那篇解决“AI 现在怎么说我”,这篇解决“AI 读不读得动我”。这篇文章给的是一份可以照着做的官网自查清单,一共 9 步。每一步都给了三样东西:怎么查、什么算合格、不合格怎么改

开始之前:你需要准备什么

  1. 一台电脑(手机查不了网页源代码,这份清单里有一半要看源码)
  2. 官网的后台或服务器权限,或者能找到给你做网站的人
  3. 半天时间——纯自查大约一到两小时,有问题要改的话看情况

不需要任何付费工具。全程只用浏览器和几个免费在线检测页面。


第 1 步:robots.txt 有没有把 AI 挡在门外

怎么查:浏览器打开 你的域名/robots.txt

什么算合格:文件能打开,且里面没有 Disallow: / 这样把整站封死的规则。如果你专门写了针对 AI 抓取器的规则(比如 GPTBot、ClaudeBot),确认那是你有意为之,而不是建站公司随手加的。

不合格怎么改:把不该有的 Disallow 删掉。同时确认文件末尾声明了 sitemap 地址,一行就够:Sitemap: https://你的域名/sitemap.xml

常见坑:很多网站是从测试环境上线的,测试环境的 robots.txt 里有 Disallow: / 用来防止被搜到,上线时忘了改。这一条能让你后面所有努力归零,一定要第一个查

第 2 步:sitemap 是不是真的能用

怎么查:打开 你的域名/sitemap.xml,看能不能正常显示一份 URL 列表。

什么算合格:返回的是真正的 XML 内容,不是 404,也不是一个跳转页面。里面的 URL 数量和你的实际页面数大致对得上。

不合格怎么改:让技术生成一份真实的 sitemap。这里有个很隐蔽的坑值得单独说——如果你的 sitemap 地址做了跳转,很多检测工具会判定为无效。跳转有真假之分:服务器层面返回 301 状态码是真跳转,而用 HTML 页面里的 meta refresh 做的是假跳转,抓取器往往不认。要确认是前者。

第 3 步:正文在不在 HTML 源码里

这一步最关键,也是最多网站栽跟头的地方。

怎么查:打开你的首页,右键选「查看网页源代码」,然后 Ctrl+F 搜索你首页正文里的任意一句话。

什么算合格:搜得到。

不合格怎么改:搜不到,说明你的内容是浏览器执行 JavaScript 之后才渲染出来的。搜索引擎有能力执行 JS,但很多 AI 抓取器没有——在它们眼里你的页面是一片空白。解决方向是服务端渲染(SSR)或静态预渲染(SSG)。这通常是个技术改造,但它的优先级高于你接下来要做的一切内容工作。

第 4 步:标题层级有没有断层

怎么查:在网页源代码里搜 <h1<h2<h3,数一下各有几个、顺序对不对。

什么算合格:每个页面有且只有一个 <h1>,下面用 <h2> 分节,<h2> 下面才是 <h3>

不合格怎么改:两类典型问题——一是整页没有 h1 或者有好几个 h1;二是从 h1 直接跳到 h3,中间没有 h2。第二种特别隐蔽,因为页面看起来完全正常,但机器读到的是一份没有目录的文档,不知道哪些内容属于同一节。

怎么验证:改完再数一遍。这一步不需要任何工具,纯粹是耐心活。

第 5 步:有没有结构化数据

怎么查:源代码里搜 application/ld+json

什么算合格:至少有 Organization(说明”我是谁”)和 WebSite(说明”这是什么网站”)两类。文章页应该有 Article,产品或服务页应该有对应的 ProductService,有问答的页面应该有 FAQPage,多层级的页面应该有 BreadcrumbList

不合格怎么改:让技术在页面里补上 JSON-LD 标注。三条原则:

  1. 只标注页面上真实存在的信息,不要标页面上没有的东西;
  2. 联系电话、地址这类字段填进去——AI 回答”怎么联系他们”时会直接读这里;
  3. 发布前用免费的结构化数据校验工具跑一遍语法。

第 6 步:canonical 指对了没有

怎么查:源代码搜 canonical,看那个地址和你当前打开的地址是不是同一个。

什么算合格:一致,且是你希望被收录的那个版本。

不合格怎么改:最常见的错误是站点跑在不带 www 的域名上,canonical 却写着带 www 的地址——等于告诉机器”我的正式版本在另一个会跳转的地址上”,白白损失权重。统一成一个版本,另一个做 301 跳到它。

第 7 步:有没有一个”事实层”

这一条不是技术问题,是内容组织问题,但对 AI 的影响非常直接。

怎么查:问自己一句——如果 AI 想知道”这家公司全称叫什么、在哪、做什么、怎么联系”,它能在一个页面里一次读全吗

什么算合格:有一个关于我们联系我们这样的页面,用表格或清单(不是一大段散文)集中列出:公司全称、品牌简称、所在城市、服务范围、成立时间、联系方式、资质信息。

不合格怎么改:把散落在各页的事实收拢到一处,用表格呈现。为什么强调表格——散文里的事实,机器要靠推断;表格里的事实,机器直接就能取

第 8 步:有没有可信度信号

怎么查:看你的网站有没有这几样:隐私政策、服务条款、公司介绍页、联系方式页、文章的作者和发布日期。

什么算合格:五样齐全,且都能正常打开。我们自己官网的隐私政策服务条款可以直接当参照。

不合格怎么改:这几个页面不需要多华丽,但缺席本身就是一个负面信号。尤其隐私政策和服务条款,很多中小企业官网干脆没有——在评估体系里这是明确的减分项,而补上它们的成本只是写两个页面。文章一定要显示作者和日期,无署名无日期的内容在可信度上天然吃亏。

第 9 步:顺手做掉 llms.txt

怎么查:打开 你的域名/llms.txt

什么算合格:能打开,内容是一份纯文本的站点说明,列出你最希望 AI 读到的几个页面及其简介。

不合格怎么改:新建一个纯文本文件放到网站根目录,格式很简单:一句话说明你是谁,然后分组列出核心页面的链接和一句话简介。

说句实话:llms.txt 目前还不是强制标准,各家 AI 平台支持程度不一。但它的成本实在太低——一个文本文件而已——而且它逼着你想清楚”我最希望 AI 读哪几页”,这个思考过程本身就有价值。

一个容易踩的坑:如果你的网站是用构建工具生成的,这类根目录文件必须放在源码的静态资源目录里,而不是直接扔进构建产物目录。否则下次重新构建,文件就没了——而且这种丢失非常难被发现,因为没人会天天去访问 llms.txt。


一个完整的自查示例

某制造业企业官网,照这份清单走了一遍,结果如下:

步骤检查结果处理
1. robots.txt存在,未封禁合格
2. sitemap打开是跳转页,非真实 XML修复:改成服务器 301
3. 正文在源码里首页正文搜不到修复:产品页改预渲染
4. 标题层级5 个页面从 h1 跳到 h3修复:补 h2 分节
5. 结构化数据只有 Organization补充:Product、FAQPage、BreadcrumbList
6. canonical指向 www 版本,站点跑在无 www修复:统一为无 www
7. 事实层公司信息散落在三个页面补充:关于页加事实表格
8. 可信度信号无隐私政策、无服务条款补充:新增两个页面
9. llms.txt没有新增

九项里有六项需要处理,其中第 3 项(正文不在源码里)是唯一一个不解决就会让其他八项白做的

做完之后你会得到什么

  • 一个能被抓取、能被读懂的官网,这是后续所有内容工作的地基
  • 一份可以交给技术的明确改造清单,而不是”你看着优化一下”
  • 一套可复查的标准——三个月后新上线的页面,照着这九步再过一遍就行

最后提醒一句

这九步做完,不代表 AI 就会推荐你。它只保证一件事:当 AI 想了解你的时候,它读得到、读得懂、且倾向于相信

这九步属于一次性的地基工程,后面持续要做的事在GEO 方法论里有完整说明;不想自己动手的,也可以看AI 友好型官网建设服务

至于会不会被提及、被推荐,取决于你有没有值得被引用的内容,以及全网关于你的事实够不够多、够不够一致。地基和房子,是两件事,但顺序不能反。