做 GEO 的时候有个顺序问题经常被搞反:很多企业一上来就猛写内容,但 AI 压根抓不动他们的官网。
这就像在一栋没通电的楼里装了一屋子家电。想先摸清自家现状的,可以配合《7 步自测 AI 可见度》一起做——那篇解决“AI 现在怎么说我”,这篇解决“AI 读不读得动我”。这篇文章给的是一份可以照着做的官网自查清单,一共 9 步。每一步都给了三样东西:怎么查、什么算合格、不合格怎么改。
开始之前:你需要准备什么
- 一台电脑(手机查不了网页源代码,这份清单里有一半要看源码)
- 官网的后台或服务器权限,或者能找到给你做网站的人
- 半天时间——纯自查大约一到两小时,有问题要改的话看情况
不需要任何付费工具。全程只用浏览器和几个免费在线检测页面。
第 1 步:robots.txt 有没有把 AI 挡在门外
怎么查:浏览器打开 你的域名/robots.txt。
什么算合格:文件能打开,且里面没有 Disallow: / 这样把整站封死的规则。如果你专门写了针对 AI 抓取器的规则(比如 GPTBot、ClaudeBot),确认那是你有意为之,而不是建站公司随手加的。
不合格怎么改:把不该有的 Disallow 删掉。同时确认文件末尾声明了 sitemap 地址,一行就够:Sitemap: https://你的域名/sitemap.xml
常见坑:很多网站是从测试环境上线的,测试环境的 robots.txt 里有 Disallow: / 用来防止被搜到,上线时忘了改。这一条能让你后面所有努力归零,一定要第一个查。
第 2 步:sitemap 是不是真的能用
怎么查:打开 你的域名/sitemap.xml,看能不能正常显示一份 URL 列表。
什么算合格:返回的是真正的 XML 内容,不是 404,也不是一个跳转页面。里面的 URL 数量和你的实际页面数大致对得上。
不合格怎么改:让技术生成一份真实的 sitemap。这里有个很隐蔽的坑值得单独说——如果你的 sitemap 地址做了跳转,很多检测工具会判定为无效。跳转有真假之分:服务器层面返回 301 状态码是真跳转,而用 HTML 页面里的 meta refresh 做的是假跳转,抓取器往往不认。要确认是前者。
第 3 步:正文在不在 HTML 源码里
这一步最关键,也是最多网站栽跟头的地方。
怎么查:打开你的首页,右键选「查看网页源代码」,然后 Ctrl+F 搜索你首页正文里的任意一句话。
什么算合格:搜得到。
不合格怎么改:搜不到,说明你的内容是浏览器执行 JavaScript 之后才渲染出来的。搜索引擎有能力执行 JS,但很多 AI 抓取器没有——在它们眼里你的页面是一片空白。解决方向是服务端渲染(SSR)或静态预渲染(SSG)。这通常是个技术改造,但它的优先级高于你接下来要做的一切内容工作。
第 4 步:标题层级有没有断层
怎么查:在网页源代码里搜 <h1、<h2、<h3,数一下各有几个、顺序对不对。
什么算合格:每个页面有且只有一个 <h1>,下面用 <h2> 分节,<h2> 下面才是 <h3>。
不合格怎么改:两类典型问题——一是整页没有 h1 或者有好几个 h1;二是从 h1 直接跳到 h3,中间没有 h2。第二种特别隐蔽,因为页面看起来完全正常,但机器读到的是一份没有目录的文档,不知道哪些内容属于同一节。
怎么验证:改完再数一遍。这一步不需要任何工具,纯粹是耐心活。
第 5 步:有没有结构化数据
怎么查:源代码里搜 application/ld+json。
什么算合格:至少有 Organization(说明”我是谁”)和 WebSite(说明”这是什么网站”)两类。文章页应该有 Article,产品或服务页应该有对应的 Product 或 Service,有问答的页面应该有 FAQPage,多层级的页面应该有 BreadcrumbList。
不合格怎么改:让技术在页面里补上 JSON-LD 标注。三条原则:
- 只标注页面上真实存在的信息,不要标页面上没有的东西;
- 联系电话、地址这类字段填进去——AI 回答”怎么联系他们”时会直接读这里;
- 发布前用免费的结构化数据校验工具跑一遍语法。
第 6 步:canonical 指对了没有
怎么查:源代码搜 canonical,看那个地址和你当前打开的地址是不是同一个。
什么算合格:一致,且是你希望被收录的那个版本。
不合格怎么改:最常见的错误是站点跑在不带 www 的域名上,canonical 却写着带 www 的地址——等于告诉机器”我的正式版本在另一个会跳转的地址上”,白白损失权重。统一成一个版本,另一个做 301 跳到它。
第 7 步:有没有一个”事实层”
这一条不是技术问题,是内容组织问题,但对 AI 的影响非常直接。
怎么查:问自己一句——如果 AI 想知道”这家公司全称叫什么、在哪、做什么、怎么联系”,它能在一个页面里一次读全吗?
什么算合格:有一个关于我们或联系我们这样的页面,用表格或清单(不是一大段散文)集中列出:公司全称、品牌简称、所在城市、服务范围、成立时间、联系方式、资质信息。
不合格怎么改:把散落在各页的事实收拢到一处,用表格呈现。为什么强调表格——散文里的事实,机器要靠推断;表格里的事实,机器直接就能取。
第 8 步:有没有可信度信号
怎么查:看你的网站有没有这几样:隐私政策、服务条款、公司介绍页、联系方式页、文章的作者和发布日期。
什么算合格:五样齐全,且都能正常打开。我们自己官网的隐私政策和服务条款可以直接当参照。
不合格怎么改:这几个页面不需要多华丽,但缺席本身就是一个负面信号。尤其隐私政策和服务条款,很多中小企业官网干脆没有——在评估体系里这是明确的减分项,而补上它们的成本只是写两个页面。文章一定要显示作者和日期,无署名无日期的内容在可信度上天然吃亏。
第 9 步:顺手做掉 llms.txt
怎么查:打开 你的域名/llms.txt。
什么算合格:能打开,内容是一份纯文本的站点说明,列出你最希望 AI 读到的几个页面及其简介。
不合格怎么改:新建一个纯文本文件放到网站根目录,格式很简单:一句话说明你是谁,然后分组列出核心页面的链接和一句话简介。
说句实话:llms.txt 目前还不是强制标准,各家 AI 平台支持程度不一。但它的成本实在太低——一个文本文件而已——而且它逼着你想清楚”我最希望 AI 读哪几页”,这个思考过程本身就有价值。
一个容易踩的坑:如果你的网站是用构建工具生成的,这类根目录文件必须放在源码的静态资源目录里,而不是直接扔进构建产物目录。否则下次重新构建,文件就没了——而且这种丢失非常难被发现,因为没人会天天去访问 llms.txt。
一个完整的自查示例
某制造业企业官网,照这份清单走了一遍,结果如下:
| 步骤 | 检查结果 | 处理 |
|---|---|---|
| 1. robots.txt | 存在,未封禁 | 合格 |
| 2. sitemap | 打开是跳转页,非真实 XML | 修复:改成服务器 301 |
| 3. 正文在源码里 | 首页正文搜不到 | 修复:产品页改预渲染 |
| 4. 标题层级 | 5 个页面从 h1 跳到 h3 | 修复:补 h2 分节 |
| 5. 结构化数据 | 只有 Organization | 补充:Product、FAQPage、BreadcrumbList |
| 6. canonical | 指向 www 版本,站点跑在无 www | 修复:统一为无 www |
| 7. 事实层 | 公司信息散落在三个页面 | 补充:关于页加事实表格 |
| 8. 可信度信号 | 无隐私政策、无服务条款 | 补充:新增两个页面 |
| 9. llms.txt | 没有 | 新增 |
九项里有六项需要处理,其中第 3 项(正文不在源码里)是唯一一个不解决就会让其他八项白做的。
做完之后你会得到什么
- 一个能被抓取、能被读懂的官网,这是后续所有内容工作的地基
- 一份可以交给技术的明确改造清单,而不是”你看着优化一下”
- 一套可复查的标准——三个月后新上线的页面,照着这九步再过一遍就行
最后提醒一句
这九步做完,不代表 AI 就会推荐你。它只保证一件事:当 AI 想了解你的时候,它读得到、读得懂、且倾向于相信。
这九步属于一次性的地基工程,后面持续要做的事在GEO 方法论里有完整说明;不想自己动手的,也可以看AI 友好型官网建设服务。
至于会不会被提及、被推荐,取决于你有没有值得被引用的内容,以及全网关于你的事实够不够多、够不够一致。地基和房子,是两件事,但顺序不能反。