为什么“网站能打开”远远不够
很多人看到网站正常访问,就认为 AI 也能正常读取。实际过程至少包含三层:进入、理解、采信。每一层的失败都可能发生在用户看不见的地方。
第一关:AI 能不能进去
AI 爬虫访问网站前,通常会尊重 robots.txt 等公开规则。如果规则误伤了 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 等爬虫,网站内容再专业也可能被挡在门外。
这一关通常检查:
- robots.txt 是否存在且能被正常读取。
- 是否错误禁止了关键 AI 爬虫。
- sitemap 是否能帮助发现重要页面。
- 页面是否存在异常跳转、登录墙或访问限制。
通俗理解:不是网站做得不好,而是门卫没让 AI 进门。
第二关:AI 能不能看到内容
有些网站的正文、产品参数和服务说明,需要 JavaScript 执行后才出现。用户浏览器可以看到,但 AI 初次抓取到的 HTML 可能只有导航、按钮和脚本占位。
这一关重点看:
- 标题、正文和内部链接是否直接出现在 HTML 中。
- 核心信息是否过度依赖客户端渲染。
- 页面是否只有一个大标题,缺少可提取的段落和列表。
- 关键信息是否藏在图片里,缺少文字说明。
能访问不代表能读取,能读取也不代表能提取出有价值的事实。
第三关:AI 能不能理解你是谁
当 AI 看到页面内容后,还要判断:这是哪家公司、提供什么服务、适合谁、有什么证据、信息是否可信。缺少结构化标记和统一表述时,AI 只能从营销文案里猜测。
企业应优先补清楚:
- Organization:公司名称、Logo、联系方式、社交账号和业务描述。
- WebSite:网站名称、网址和搜索入口。
- Service / Product:服务或产品名称、适用对象和说明。
- Article / FAQPage:知识文章和常见问题,提供可引用的结构化答案。
第四步才是被推荐
被推荐不是单独的技术开关,而是前三关都具备后的结果。AI 还会继续判断内容与用户问题的相关性、品牌可信度、信息一致性和平台策略。
企业可以用一条路径来理解
| 阶段 | 用户能感受到的结果 | 网站需要具备 |
|---|---|---|
| 能进去 | AI 能访问网站 | robots、链接、可访问性 |
| 能看到 | AI 能读取正文 | 静态 HTML、标题结构、文字内容 |
| 能看懂 | AI 知道你是谁 | Schema、统一定义、案例和事实 |
| 能被推荐 | 有机会成为答案来源 | 相关性、可信度和持续更新 |
所以,当报告显示“访问满分、内容可读性满分”时,只能说明基础门槛没有明显阻断,仍然需要继续检查 AI 是否真正理解企业的业务和事实。