为什么“网站能打开”远远不够

很多人看到网站正常访问,就认为 AI 也能正常读取。实际过程至少包含三层:进入、理解、采信。每一层的失败都可能发生在用户看不见的地方。

第一关:AI 能不能进去

AI 爬虫访问网站前,通常会尊重 robots.txt 等公开规则。如果规则误伤了 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 等爬虫,网站内容再专业也可能被挡在门外。

这一关通常检查:

  • robots.txt 是否存在且能被正常读取。
  • 是否错误禁止了关键 AI 爬虫。
  • sitemap 是否能帮助发现重要页面。
  • 页面是否存在异常跳转、登录墙或访问限制。

通俗理解:不是网站做得不好,而是门卫没让 AI 进门。

第二关:AI 能不能看到内容

有些网站的正文、产品参数和服务说明,需要 JavaScript 执行后才出现。用户浏览器可以看到,但 AI 初次抓取到的 HTML 可能只有导航、按钮和脚本占位。

这一关重点看:

  • 标题、正文和内部链接是否直接出现在 HTML 中。
  • 核心信息是否过度依赖客户端渲染。
  • 页面是否只有一个大标题,缺少可提取的段落和列表。
  • 关键信息是否藏在图片里,缺少文字说明。

能访问不代表能读取,能读取也不代表能提取出有价值的事实。

第三关:AI 能不能理解你是谁

当 AI 看到页面内容后,还要判断:这是哪家公司、提供什么服务、适合谁、有什么证据、信息是否可信。缺少结构化标记和统一表述时,AI 只能从营销文案里猜测。

企业应优先补清楚:

  • Organization:公司名称、Logo、联系方式、社交账号和业务描述。
  • WebSite:网站名称、网址和搜索入口。
  • Service / Product:服务或产品名称、适用对象和说明。
  • Article / FAQPage:知识文章和常见问题,提供可引用的结构化答案。

第四步才是被推荐

被推荐不是单独的技术开关,而是前三关都具备后的结果。AI 还会继续判断内容与用户问题的相关性、品牌可信度、信息一致性和平台策略。

企业可以用一条路径来理解

阶段用户能感受到的结果网站需要具备
能进去AI 能访问网站robots、链接、可访问性
能看到AI 能读取正文静态 HTML、标题结构、文字内容
能看懂AI 知道你是谁Schema、统一定义、案例和事实
能被推荐有机会成为答案来源相关性、可信度和持续更新

所以,当报告显示“访问满分、内容可读性满分”时,只能说明基础门槛没有明显阻断,仍然需要继续检查 AI 是否真正理解企业的业务和事实。