Methodology

检测依据与复核方法

重新检测
公开依据

一份可以被检查、被重复、被质疑的报告

ChatGeo 不要求用户直接相信一个分数。报告会说明检测依据、展示检测证据、保留规则版本,并告诉用户如何自行复核。它也不是对“AI 必然引用”的承诺,而是一份网站 AI 可见性诊断。

Standards

四项检测分别依据什么

公开规范与行业实践
01标准

AI 访问门禁

依据:robots.txt 排除协议

检测 AI 爬虫是否能访问网站。判断基于 robots.txt 的公开解析规则和主流 AI 爬虫 User-Agent 列表。

查看 RFC 9309
02新兴约定

AI 站点说明书

依据:llms.txt 社区约定

llms.txt 还不是像 HTML 或 robots.txt 一样普及的正式国际标准。ChatGeo 把它作为辅助说明项,不会因为缺失单独判定网站不可用。

查看 llms.txt 说明
03公开标准

AI 可读档案

依据:Schema.org 与搜索引擎结构化数据规范

检查 JSON-LD、Microdata 和 RDFa,并通过公开验证工具判断数据是否可被机器读取。

查看 Schema.org
04可复核

内容可读性

依据:HTML 内容与 JavaScript 渲染检测

检查正文、标题和链接是否直接出现在 HTML 中,同时记录 JS、样式和图片等辅助信息。

查看 Google 渲染说明

Verify yourself

用户如何自己验证

不需要先相信 ChatGeo
  1. 检查 robots.txt直接打开网站根目录的 /robots.txt,搜索 GPTBot、OAI-SearchBot、ClaudeBot 等名称。
  2. 检查 llms.txt打开 /llms.txt。如果返回 404,报告中的缺失结论可以直接复现。
  3. 检查结构化数据把页面 URL 输入 Google Rich Results Test 或 Schema Markup Validator,确认是否存在有效 JSON-LD。
  4. 检查正文是否可读查看网页源代码,确认核心卖点、标题和链接不是只存在于 JavaScript 中。
  5. 重复检测同一网址在相同规则版本下重新检测,检查核心分数和检测结论是否稳定。

Internal tests

我们如何检验自己的方法

持续校准
测试集 A全通过样本

使用明确允许 AI 爬虫、具备完整 llms.txt、Organization/Product JSON-LD 和静态正文的页面,预期得到高分。

测试集 B明显阻断样本

使用阻止 AI 爬虫、缺少结构化数据、正文依赖脚本的页面,预期得到低分并准确指出原因。

测试集 C混合情况

使用部分通过、部分失败的页面,检查评分是否随单项证据变化,而不是出现无法解释的总分。

真实案例外部网站复测

使用宜家等公开网站做重复检测,并与 Google、Schema.org 等公开工具的人工复核结果对照。

能力边界

ChatGeo 检测的是网站被 AI 访问、理解和提取的基础条件,不承诺任何平台一定引用或推荐。真实引用还受到问题相关性、品牌权威、信息一致性、内容时效和平台策略影响。用户可以把分数作为改造优先级,而不是营销结果的保证。

Next

先复核,再改造

用公开工具验证报告结论,再按照“对获客影响”和“改造难度”安排网站优化顺序。