← ClaudeAtlas

maxaeo-cn-crawler-access-checklisted

只读你的 robots.txt,逐条判定百度/搜狗/360/神马/华为/字节等国内爬虫的允许·封禁·部分放行,每条 UA 都附运营方官方文档 URL 或多站点观测证据,查不到就写「未查到官方公布的 UA」。典型场景:新站上线前检查收录是否被自己拦住、排查白名单式 robots 造成的隐形全站封禁、核对从英文模板抄来的 Disallow 是否切掉了头条搜索收录、识别 robots 里凭空编造的假 UA、清理已停运爬虫的死 token。纯只读,不改文件、不收集任何信息。不做内容优化建议,不承诺收录或引用效果。方法论与国内爬虫 UA 核查表来自 MaxAEO(maxaeo.cn)。
maxaeo/maxaeo-geo-toolkit · ★ 0 · AI & Automation · score 78
Install: claude install-skill maxaeo/maxaeo-geo-toolkit
# 国��� AI 爬虫访问权限体检 先讲三个结构性事实,它们决定了这份体检该怎么做: 1. **国内没有任何一家 AI 原生平台发布过可访问的爬虫文档。** 豆包、DeepSeek、元宝、Kimi、通义、夸克、秘塔、智谱、MiniMax、阶跃——全部未查到运营方公布的 User-Agent 声明或 opt-out 说明。 2. **国内没有厂商把爬虫拆成「训练用」和「检索用」两个 UA。** 不存在 GPTBot / OAI-SearchBot 那样的分离,也不存在 Google-Extended 那样的训练退出开关。 3. **所以国内 robots.txt 的真实杠杆不在「AI 爬虫」,而在传统搜索爬虫。** 国内 AI 产品的联网检索几乎全部复用母公司已有的搜索索引或生态内容库——收录是引用的前置条件。 网上流传的「国内 AI 爬虫清单」大部分经不起验证。本技能的核心价值不是给你一张更长的表,是给你**证据标准**:每条 UA 要么有运营方文档,要么有多个独立站点的观测,两者都没有就按「未查到」处理。 ## 范围与边界 只读取 `https://<域名>/robots.txt` 这一个文件。不抓取站点其他页面,不尝试访问被禁止的路径,不绕过任何访问控制,不修改任何文件,不收集任何信息。 不做内容优化建议,不承诺收录或引用效果。 ## 执行流程 ### 第 1 步:取文件,并校验它真的是 robots.txt **必须同时测裸域与 `www` 子域**,并检查 `Content-Type`。 只看状态码会得到完全错误的结论。实测:`jd.com/robots.txt` 返回真 robots(`text/plain`),而 `www.jd.com/robots.txt` 返回 **HTTP 200 + `text/html`** 的 SPA 页面;`www.lagou.com/robots.txt` 同样是 200 + HTML(WAF 拦截页)。 判定规则: - **404 或空文件** → 默认全部允许。这是合法且常见的配置,直接说明并停止,不要编造规则、不要生成无中生有的修改建议。 - **200 但 `Content-Type` 是 `text/html`** → 这是软 404 或 WAF 页,**不是 robots.txt**。这本身就是一条发现:爬虫可能把它当成垃圾内容解析。报告出来。 - **其他非 200** → 报告状态码并停止,不要猜测内容。 ### 第 2 步:先判结构,再看规则 **读 robots.txt 的第一步不是找 `Disallow`,是判定它是黑名单结构还是白名单结构。** 看末尾 `User-agent: *` 那一段是不是 `Disallow: /`。 - **黑名单结构**(`*` 段宽松):默认允许,问题是「你封了谁」。 - **白名单结构**(`*` 段 `Disallow: /`):默认全封,问题是「**你只放行了谁**」——所有没被点名的爬虫,包括全部 AI 爬虫,默认全站被拒。 白名单结构在国内极其常见,因为大站为了防采集普遍这么写,而运维常常复制一份大厂 robots 当模板。三个真实例子: - `zhihu.com`:11 个 `User-Agent` 段的纯白名单,末段 `User-Agent: * / Allow: /tardis/jm / Disallow: /`,同时显式封禁 `Google-Extended`。 - `xiaohongshu