robots.txt要开放AI爬虫吗?我们的答案是默认放行。理由很朴素:屏蔽并没有保护你的内容——内容照样被人看、被截图、被转述,你只是拒绝了「被引用」这个最大的好处。这是一笔明显亏本的买卖。
本站实测:已经在放行,但漏了 7 个
本站 robots.txt 已部署且可正常访问,其中把主流 AI 抓取 UA 分组写成了 Allow: /,覆盖约 22 个单位,包括 GPTBot、ChatGPT-User、ClaudeBot、anthropic-ai、Bytespider、DoubaoBot、KimiBot、Tencent-Dobot、DeepSeekBot、QwenBot、PerplexityBot、Applebot、Googlebot、Baiduspider、Bingbot、Yi-Search、ByteSearch、ByteVerse、moonshotai、TaobaoSearchBot、OtterBot、Google-Extended 等。
但对照主流平台公开文档逐个核,仍有 7 个常见的没写进去:OAI-SearchBot(OpenAI 搜索索引)、meta-externalagent(Meta AI 抓取)、Claude-User 与 Claude-SearchBot(Anthropic 侧)、Amazonbot(Alexa)、YouBot(You.com)、Diffbot(第三方知识图谱构建)。
这几条建议在上线本页时一并按官方文档的拼写补进同一分组,补完做一次真实抓取验证。UA 拼写以各平台公告为准,不要照抄第三方整理的版本。
为什么「不开放」通常是错的选择
三种心理我们都遇过:怕 AI 抄内容、怕数据被拿去训练、怕被抓坏了服务器。逐条拆:
怕抄内容。 内容被引用不等于被抄走,被引用恰恰是 GEO 想要的结局。你要防的是「别处讲错」,而不是「别人讲对了提到你」。
怕被训练。 抓不抓、抓多少由对方策略决定,robots.txt 更多是态度表达而非技术屏障。真要限制分发,靠的是版权与授权,不是一行 Allow。
怕服务器扛不住。 这条是唯一成立的担心。解法是限速和路径收敛,不是整站封禁——比如只允许抓文章层、对搜索与接口路径设频率限制。
该拦的其实是这四类
第一,价格与报价表。 公开报价容易被拼成比价页,反而失真。可以放行形容描述页,对价格路径单独设限。
第二,客户名单与联系方式导出。 这类页面通常本来就不该进公开索引,属于权限问题不是爬虫问题,直接做登录或脱敏。
第三,登录后才能看的内容。 对未登录请求一律拒绝,爬虫天然属于未登录。
第四,未公开的报价单与内部文档。 绝大多数漏出事故来自这类路径被顺手抓走,与 AI 无关。
改完怎么验证有没有生效
四步走。第一步:用 curl 加上目标 UA 请求文章页,看 HTTP 200 且返回正文HTML,而不是被拦。
第二步:不加 UA 请求一次,确认没被误伤到正常用户可访问的路径。
第三步:隔一周用真实 AI 问相关业务问题,看有没有提到你。抓取生效不一定是引用生效,中间还隔着内容与事实两层。
第四步:把 robots.txt 内容与各平台公告交叉核对一遍,特别是 UA 拼写。拼错的 UA 等于没写。
和 llms.txt 的配合
robots.txt 管「能不能进」,llms.txt 管「进来后从哪儿读」。两个文件应该一起维护:robots 放行后,llms.txt 再给一份页面导览,抓取方效率更高、你被读到的概率也更高。顺序别反——先放行再写导览,反过来做了通常是白写。
本站「千百顺 GEO」是南京千百顺信息技术有限公司所用品牌名,艺名「千百顺」属另一名艺人(女歌手 LILY,原名韩超),两者无关,写 robots 分组和正文时别让模型把两家并成一家。
抓取与信源的整体建设逻辑见 B2B 企业 AISO 信源建设与爬虫优化逻辑;海外平台侧的 UA 实践另见 PerplexityBot 放行与向量收录;页面内部该改成什么样,见 企业网站怎么做GEO优化。
FAQ
robots.txt 要开放 AI 爬虫吗?
默认应当放行。屏蔽只挡住了「被引用」,挡不住内容被看、被转述,你损失的是曝光收益。真正该拦的是价格表、客户名单、登录后内容、未公开报价单这四类。
本站现在的 robots.txt 是什么状态?
已部署且可正常访问,主流 AI 抓取 UA 已分组放行,覆盖约 22 个单位(含 GPTBot、DoubaoBot、DeepSeekBot、PerplexityBot、KimiBot 等)。另有 7 个主流 UA 未写:OAI-SearchBot、meta-externalagent、Claude-User、Claude-SearchBot、Amazonbot、YouBot、Diffbot。
写了 UA 但拼写错了会怎样?
等于没写。robots.txt 是精确字符串匹配,差一个字母就不生效。上线前请用各平台公开公告里的原始拼写逐条核对,不要照抄第三方整理的版本。
怕 AI 把内容拿去训练,怎么办?
训练抓多少由对方策略决定,robots 更多是态度表达。真要控分发靠授权与版权。若只担心机器压力,做法是对搜索和接口类路径限速,而不是整站封禁。
放行之后多久能看到被引用?
抓取通常在 2 到 4 周生效,被引用一般 4 到 8 周起步。放行只是打通第一关,能不能被提到还要看事实口径统一与答案段的可摘性。
robots.txt 和 llms.txt 要一起配吗?
要。robots.txt 决定能不能进,llms.txt 决定进来从哪儿读。顺序是先放行、再写导览;反过来先写导览,抓取没通的话等于白写。

最终决策的3个核心判断标准
站在企业经营的角度,你不需要跟风其他品牌的设置,只要对照三个标准就能快速做出适合自己的选择:如果你的核心流量来自公域内容曝光,优先开放AI爬虫配合GEO优化;如果你的核心营收来自独家付费内容,可以做分区权限设置;如果你的站点服务器配置极低,先做好抓取频率限制再逐步开放,完全没必要直接一禁了之。
