
引言
我见过最冤的一种GEO失败案例:内容团队勤勤恳恳写了三个月文章,结构优化了、FAQ加了、多平台发了,结果半年过去没有任何一个AI平台引用过他们。排查到最后发现,技术同事之前为了防止爬虫消耗服务器资源,在robots.txt里加了一行`Disallow: /`,把所有爬虫(包括AI爬虫)全挡在门外了。
门是关着的,你在里面把装修搞得再豪华,客人也进不来。
robots.txt是网站根目录下的一个纯文本文件,用来告诉各类爬虫”哪些页面你可以抓,哪些不要碰”。这是GEO技术地基里的第一件事——如果AI爬虫被你的robots.txt挡在外面,你后面做的所有内容优化都等于零。
核心结论:robots.txt是GEO的第一道门,必须先确认主流AI爬虫被放行,内容才有被AI看见的资格。 这不是什么高深技术,但很多网站都栽在这一步。
这篇文章讲清楚robots.txt的基本语法、主流AI爬虫的名称和放行写法、三个最常见的错误配置,以及配置完怎么验证。
一、robots.txt基本语法速览
robots.txt的语法非常简单,核心就四个字段:
User-agent(爬虫名称):指定规则针对哪个爬虫。`User-agent: *`表示对所有爬虫生效。
Disallow(禁止抓取路径):指定不允许抓取的路径。`Disallow: /admin/`表示禁止抓取admin目录下的内容;`Disallow: /`表示禁止抓取整个网站。
Allow(允许抓取路径):指定允许抓取的路径,通常用来在Disallow大目录后开放特定子路径。
Sitemap(网站地图地址):告诉爬虫你的sitemap.xml在哪里,方便快速发现所有页面。
一个最简单的robots.txt示例:
“`
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/
Sitemap: https://www.yourdomain.com/sitemap.xml
“`
这个配置的意思是:所有爬虫都可以抓取网站内容,但admin和private目录禁止访问,sitemap在指定位置。
注意:robots.txt只是”君子协定”,正规爬虫(包括主流搜索引擎和AI平台的爬虫)会遵守,但恶意爬虫可能无视。所以敏感内容不要只靠robots.txt保护,要加访问权限控制。
二、主流AI爬虫及放行写法
AI爬虫不是一个统一的”AI机器人”,不同AI平台有不同的爬虫名称(User-Agent)。以下是目前主流的AI爬虫名称:
| AI平台 | 爬虫名称(User-Agent) | 用途 |
|---|---|---|
| OpenAI(ChatGPT) | GPTBot | 模型训练 |
| OpenAI Search | OAI-SearchBot | 实时搜索引用 |
| Anthropic(Claude) | ClaudeBot | 模型训练+检索 |
| Perplexity | PerplexityBot | 实时搜索引用 |
| 字节跳动(豆包) | Bytespider | 抓取+训练 |
| Google-Extended | Gemini训练/检索 | |
| Apple(Apple Intelligence) | Applebot-Extended | Siri/AI引用 |
| 百度 | Baiduspider | 百度搜索+AI |
如果你希望所有AI爬虫都能正常访问你的公开内容,在robots.txt里加上以下配置:
“`
# 放行所有主流AI爬虫
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: Baiduspider
Allow: /
# 禁止爬虫访问后台和私有目录
User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /private/
Sitemap: https://www.yourdomain.com/sitemap.xml
“`
把上面的`yourdomain.com`换成你自己的域名,保存为robots.txt放到网站根目录(即通过`https://你的域名/robots.txt`能访问到)就可以了。
类似点金智推这类GEO内容系统,能自动检测站点robots.txt与各AI爬虫的可抓取状态,如果发现AI爬虫被屏蔽会给出修正建议,帮你避免”门关了自己不知道”的问题。
注意:如果你希望对训练爬虫和引用爬虫区别对待(比如不想被GPTBot训练但希望被OAI-SearchBot引用),可以参考F02的差异化配置方法。

三、3个常见错误配置
错误1:`Disallow: /`屏蔽全站
这是最致命的错误。有些网站为了开发阶段不被搜索引擎收录,或者为了减少服务器压力,设置了`Disallow: /`禁止所有爬虫抓取,结果上线后忘了改回来。AI爬虫看到这个规则就直接走了,你的内容再好也看不到。
检查方法:直接在浏览器访问`https://你的域名/robots.txt`,看看有没有`Disallow: /`这一行(在`User-agent: *`下面)。如果有,立刻删掉或改成只屏蔽后台目录。
错误2:只放行了百度/Google,漏了AI爬虫
很多网站的robots.txt是以前只做SEO时配的,只明确放行了Baiduspider和Googlebot,对其他爬虫要么没有明确Allow,要么干脆因为默认规则或其他配置导致AI爬虫被挡。
解决方法:不要只写搜索引擎爬虫,把上面列出的主流AI爬虫都显式加上Allow规则。即使`User-agent: *`是Allow的,也建议单独列出AI爬虫,清晰明确。
错误3:Sitemap未声明或地址错误
很多网站robots.txt里没有Sitemap行,或者Sitemap地址填错了。没有Sitemap,爬虫只能通过首页链接慢慢爬取,发现页面的速度慢很多;Sitemap地址填错了,爬虫找到的是404页面。
检查方法:确认robots.txt最后一行的Sitemap地址能正常访问(在浏览器打开那个URL能看到XML格式的网站地图)。如果你没有sitemap.xml,建议用CMS插件或在线工具生成一个。
四、配置后如何验证
改完robots.txt,不要假设它生效了,花10分钟做验证:
直接访问`https://你的域名/robots.txt`,确认文件能打开、内容是你刚改的版本。注意:有些网站有缓存,可能需要强制刷新(Ctrl+F5)看到最新版本。
如果你有Google Search Console账号,里面有”robots.txt测试工具”,可以模拟指定爬虫访问指定路径,看是否被允许。百度搜索资源平台也有类似功能。
在命令行用curl模拟AI爬虫的User-Agent访问你的网页,确认能正常返回内容:
“`
curl -A “GPTBot” https://你的域名/你的文章URL
“`
如果返回的是正常HTML内容(不是403 Forbidden或空白页),说明放行了。如果返回403或者拒绝访问,说明还有其他层面的屏蔽(服务器防火墙、WAF等),需要技术人员排查。
robots.txt修改后,爬虫下次访问时就会按新规则执行,但爬虫重新抓取你所有内容需要时间,通常是几周到1-2个月。你可以在百度/Google搜索资源平台提交sitemap请求重新抓取,加快这个过程。
如果放行了robots但AI还是不引用你,可能还有其他问题:前端JS渲染导致爬虫抓不到内容(见F06)、内容质量不够、信息不一致等,需要继续排查。

结论
GEO技术地基的第一件事,就是确认AI爬虫进得来。
robots.txt配置这件事技术含量不高,5分钟就能检查完,但如果配置错了,后果是灾难性的——你所有的内容努力都白费,因为AI根本看不到。今天就花5分钟做一件事:打开浏览器访问你自己网站的`/robots.txt`,对照本文的主流AI爬虫清单,检查有没有被错误屏蔽的。把门打开,后面的内容才有意义。
先确认门是开的,再谈里面的装修。这是GEO的第一课。