引言:内容写得再好,AI爬虫进不来也白搭

很多企业做GEO都遇到过一个非常”冤”的问题:内容写得非常专业,关键词也布局了,知识图谱也做了,分发也做了,但是问AI相关问题的时候,品牌就像不存在一样,根本搜不到。一开始以为是内容写得不好,改了又改还是没用,最后让技术同事一看网站日志,发现所有AI爬虫都被robots.txt屏蔽了,或者网站是纯前端渲染,爬虫抓不到正文——AI根本连你的内容都看不到,怎么可能推荐你?

这是GEO最底层、最容易被忽略的问题:被AI推荐的前提,是AI爬虫能正常访问你的网站、能抓取到完整的正文内容、能读懂你内容讲的是什么。如果爬虫被挡在门外,或者抓到的是空页面,你上面所有GEO优化都是空中楼阁,做得再好也没用。很多技术同事出于安全或者节省服务器带宽的考虑,会默认屏蔽所有不认识的爬虫,结果一不小心把所有AI爬虫都屏蔽了,市场部门花几十万做的内容和GEO优化,全部打了水漂。

本文就把主流AI搜索爬虫的身份、抓取逻辑、robots.txt正确配置方法、服务端渲染要求、结构化数据优化、抓取验证方法全部讲清楚,帮你把GEO的”地基”打牢,不要让内容输在最基础的抓取环节。

AI爬虫抓取流程

主流AI爬虫身份清单:别把”朋友”挡在门外

首先要搞清楚现在主流的AI爬虫都有哪些,它们是谁家的、来干什么的,不要不分青红皂白全屏蔽了。我们整理了目前市面上最常见的五大类AI爬虫,按用途可以分成两大类:引用/检索型爬虫训练型爬虫,这两类一定要区分开,它们来你网站的目的完全不同,处置策略也完全不一样:

爬虫名称 所属公司 主要用途 类型 对企业的价值
OAI-SearchBot OpenAI ChatGPT搜索功能的实时检索引用 引用/检索型 极高,是ChatGPT推荐你品牌的核心通道
PerplexityBot Perplexity Perplexity AI搜索的实时抓取引用 引用/检索型 极高,Perplexity用户都是高价值调研用户
Bytespider 字节跳动 豆包、抖音AI搜索的网页抓取 引用/检索型 高,覆盖豆包+抖音双平台AI搜索
ClaudeBot Anthropic Claude大模型的训练和检索 训练+检索混合型 中等,Claude在企业用户中渗透率高
GPTBot OpenAI 大模型通用训练数据抓取 训练型 低,主要用来训练基础模型,不直接带来搜索流量

核心原则非常明确:所有”引用/检索型”爬虫必须放行,它们是来抓你的内容给AI搜索用户看的,直接决定你在AI搜索里的可见率,放行了才有机会被推荐,屏蔽了就彻底没机会;“训练型”爬虫可以根据企业自己的需求选择是否屏蔽,如果你介意自己的内容被用来训练大模型基础能力,可以屏蔽,但是千万不要误伤了引用型爬虫。

我们见过太多企业,技术同事一句”为了安全把所有陌生爬虫全屏蔽”,结果把OAI-SearchBot、PerplexityBot、Bytespider这三个最重要的引用型爬虫全挡在门外,做了半年GEO一点效果都没有,最后排查了半天才发现问题,白白浪费了半年时间和预算。做GEO第一步,先找技术同事确认这几个爬虫有没有被屏蔽,这是所有优化的前提。

抓取第一步:正确配置robots.txt,该放的放,该管的管

robots.txt是网站根目录下的一个文本文件,用来告诉爬虫哪些页面可以抓、哪些不能抓,是爬虫访问你网站第一个看的文件,配置错了直接导致爬虫不抓你的内容,是最容易出问题的地方。

很多企业的robots.txt要么是默认配置把所有陌生爬虫都屏蔽了,要么是抄网上的模板不小心把AI爬虫禁了,这里给大家一个可以直接用的配置参考,兼顾”放行引用型爬虫”和”管控训练型爬虫”的需求:

“`
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: ClaudeBot
Allow: /
Disallow: /private/ # 你不想被抓取的私密目录
Disallow: /admin/

# 如果你介意内容被用来训练大模型,可以屏蔽GPTBot
User-agent: GPTBot
Disallow: /

# 其他爬虫默认允许
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/
“`

这里有几个非常重要的注意事项,很多人都踩过坑:

很多技术为了省事,直接写`User-agent: * Disallow: /`只放行Google、百度这些认识的搜索引擎爬虫,其他全屏蔽,结果所有AI爬虫都进不来,GEO直接归零。现在AI搜索的流量占比越来越高,一定要单独给主流引用型AI爬虫开白名单。

一定要把单独放行AI爬虫的规则写在通用规则前面,如果你先写`User-agent: * Disallow: /`,后面再写允许OAI-SearchBot是没用的,匹配到第一个通用规则就直接生效了,很多人配置完发现还是没收录,就是顺序写错了。

很多人robots.txt里把/css/、/js/、/images/这些目录也屏蔽了,爬虫抓到HTML但是抓不到渲染需要的资源,很可能渲染出来是空页面,还是读不到正文,静态资源目录一定要放行。

配置完robots.txt之后,可以用Google的robots.txt测试工具验证一下,确认OAI-SearchBot、PerplexityBot、Bytespider这三个核心爬虫的访问权限是允许的,这一步花10分钟就能搞定,但是能避免90%的收录问题。

让爬虫”读懂”内容:服务端渲染和结构化数据是关键

robots.txt放行只是第一步,爬虫能进来了,不代表能抓到正确的内容,很多纯前端Vue/React写的网站,首屏HTML是空的,内容全靠JS在浏览器端渲染,爬虫如果不执行JS,抓到的就是一个空页面,什么内容都读不到,这也是非常常见的问题。

第一,纯前端网站一定要做服务端渲染(SSR)或者预渲染

现在很多企业官网都是用Vue、React做的单页应用(SPA),用户用浏览器打开没问题,因为浏览器会执行JS把内容渲染出来,但是很多AI爬虫和早期搜索引擎爬虫一样,不会完整执行JS,或者执行JS的能力很弱,抓到的初始HTML就是一个`

`空标签,根本没有正文内容。

解决这个问题有三个方案,按优先级排序:

如果你的网站是纯前端渲染,又没做任何SSR/预渲染处理,不管你内容写得多好,AI爬虫抓到的都是空页面,不可能引用你,这是纯技术问题,内容部门解决不了,一定要找技术同事处理。我们接触过至少20%的企业客户,GEO没效果最后查出来都是这个问题,解决之后1-2个月AI收录量就涨了好几倍。

第二,加Schema结构化数据,帮AI准确提取信息

爬虫抓到内容之后,还需要理解你内容里什么是品牌名、什么是产品、什么是参数、什么是问答,如果你给正文加上Schema.org结构化标记(JSON-LD格式),相当于直接给AI递名片,告诉它”这是我们公司名字、这是我们的产品、这是参数、这是常见问题答案”,提取准确率能提升5倍以上,被引用的概率自然高很多。

最核心的三类Schema是所有企业官网必须加的:

很多人觉得Schema是技术细节不重要,我们做过对比测试,同样的内容加了正确的Schema之后,被AI引用的概率是没加的3-5倍,投入产出比极高,技术同事半天就能加完,一定要做。

验证爬虫是否能正常抓取:用curl模拟爬虫视角看内容

配置完robots.txt、做完SSR、加完Schema,怎么知道AI爬虫到底能不能正常抓到你的内容?不用等爬虫来抓,你自己用curl命令模拟AI爬虫的UA,直接就能看到爬虫能抓到什么内容,1分钟就能验证,非常简单。

模拟OAI-SearchBot抓首页的命令:
“`bash
curl -A “Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)” https://你的官网.com
“`

模拟PerplexityBot抓首页的命令:
“`bash
curl -A “Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)” https://你的官网.com
“`

执行完命令之后,看返回的HTML源码里有没有你网站的正文内容:如果能看到完整的公司介绍、产品信息、正文文字,说明爬虫能正常抓到内容;如果返回的只有空的div标签、JS代码,看不到正文,说明渲染有问题,爬虫读不到内容,需要回去做SSR/预渲染。

除了curl之外,还可以用百度搜索资源平台、Google Search Console的”网址抓取”功能,输入你的页面URL,模拟爬虫抓取,看渲染后的内容是否完整,这些工具都是免费的,每个月花10分钟抽几个核心页面测一下,确保爬虫能正常访问。

类似点金智推这类GEO内容系统,已经内置了AI爬虫抓取检测功能,系统会自动模拟各大AI爬虫访问你的网站,检测robots.txt是否放行、是否能抓到完整正文、Schema是否配置正确,直接给出优化建议,不用企业自己敲命令、自己排查,技术同事按照建议改就行,能节省大量排查时间,避免因为技术细节问题浪费GEO投入。

AI爬虫优化三步法

结论:抓取是GEO的地基,地基不牢地动山摇

最后总结一下,GEO和建房子一样,抓取是地基,内容是墙体,分发是装修,很多人上来就忙着写内容、做分发,地基没打好,AI爬虫根本进不来,最后做的都是无用功。

AI爬虫优化其实非常简单,就四件事:

这五件事全部做完,也就技术同事1-2天的工作量,但是能解决80%的”AI搜不到品牌”问题,是所有GEO优化的前提。如果你不知道自己网站有没有屏蔽AI爬虫、渲染有没有问题、Schema有没有加对,可以预约我们15分钟免费GEO技术诊断(电话:189-7512-3480),我们帮你做一次完整的AI爬虫抓取检测,告诉你哪里有问题、怎么改,也可以领取《GEO技术配置清单》,交给技术同事照着配置就行。