
引言
“我们网站内容很全啊,产品介绍、技术文章、公司新闻都有,为什么AI搜索里就是找不到我们?”
这是很多企业做GEO时遇到的第一堵墙。他们打开浏览器看自己的网站,内容满满当当,一切正常,以为AI爬虫看到的也是一样的。但真相是:你在浏览器里看到的内容,和AI爬虫拿到的内容,可能完全是两个东西。
浏览器会执行JavaScript、加载CSS、渲染动态内容,但AI爬虫大部分时候不会——它们直接请求URL,拿到服务器最初返回的HTML就走了。如果你的内容是靠JS动态渲染的(React/Vue/Angular写的SPA),或者有登录墙、Cookie限制、反爬机制,爬虫拿到的可能只是一个空壳。
怎么验证?不需要请技术团队做复杂审计,不需要买昂贵工具,用一个命令行工具curl就能模拟爬虫视角,5秒钟看出真相。
核心结论:curl是你做GEO的最低成本体检工具。用curl模拟AI爬虫请求你的页面,如果返回的HTML里看不到正文文字,那AI爬虫也看不到——你写的所有内容都白费了。
一、为什么需要”爬虫视角”
理解”爬虫视角”和”用户视角”的区别,是GEO技术诊断的第一步。
用户视角(浏览器):
- 浏览器下载HTML → 下载并执行JS → JS拉取数据 → JS渲染出完整页面
- 用户看到的是经过完整渲染的最终结果:文字、图片、按钮、表单全部正常
- 你的React/Vue网站在浏览器里看起来完美无缺
爬虫视角(AI爬虫/搜索引擎爬虫):
- 爬虫请求URL → 服务器返回初始HTML → 爬虫直接解析这个HTML
- 大部分AI爬虫不执行JS,或者JS执行能力极其有限
- 如果初始HTML里没有正文(只有空div和JS引用),爬虫就认为这个页面没有内容
这就是为什么很多企业觉得”我们内容做得很好”,但AI从来不推荐他们——AI根本没看到那些内容。
常见的”用户可见但爬虫不可见”的原因:
curl验证就是让你”站在爬虫的角度”看页面,立刻发现这些问题。

二、实操:用curl模拟一次爬虫请求
curl是一个命令行工具,Mac/Linux自带,Windows 10/11也自带(PowerShell里直接能用)。不需要安装任何东西。
“`
curl -A “爬虫User-Agent” “https://你的URL”
“`
`-A`参数用来指定User-Agent,也就是告诉服务器”我是谁”。你可以模拟不同的爬虫:
“`
curl -A “GPTBot” “https://www.yourdomain.com” -o page.html
“`
“`
curl -A “Bytespider” “https://www.yourdomain.com” -o page.html
“`
“`
curl -A “Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36” “https://www.yourdomain.com” -o page.html
“`
`-o page.html`表示把结果保存到page.html文件,方便查看。如果不加`-o`,结果会直接打印在终端里(内容多的话会刷屏)。
执行后怎么检查:
- 用记事本或VS Code打开保存的page.html文件
- 按Ctrl+F搜索你页面上的关键词,比如你的公司名、产品名、文章正文里的某个独特短语
- 判断标准:
- 能在HTML源码里直接搜到正文字段 → 爬虫能看到,OK
- 搜不到正文,只能看到`
`或`
`加一堆script标签 → 空壳问题,爬虫看不到
- 返回403 Forbidden或404或验证码页面 → 被反爬机制拦截了
- 返回的内容很短(几百字节)→ 可能被WAF拦截或者有其他问题
“`
curl -A “GPTBot” “https://www.yourdomain.com/your-article” -s | grep -o “你的关键词”
“`
`-s`表示静默模式(不显示进度条),`grep -o “你的关键词”`搜索并输出匹配内容。如果输出了你的关键词,说明爬虫能看到;如果什么都没输出,说明看不到。
一定要检查多个页面:
- 首页
- 一篇文章详情页
- 一个产品详情页
- 关于我们/联系我们页
不要只检查首页,很多网站首页做了SSR但内页还是空壳。
三、常见问题定位与修复
据纪欧网络对B2B官网爬虫可见性的持续观测(基于服务50+ B2B企业的实践),纯前端渲染造成的空壳页在中小站点中占比偏高,先做curl体检可显著降低漏抓。
用curl验证后,你可能会发现以下几种问题:
| curl结果 | 问题诊断 | 修复方向 |
|---|---|---|
| 能搜到正文,内容完整 | 正常,爬虫可见 | 继续做内容优化 |
| 只有`
`空壳 |
SPA前端渲染问题 | 做SSR/SSG/预渲染(详见F06) |
| 返回403 Forbidden | 被WAF/CDN/服务器拦截 | 检查防火墙规则,将AI爬虫UA加白名单 |
| 返回登录页/注册页 | 内容在登录墙后 | 公开内容对爬虫开放(不需要登录就能访问) |
| 301/302跳转 | 重定向问题 | 确保重定向到的最终页面也可被正常抓取 |
| robots.txt禁止 | robots.txt屏蔽 | 修改robots.txt放行AI爬虫(详见F01) |
| 内容是图片里的文字 | 文字在图片中不可抽取 | 把文字做成HTML文本,不要全在图片里 |
| 只渲染了部分内容 | SSR不完整/懒加载问题 | 确保核心内容在首屏HTML里,不靠滚动加载 |
特别注意:User-Agent差异
有些网站的反爬策略对不同UA区别对待——模拟百度蜘蛛能正常访问,模拟GPTBot就被拦截。所以一定要用多个AI爬虫的UA分别测试,不要只测一个。
curl默认不带Cookie,如果你测试发现curl返回的内容比浏览器少,可能是因为部分内容依赖Cookie或特定请求头。对于公开内容,这是需要修复的——爬虫不会带着你的用户Cookie访问。
技术团队修复后(比如上了SSR、加了白名单),再用curl测试一次,确认HTML里能看到正文了才算修复成功。不要听技术说”改好了”就信,自己用curl验证。

结论
curl是GEO的体温计——5秒钟测出你的网站有没有”发烧”(爬虫看不到内容)。
在你花时间精力做内容优化、加Schema、分发文章之前,先用curl做个体检。如果curl测试显示爬虫看不到正文,那后面所有GEO动作都是在一个不存在的舞台上表演。先把”让AI看到内容”这个问题解决了,再谈其他优化。
这是GEO所有技术动作中成本最低的一个:0成本、5分钟、不需要任何技术背景就能做。今天就打开终端,curl一下你的官网首页和核心产品页,看看AI眼里你的网站到底长什么样。
看到了,才有机会被推荐。看不到,一切都是零。