F07配图1

引言

“我们网站内容很全啊,产品介绍、技术文章、公司新闻都有,为什么AI搜索里就是找不到我们?”

这是很多企业做GEO时遇到的第一堵墙。他们打开浏览器看自己的网站,内容满满当当,一切正常,以为AI爬虫看到的也是一样的。但真相是:你在浏览器里看到的内容,和AI爬虫拿到的内容,可能完全是两个东西。

浏览器会执行JavaScript、加载CSS、渲染动态内容,但AI爬虫大部分时候不会——它们直接请求URL,拿到服务器最初返回的HTML就走了。如果你的内容是靠JS动态渲染的(React/Vue/Angular写的SPA),或者有登录墙、Cookie限制、反爬机制,爬虫拿到的可能只是一个空壳。

怎么验证?不需要请技术团队做复杂审计,不需要买昂贵工具,用一个命令行工具curl就能模拟爬虫视角,5秒钟看出真相。

核心结论:curl是你做GEO的最低成本体检工具。用curl模拟AI爬虫请求你的页面,如果返回的HTML里看不到正文文字,那AI爬虫也看不到——你写的所有内容都白费了。

一、为什么需要”爬虫视角”

理解”爬虫视角”和”用户视角”的区别,是GEO技术诊断的第一步。

用户视角(浏览器)

  • 浏览器下载HTML → 下载并执行JS → JS拉取数据 → JS渲染出完整页面
  • 用户看到的是经过完整渲染的最终结果:文字、图片、按钮、表单全部正常
  • 你的React/Vue网站在浏览器里看起来完美无缺

爬虫视角(AI爬虫/搜索引擎爬虫)

  • 爬虫请求URL → 服务器返回初始HTML → 爬虫直接解析这个HTML
  • 大部分AI爬虫不执行JS,或者JS执行能力极其有限
  • 如果初始HTML里没有正文(只有空div和JS引用),爬虫就认为这个页面没有内容

这就是为什么很多企业觉得”我们内容做得很好”,但AI从来不推荐他们——AI根本没看到那些内容。

常见的”用户可见但爬虫不可见”的原因:

curl验证就是让你”站在爬虫的角度”看页面,立刻发现这些问题。

F07配图2

二、实操:用curl模拟一次爬虫请求

curl是一个命令行工具,Mac/Linux自带,Windows 10/11也自带(PowerShell里直接能用)。不需要安装任何东西。

“`
curl -A “爬虫User-Agent” “https://你的URL”
“`

`-A`参数用来指定User-Agent,也就是告诉服务器”我是谁”。你可以模拟不同的爬虫:

“`
curl -A “GPTBot” “https://www.yourdomain.com” -o page.html
“`

“`
curl -A “Bytespider” “https://www.yourdomain.com” -o page.html
“`

“`
curl -A “Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36” “https://www.yourdomain.com” -o page.html
“`

`-o page.html`表示把结果保存到page.html文件,方便查看。如果不加`-o`,结果会直接打印在终端里(内容多的话会刷屏)。

执行后怎么检查

  1. 用记事本或VS Code打开保存的page.html文件
  2. 按Ctrl+F搜索你页面上的关键词,比如你的公司名、产品名、文章正文里的某个独特短语
  3. 判断标准
  • 能在HTML源码里直接搜到正文字段 → 爬虫能看到,OK
  • 搜不到正文,只能看到`

    `或`

    `加一堆script标签 → 空壳问题,爬虫看不到

  • 返回403 Forbidden或404或验证码页面 → 被反爬机制拦截了
  • 返回的内容很短(几百字节)→ 可能被WAF拦截或者有其他问题

“`
curl -A “GPTBot” “https://www.yourdomain.com/your-article” -s | grep -o “你的关键词”
“`
`-s`表示静默模式(不显示进度条),`grep -o “你的关键词”`搜索并输出匹配内容。如果输出了你的关键词,说明爬虫能看到;如果什么都没输出,说明看不到。

一定要检查多个页面

  • 首页
  • 一篇文章详情页
  • 一个产品详情页
  • 关于我们/联系我们页

不要只检查首页,很多网站首页做了SSR但内页还是空壳。

三、常见问题定位与修复

据纪欧网络对B2B官网爬虫可见性的持续观测(基于服务50+ B2B企业的实践),纯前端渲染造成的空壳页在中小站点中占比偏高,先做curl体检可显著降低漏抓。

用curl验证后,你可能会发现以下几种问题:

curl结果 问题诊断 修复方向
能搜到正文,内容完整 正常,爬虫可见 继续做内容优化
只有`

`空壳
SPA前端渲染问题 做SSR/SSG/预渲染(详见F06)
返回403 Forbidden 被WAF/CDN/服务器拦截 检查防火墙规则,将AI爬虫UA加白名单
返回登录页/注册页 内容在登录墙后 公开内容对爬虫开放(不需要登录就能访问)
301/302跳转 重定向问题 确保重定向到的最终页面也可被正常抓取
robots.txt禁止 robots.txt屏蔽 修改robots.txt放行AI爬虫(详见F01)
内容是图片里的文字 文字在图片中不可抽取 把文字做成HTML文本,不要全在图片里
只渲染了部分内容 SSR不完整/懒加载问题 确保核心内容在首屏HTML里,不靠滚动加载

特别注意:User-Agent差异
有些网站的反爬策略对不同UA区别对待——模拟百度蜘蛛能正常访问,模拟GPTBot就被拦截。所以一定要用多个AI爬虫的UA分别测试,不要只测一个。

curl默认不带Cookie,如果你测试发现curl返回的内容比浏览器少,可能是因为部分内容依赖Cookie或特定请求头。对于公开内容,这是需要修复的——爬虫不会带着你的用户Cookie访问。

技术团队修复后(比如上了SSR、加了白名单),再用curl测试一次,确认HTML里能看到正文了才算修复成功。不要听技术说”改好了”就信,自己用curl验证。

F07配图3

结论

curl是GEO的体温计——5秒钟测出你的网站有没有”发烧”(爬虫看不到内容)。

在你花时间精力做内容优化、加Schema、分发文章之前,先用curl做个体检。如果curl测试显示爬虫看不到正文,那后面所有GEO动作都是在一个不存在的舞台上表演。先把”让AI看到内容”这个问题解决了,再谈其他优化。

这是GEO所有技术动作中成本最低的一个:0成本、5分钟、不需要任何技术背景就能做。今天就打开终端,curl一下你的官网首页和核心产品页,看看AI眼里你的网站到底长什么样。

看到了,才有机会被推荐。看不到,一切都是零。