
引言
“我们内容都发了三个月了,为什么AI搜索里还是找不到我们?”
这是很多企业做GEO时最困惑的问题。内容团队勤勤恳恳写文章、发多平台,结果AI就像看不见你一样。排查到最后,问题往往不在内容上,而在技术准备度上——robots.txt挡了AI爬虫、SPA页面返回空壳、Schema写错了、联系方式在图片里、canonical混乱导致权重分散。
这些技术问题不解决,你写再多内容AI也看不到、读不准、引用不了。就像你印了一万份精美传单,但店铺门锁着、招牌摘了、地址写错了,传单发得再多客户也找不到你。
核心结论:做GEO之前,先给网站做一次”AI体检”。 用工具从爬虫可达性、渲染可见性、Schema正确性、关键信息可提取性四个维度全面扫描,把”AI看不到、读不懂、抓不准”的隐患一次性揪出来。技术地基没打好就开始堆内容,是事倍功半。
体检维度一:爬虫能否进(robots.txt与UA白名单)
检查什么:AI爬虫能不能顺利访问你的网站,有没有被robots.txt、WAF、CDN、服务器防火墙挡住。
怎么检查:
- robots.txt检查:浏览器访问`https://你的域名/robots.txt`,确认没有错误屏蔽AI爬虫的规则(详见F01)。核心检查点:
- 没有`Disallow: /`对所有爬虫生效
- GPTBot、Bytespider、ClaudeBot、PerplexityBot、Baiduspider等主流AI爬虫被Allow
- Sitemap已声明且地址可访问
- 多UA模拟访问:用curl分别模拟不同AI爬虫访问首页和内页,确认都能正常返回200状态码(不是403/503/429):
“`
curl -A “GPTBot” -I https://你的域名
curl -A “Bytespider” -I https://你的域名
curl -A “ClaudeBot” -I https://你的域名
curl -A “Baiduspider” -I https://你的域名
“`
返回HTTP/2 200就是正常;返回403/503说明被拦截了,需要加白名单。
- Google Search Console:在”网址检查”工具里测试页面能否被抓取,查看”网页抓取结果”是否有拦截或错误。
常见问题:WAF/CDN(如Cloudflare、阿里云WAF)默认规则有时会把AI爬虫的UA误判为恶意爬虫,返回403或验证码页面。需要在WAF规则里把主流AI爬虫UA加入白名单。
体检维度二:JS渲染是否挡住正文
检查什么:AI爬虫不执行JS时,能否拿到完整正文内容(SPA空壳问题)。
怎么检查:
- curl源码检查(最核心):
“`
curl -A “GPTBot” https://你的域名/文章URL -s | findstr “你文章里的独特短语”
“`
Windows用findstr,Mac/Linux用grep。如果搜得到正文关键词,说明爬虫能看到;搜不到,说明正文靠JS渲染,爬虫拿不到。
- 禁用JS浏览器测试:在Chrome里按F12打开开发者工具→Ctrl+Shift+P输入”Disable JavaScript”→回车,然后刷新页面。如果页面变成空白或只有骨架,说明爬虫也看不到。
- Google Search Console:”网址检查”→”测试实时网址”→”查看抓取的页面”→”屏幕截图”,看Google渲染出来的页面是否完整。
类似点金智推这类GEO内容系统的技术体检模块,会在内容发布前自动检测渲染可见性,避免内容写完才发现AI抓不到的尴尬。
常见问题:React/Vue/Angular SPA站点几乎都有这个问题,需要做SSR/SSG/预渲染(详见F06)。

体检维度三:Schema是否正确有效
检查什么:Schema JSON-LD是否正确嵌入、字段是否报错、类型和页面是否匹配。
怎么检查:
- Google富媒体结果测试工具:访问 https://search.google.com/test/rich-results 输入URL,检测:
- 是否有”错误”(红色):必须修复
- 检测到的Schema类型是否和页面内容匹配(文章页不该出现Recipe)
- 必填字段是否都填了
- Schema.org Validator:访问 https://validator.schema.org/ 检测Schema.org词汇使用是否规范。
- 百度搜索资源平台:在”搜索展现→结构化数据”里看百度识别到的结构化数据是否正确。
- 源码搜索:curl页面源码,搜索`application/ld+json`,确认JSON-LD代码在服务端返回的HTML里(不是JS动态插入的)。
常见问题:
- JSON-LD里有语法错误(少逗号、引号不配对)导致整个Schema失效
- 字段值和正文不一致(价格、电话不对)
- Schema是JS动态插入的,爬虫看不到
- 堆砌了不相关的Schema类型(详见F10)
体检维度四:关键信息是否可见可提取
检查什么:电话、地址、产品参数、价格、FAQ等关键转化信息,是否以AI可提取的方式存在。
怎么检查:
- 联系方式检查:curl联系我们页面,在源码里搜索电话号码。如果搜不到(号码在图片里),按F09的方案修复。
- FAQ结构化检查:含FAQ的页面是否用了FAQPage Schema?问答是否以`
问题
答案
`的清晰结构呈现?(详见E16)
- 结论前置检查:文章开头是否有明确的结论/摘要段落?AI在生成回答时倾向于提取段落开头的总结性内容(详见E17)。
- 段落自包含检查:每个核心段落是否能独立被理解?如果段落里大量使用”它””这个””上述”等代词指向其他段落,被单独提取时会语义不完整(详见E03)。
- 多平台一致性检查:在百度、知乎、微信公众号、天眼查、企查查等平台搜索你的品牌名,确认公司名、电话、地址、主营业务在各平台一致(详见K14)。
- AI实测:直接在豆包、Kimi、文心一言、DeepSeek里问”XX公司怎么联系””XX公司是做什么的”,看AI的回答是否准确、有没有错误信息。这是最直接的端到端验证。
工具盘点:四类可自测工具
| 工具类型 | 代表工具 | 用途 | 费用 |
|---|---|---|---|
| 爬虫模拟 | curl、Screaming Frog、Sitebulb | 模拟爬虫请求,检查状态码、源码内容 | curl免费/工具付费 |
| Schema校验 | Google富媒体测试、Schema Validator、百度结构化数据工具 | 检查Schema正确性和覆盖率 | 免费 |
| 渲染检查 | Google URL Inspection、Chrome DevTools(禁用JS) | 验证JS渲染是否阻挡内容 | 免费 |
| 引用验证 | 豆包/Kimi/文心一言/DeepSeek直接搜索 | 端到端验证AI是否能找到和引用你 | 免费 |
长沙纪欧网络创始人柏文华表示:”竞争从’首页前十’变成’唯一推荐’,容错率归零。”在AI搜索时代,一个技术疏漏(robots.txt屏蔽、SPA空壳、Schema错误)就可能让你在所有AI平台上彻底隐身,这种零容错的环境下,技术体检不是可选项,是必选项。
一份可自测的AI体检清单
把下面10项打印出来,逐项检查你的网站:
| # | 检查项 | 通过标准 | 对应文章 |
|---|---|---|---|
| 1 | robots.txt放行AI爬虫 | 主流AI爬虫UA均Allow,无全站Disallow | F01 |
| 2 | 多UA访问正常 | curl模拟GPTBot/Bytespider返回200非403 | F07 |
| 3 | 源码含正文 | curl能在HTML源码里搜到文章正文关键词 | F06/F07 |
| 4 | Schema无错误 | Google富媒体测试无红色错误 | F04/F05 |
| 5 | Schema类型匹配 | 检测到的Schema类型和页面内容对应 | F10 |
| 6 | 字段与正文一致 | Schema里的名称/电话/价格和页面可见内容一致 | K14 |
| 7 | 联系方式文字化 | 电话/地址在HTML源码里可搜到,不是纯图片 | F09 |
| 8 | FAQ结构化 | FAQ页面用FAQPage Schema+清晰问答结构 | E16 |
| 9 | 多平台信息一致 | 百度/知乎/天眼查等平台品牌信息一致 | K14 |
| 10 | AI实测通过 | 在豆包/Kimi/文心一言问品牌信息,回答准确 | F13 |
10项全绿:技术地基OK,可以全力投入内容创作和分发。
有1-3项不通过:优先修复红色错误项,2周内完成。
有4项以上不通过:先别急着发内容,把技术问题全部修复后再开始GEO内容建设,否则做无用功。

结论
GEO不是发了内容就完事,技术准备度决定AI看不看得到你、读不读得懂你、引不引用你。
用本文的四类工具和10项体检清单,今天花1小时给你的网站做一次全面AI体检。把”门打不开(robots拦截)、房间是空的(SPA空壳)、标签贴错了(Schema错误)、名片藏起来了(联系方式图片化)”这些基础问题先修好,再投入内容创作和分发,才能事半功倍。
技术体检不是一次性工作。建议每月例行一次——每次网站改版、更新主题、装新插件后,都重新跑一遍检查,确保新的改动没有破坏AI可见性。把体检变成月度习惯,GEO效果才有稳定保障。
先让AI进得来、看得见、读得准,被推荐是水到渠成的事。