最常见的 AEO 故障是 robots.txt 里的一行
如果引擎抓不到你的页面,那这一页就永远进不了它写答案时所依据的来源集合 —— 问题答得再好也没用。相当多的站点至今仍在屏蔽 AI 爬虫,源于当年对模型训练的第一波担忧时加的一刀切规则,此后再没人回头看过。
先查这一件事:打开 你的域名.com/robots.txt,搜索 GPTBot、ClaudeBot、PerplexityBot 和 Google-Extended。其中任何一个是 Disallow,都值得重新认真决策一次,而不是就这么继承下来。
训练爬虫和答题爬虫是两个不同的决定
制定策略时最有用的区分,是这个爬虫在喂给谁。大体上厂商会跑三类爬虫,而你可以分别决定放行或屏蔽。
- 训练型爬虫收集用于训练或改进模型的内容。屏蔽它们不会让你从今天的答案里消失,这也是最常出于原则考虑而做的决定。
- 搜索/索引型爬虫构建的是引擎答题时检索的那个索引。屏蔽它们确实会让你失去引用机会,而这恰恰是最多站点误伤的一类。
- 用户触发型抓取是因为用户的提问指向了某个页面而去取那一页。屏蔽它们会破坏一种场景:潜在客户把你的网址贴进对话框问「这家怎么样」。
值得认识的 user agent
这些由厂商公布、也会变动,所以把下面这份当起点看,制定策略前请对照厂商当前的文档核实。
- OpenAI:GPTBot 抓取用于模型训练与改进的内容,OAI-SearchBot 构建 ChatGPT 搜索背后的索引,ChatGPT-User 则在用户提问指向某页时去抓取那一页。
- Google:Google-Extended 本身不是爬虫,而是一个开关,决定 Googlebot 已抓取的内容能否用于 Gemini 和生成式答案的 grounding。它不影响搜索排名。
- Anthropic:ClaudeBot 负责抓取内容,另有用户触发型与搜索导向的代理,在对话过程中去取页面。
- Perplexity:PerplexityBot 为检索建立索引,Perplexity-User 抓取用户提问指向的页面。
- Apple:Applebot 服务于 Siri 和 Spotlight,而 Applebot-Extended 单独管辖生成式模型训练方面的使用。
- Microsoft:Copilot 主要基于 Bing 索引做 grounding,所以对 Copilot 可见度而言,Bingbot 的访问权限比任何 AI 专用代理都更关键。
- 其他值得显式列出的:meta-externalagent、Amazonbot、MistralAI-User、cohere-ai、DuckAssistBot、YouBot 和 Bytespider。
- 中文市场:Baiduspider、Sogou web spider、360Spider 和 PetalBot 喂的是你在那边的客户真正在用的引擎。
一个站得住的默认策略
对多数希望被发现的商业站点,建议全部放行,把真正的保护交给真正起作用的手段:私有内容用鉴权、复用问题用授权条款,以及不发布你不希望被转述的东西。
如果确实想划一条线,逻辑自洽的划法是:屏蔽训练型爬虫,放行搜索、索引和用户触发型代理。这样你今天仍然可被引用,同时不参与模型训练。真正不自洽的是一边做 AEO、一边屏蔽索引型代理 —— 而这恰恰是我们最常见到的组合。
robots.txt 是一种请求,不是强制机制,而且它是公开的。永远不要用它来隐藏敏感路径 —— 把它们列出来等于告诉所有人它们在哪。该用鉴权。
放行爬虫是必要条件,不是充分条件
- 把正文放进首屏 HTML。有几个 AI 爬虫不执行 JavaScript,所以纯客户端渲染的页面到手可能等同空白。
- 别在 CDN 或 WAF 层拦截 AI 代理。那一层的规则会完全盖过 robots.txt,而且很容易被遗忘。
- 维护好 sitemap 和干净的 canonical,让爬虫把预算花在你希望被引用的页面上。
- 可以考虑加一份 llms.txt 站点摘要。支持度还不普遍,但成本很低,能消除关于「你到底是做什么的」的歧义。
常见问题
对多数希望被发现的商业站点来说,不建议。GPTBot 关联的是训练而非答题,但实践中往往是把 AI 爬虫整组屏蔽 —— 而屏蔽搜索与索引类代理会让你彻底失去引用机会。如果要划线,就精确地只屏蔽训练型爬虫,保留搜索、索引和用户触发型代理。
不会。Google-Extended 是一个独立开关,管辖已抓取内容能否用于 Gemini 和生成式答案的 grounding。它不影响页面在 Google 搜索中的排名,但确实影响生成式场景。
不能。robots.txt 是一种请求,守规矩的爬虫会遵守,但它不是强制机制,而且文件本身是公开的。真正不能被模型读到的内容,需要的是鉴权,而不是一条 Disallow。
是 Bingbot。Copilot 主要基于 Bing 索引做 grounding,所以 Bing 的抓取权限和收录状态,对 Copilot 可见度的影响大于任何 Copilot 专用 user agent。
