检测看什么
对你输入的网站首页,按爬虫的规则读 robots.txt,再用每个爬虫的名字去打开首页。另外查五样我们实际遇过、会让网站在 AI 回答里消失的东西。
- Cloudflare 的邮箱加密:爬虫在你写邮箱的地方读到「[email protected]」。
- 要执行 JavaScript 才出现的文字。OpenAI、Anthropic、Perplexity 的爬虫读 HTML 时不执行脚本。
- 首页上的 noindex。
- sitemap:写在 robots.txt 里,或放在 /sitemap.xml。
- llms.txt:给部分 AI 工具读的纯文字简介。
为什么 200 只算好消息
请求是从我们的服务器、用每个爬虫的名字送出去的。有些防火墙还会查请求从哪里来,所以真正的爬虫可能被另外对待。看到 403 一定要追:我们在自己网站上遇到的那次 403,对应的正是一个连真爬虫也会挡掉的设定。
如果连用浏览器名字送的请求都被挡,那是网站在挡检测器,爬虫的结果说明不了什么;robots.txt 还是照样读、照样判断。
我们保存什么
每次的结果保存十分钟,重复检测时不会再去打扰同一个网站;每位访客一小时内的检测次数保存一小时,用 IP 地址的单向哈希记录,用来防止滥用。其他什么都不保存。
为什么做这个工具:我们自己的网站被 AI 看漏的两次。
Nicasia Digital Solutions