YandexBot 是 Yandex 的搜索引擎的爬虫。Yandex 是一家俄罗斯互联网公司,在俄罗斯经营最大的搜索引擎,在该国拥有约 60% 的市场份额。截至 2012 年 4 月,Yandex 排名全球第五大搜索引擎,每天有超过1.5 亿次搜索,访客超过 2550 万。
经常有网友问我如何屏蔽 yandexbot,或者如何查询 yandexbot ip range(yandex ip 地址段)?
这篇文章中我详细介绍一下这两个问题。
如何屏蔽 yandexbot
我们可以通过 robots.txt 屏蔽 yandexbot 的爬虫,下面是示例:
User-agent: Yandex
Disallow: /
这样我们就屏蔽了 yandexbot 抓取所有页面。
如果我们只想 yandexbot 抓取部分页面,下面是写法示例:
User-agent: Yandex
Allow: /public
Disallow: /
上面除了 /public
页面允许被 yandexbot 访问之外,其他都禁止 yandexbot 爬虫抓取。
通过 IP 地址段屏蔽 yandexbot
yandexbot 的 ASN 是 AS13238、AS208722 这两个,我们可以通过 ASN 查询获取 ASN 的 IP 地址段。
将查询的 IP 地址加入到黑名单中就可以屏蔽 yandexbot 的目的了。
同时我们可以找到爬虫查询这个工具,直接输入 IP 地址,就可以判断 IP 是否属于 yandexbot 的。
总结
这篇文章主要介绍了屏蔽 yandexbot 的两种方法,一种是:通过 robots.txt 协议,一个是通过 yandexbot ip range 的方法来屏蔽
当然由于 yandexbot 属于搜索引擎爬虫,可以为我们带来流量,所以在 yandexbot 没有影响到你服务器性能的情况下,尽量不要屏蔽它。