2024年什么是robots协议?(网站robots协议使用教程)
2024-02-26
王柯团队

网站robots协议使用教程
robots协议可以说是各种网络爬虫程序与网站之间的一种约定,前段时间etao和京东就360buy内容的抓取闹得像两个孩子(PS:这篇文章写了一段时间了),且不论京东与etao的对错是非,从中我们可以知道robots可以将一些内容不开放给网络爬虫抓取,网络爬虫呢也完全可以不理会robots协议,按照自己的喜好获取你的信息,纵然是需要登录的网站爬虫也能注册账号登录,只是看想与不想。
也许有人说这样看robots协议一点作用也没有了,zhihu也曾讨论过robots是否涉及法律,协议的存在有其一定的约束力,但对于流氓行径连法律都不能完全阻止更别说协议了。
robots协议在遵守其约束的行为中能对SEO帮助很大的,下面看下都能做些什么?
第一:robots能规范网站的URL
网站有两种甚至3种以上地址的时候,该协议就能禁止蜘蛛爬去你不想展示的几种URL,而使网站解决站内重复问题集中权重。
网站有时候为了数据分析会在url接受后添加一些参数以区分来路,这样也是能用该协议解决的
第二:鉴于网站不想通过搜索引擎展示给用户的一些内容,也可以使用 robots.txt解决
第三:控制蜘蛛抓取,以减轻服务器负担,对于内容数量比较大的网站 蜘蛛抓取对于服务器资源的消耗是十分大的。
第四:和nofollow配合控制蜘蛛对网站的充分抓取
第五:robots.txt 支持添加网站地址以促进网站抓取和收录,语法:Sitemap:http://www.snlvyou.com/sitemap.xml
robots.txt文件用法举例