爬虫协议robots

前面的话

　　Robots协议(也称为爬虫协议、机器人协议等)全称是“网络爬虫排除标准”(Robots Exclusion Protocol)，网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。本文将详细介绍爬虫协议robots

概述

　　robots.txt文件是一个文本文件，是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的

　　当一个搜索蜘蛛访问一个站点时，它会首先检查该站点根目录下是否存在robots.txt，如果存在，搜索机器人就会按照该文件中的内容来确定访问的范围；如果该文件不存在，所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面

【原则】

　　Robots协议是国际互联网界通行的道德规范，基于以下原则建立：

　　1、搜索技术应服务于人类，同时尊重信息提供者的意愿，并维护其隐私权；

　　2、网站有义务保护其使用者的个人信息和隐私不被侵犯

　　[注意]robots.txt必须放置在一个站点的根目录下，而且文件名必须全部小写

写法

【User-agent】

　　下面代码中*代表的所有的搜索引擎种类，*是一个通配符，表示所有的搜索机器人

User-agent: *

　　下面代码表示百度的搜索机器人

User-agent: Baiduspider

【Disallow】

　　下面代码表示禁止爬寻admin目录下面的目录

Disallow: /admin/

　　下面代码表示禁止抓取网页所有的.jpg格式的图片

Disallow: /.jpg$

　　下面代码表示禁止爬取ab文件夹下面的adc.html文件

Disallow:/ab/adc.html

　　下面代码表示禁止访问网站中所有包含问号 (?) 的网址

Disallow: /*?*

　　下面代码表示禁止访问网站中所有页面

Disallow: /

【Allow】

　　下面代码表示允许访问以".html"为后缀的URL

Allow: .html$

　　下面代码表示允许爬寻tmp的整个目录

Allow: /tmp

用法

　　下面代码表示允许所有的robot访问网站所有的页面

User-agent: *

Allow:　/

　　下面代码表示禁止所有搜索引擎访问网站的任何部分

User-agent: *

Disallow: /

　　下面代码表示禁止百度的机器人访问其网站下其所有的目录

User-agent: Baiduspider

Disallow: /

　　下面代码表示禁止所有搜索引擎访问网站的cgi-bin、tmp、~joe这三个目录下的文件

User-agent: *

Disallow: /cgi-bin/

Disallow: /tmp/

Disallow: /~joe/

误区

　　【误区一】：网站上的所有文件都需要蜘蛛抓取，那就没必要在添加robots.txt文件了。反正如果该文件不存在，所有的搜索蜘蛛将默认能够访问网站上所有没有被口令保护的页面

　　每当用户试图访问某个不存在的URL时，服务器都会在日志中记录404错误（无法找到文件）。每当搜索蜘蛛来寻找并不存在的robots.txt文件时，服务器也将在日志中记录一条404错误，所以应该在网站中添加一个robots.txt

　　【误区二】：在robots.txt文件中设置所有的文件都可以被搜索蜘蛛抓取，这样可以增加网站的收录率

　　网站中的程序脚本、样式表等文件即使被蜘蛛收录，也不会增加网站的收录率，还只会浪费服务器资源。因此必须在robots.txt文件里设置不要让搜索蜘蛛索引这些文件

爬虫协议robots的更多相关文章

Natas3 Writeup（爬虫协议robots.txt）
Natas3: 页面提示本页面什么都没有. 在源码中发现提示:无信息泄露,谷歌这次不会发现它.提到了搜索引擎,猜测爬虫协议robots.txt中存在信息泄露,访问网站爬虫协议http://natas3 ...
Robots协议（爬虫协议、机器人协议）
Robots协议(也称为爬虫协议.机器人协议等)的全称是“网络爬虫排除标准”(Robots Exclusion Protocol),网站通过Robots协议告诉搜索引擎哪些页面可以抓取,哪些页面不能抓 ...
网络爬虫 robots协议 robots.txt
网络爬虫网络爬虫是一个自动提取网页的程序,它为搜索引擎从万维网上下载网页,是搜索引擎的重要组成.传统爬虫从一个或若干初始网页的URL开始,获得初始网页上的URL,在抓取网页的过程中,不断从当前页面上 ...
网络爬虫与web之间的访问授权协议——Robots
网站的管理者们通常会有这样一种心态:一方面期待百度.Google这样的搜索引擎来抓取网站的内容,另一方面又很厌恶其他来路不明的网络爬虫抓取自己的信息.正是因为这样,才有“好爬虫”.“坏爬虫”这样的说法 ...
爬虫协议 Tobots
一.简介 Robots 协议(也称为爬虫协议.机器人协议等)的全称是“网络爬虫排除标准”(Robots Exclusion Protocol),网站通过 Robots 协议告诉搜索引擎哪些页面可以抓取 ...
爬虫基础 - Robots协议
Robots协议指定一个robots.txt文件,告诉爬虫引擎怎么爬取 https://www.taobao.com/robots.txt User-agent: Baiduspider Allow ...
爬虫之robots.txt
robots是网站跟爬虫间的协议,用简单直接的txt格式文本方式告诉对应的爬虫被允许的权限,也就是说robots.txt是搜索引擎中访问网站的时候要查看的第一个文件. 当一个搜索蜘蛛访问一个站点时,它 ...
通过[蜘蛛协议]Robots.txt禁止搜索引擎收录的方法
什么是robots.txt文件? 搜索引擎通过一种程序robot(又称spider),自动访问互联网上的网页并获取网页信息. 您可以在您的网站中创建一个纯文本文件robots.txt,在这个文件中 ...
PYTHON网络爬虫与信息提取[网络爬虫协议](单元二)
robots.txt在网站的根目录下遵守自动或人工识别robots.txt再进行内容爬取约束性:建议性,不遵守协议,存在法律风险. 基本语法: User-agent: * Disallow: / ...

随机推荐

php中的date函数
一.带零 echo date('Y-m-d');2012-08-08二.不带零 echo date('Y-n-j');2012-8-8
Spring事务管理注意小事项
在service类前加上@Transactional,声明这个service所有方法需要事务管理.每一个业务方法开始时都会打开一个事务. Spring默认情况下会对运行期例外(RunTimeExcep ...
容器间通信的三种方式 - 每天5分钟玩转 Docker 容器技术（35）
容器之间可通过 IP,Docker DNS Server 或 joined 容器三种方式通信. IP 通信从上一节的例子可以得出这样一个结论:两个容器要能通信,必须要有属于同一个网络的网卡. 满足这 ...
AngularJS服务和路由
colnplie 网页加载的出现一次 link 元素每次改变的时候 **$watch** 监听列表 $scope.$watch("name",functio ...
Python3.5学习笔记-文件操作
在Python中,操作文件对象使用open函数来创建,下表列出了常用的操作file的函数: 序号方法及描述 1.file.close() 关闭文件.关闭后文件不能再进行读写操作. 2.file.fl ...
ASP.NET MVC5+EF6+EasyUI 后台管理系统（85）-Quartz 作业调度用法详解二
前言上一节我们学习了Quartz的基本用法这一节学习通过XML配置的形式来执行任务这一节主要认识一些属性,为下一步打基础代码下载:链接:http://pan.baidu.com/s/1ge6j ...
ASP搜索查询
html code: <form name="frm_Search" method="get" action="Search.asp" ...
Unity应用架构设计(12)——AOP思想的实践
想象一下,当程序所有的业务逻辑都完成的时候,你可能还来不及喘口气,紧张的测试即将来临.你的Boss告诉你,虽然程序没问题,但某些方法为什么执行这么慢,性能堪忧.领会了Boss的意图之后,漫长的排查问题 ...
使用three.js加载3dmax资源，以及实现场景中的阴影效果
使用three.js可以方便的让我们在网页中做出各种不同的3D效果.如果希望2D绘图内容,建议使用canvas来进行.但很多小伙伴不清楚到底如何为我们绘制和导入的图形添加阴影效果,更是不清楚到底如何导 ...
关于非阻塞connnect的看法
关于非阻塞connnect的总结在面试题中,看到有关于阻塞connect和非阻塞connect的区别: 显然,我们可以从阻塞和非阻塞的意思来回答,既然是阻塞,那么执行connect的操作会一直阻塞到 ...

爬虫协议robots

前面的话

概述

写法

用法

误区

爬虫协议robots的更多相关文章

随机推荐

热门专题