python网络爬虫（一）：网络爬虫科普与URL含义

1. 科普

通用搜索引擎处理的对象是互联网的网页，目前网页的数量数以亿计，所以搜索引擎面临的第一个问题是如何设计出高效的下载系统，已将海量的网页下载到本地，在本地形成互联网网页的镜像。网络爬虫就是担当此大任的。

抓取网页的过程其实和读者平时使用IE浏览器浏览网页的道理是一样的。比如说你在浏览器的地址栏中输入 www.baidu.com 这个地址。打开网页的过程其实就是浏览器作为一个浏览的“客户端”，向服务器端发送了一次请求，把服务器端的文件“抓”到本地，再进行解释、展现。浏览器的功能是将获取的HTML代码进行解析，然后将原始的网页转化为我们看到的网站页面。

网络爬虫最基本的思路就是：从一个页面开始，分析其中的url，提取出来，然后通过这些链接寻求下一个页面。如此往复。

2. 通用爬虫框架

首先，从互联网上精心选择一部分网页，以这些网页的链接地址最为种子URL，将这些种子RUL存入待抓取的URL队列（1），从待抓取的URL队列开始读取一个url(2)。其中的链接地址经过DNS解析（3）转化为网站服务器对应的IP地址。网页下载器根据IP地址向服务器发送请求，获得网页（5），下载好网页后一方面作为原始数据保存到页面库中，等待建立索引等后处理。另一方面将该网页的地址存到已经抓取的队列（8）（避免重复爬取）。对于刚才爬取的网页进行解析（6），抽取其中的url（7），对于不再已抓取URL队列中的URL存于待抓取URL队列（9）和。重复刚才的故事。

3. URL

爬虫最主要的处理对象是URL。简单说url就是输入的网址（例如：http://www.cnblogs.com/kaituorensheng/）。理解URL之前首先理解URI.

Web上每种可用的资源，如 HTML文档、图像、视频片段、程序等都由一个通用资源标志符(Universal Resource Identifier， URI)进行定位。
URI通常由三部分组成：

访问资源的命名机制
存放资源的主机名
资源自身的名称，由路径表示

如URI：http://www.why.com.cn/myhtml/html1223/

我们可以这样解释它：

这是一个可以通过HTTP协议访问的资源
位于主机 www.why.com.cn上
通过路径“/myhtml/html1223/”访问

URL是URI的一个子集。它是Uniform Resource Locator的缩写，译为“统一资源定位符”。
通俗地说，URL是Internet上描述信息资源的字符串，主要用在各种WWW客户程序和服务器程序上。
采用URL可以用一种统一的格式来描述各种信息资源，包括文件、服务器的地址和目录等。
URL的格式由三部分组成：

第一部分是协议(或称为服务方式)
第二部分是存有该资源的主机IP地址(有时也包括端口号)
第三部分是主机资源的具体地址，如目录和文件名等

第一部分和第二部分用“://”符号隔开
第二部分和第三部分用“/”符号隔开
第一部分和第二部分是不可缺少的，第三部分有时可以省略

3. 1 HTTP协议的URL示例
使用超级文本传输协议HTTP，提供超级文本信息服务的资源。
例：
其计算机域名为www.peopledaily.com.cn。
超级文本文件(文件类型为.html)是在目录 /channel下的welcome.htm。

3.2 文件的URL
用URL表示文件时，服务器方式用file表示，后面要有主机IP地址、文件的存取路径(即目录)和文件名等信息。
有时可以省略目录和文件名，但“/”符号不能省略。
例：file://ftp.yoyodyne.com/pub/files/foobar.txt
上面这个URL代表存放在主机ftp.yoyodyne.com上的pub/files/目录下的一个文件，文件名是foobar.txt。

python网络爬虫（一）：网络爬虫科普与URL含义的更多相关文章

python Cmd实例之网络爬虫应用
python Cmd实例之网络爬虫应用标签(空格分隔): python Cmd 爬虫废话少说,直接上代码 # encoding=utf-8 import os import multiproces ...
【Python网络爬虫一】爬虫原理和URL基本构成
1.爬虫定义网络爬虫,即Web Spider,是一个很形象的名字.把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛.网络蜘蛛是通过网页的链接地址来寻找网页的.从网站某一个页面(通常 ...
爬虫中网络请求的那些事之urllib库
目录爬虫之网络请求中的那些事 urllib库 urlopen函数 urlretrieve函数 urlencode.parse_qs函数 urlparse.urlsplit函数: request.Re ...
python爬虫(一)_爬虫原理和数据抓取
本篇将开始介绍Python原理,更多内容请参考:Python学习指南为什么要做爬虫著名的革命家.思想家.政治家.战略家.社会改革的主要领导人物马云曾经在2015年提到由IT转到DT,何谓DT,DT ...
Python爬虫-01：爬虫的概念及分类
目录 # 1. 为什么要爬虫? 2. 什么是爬虫? 3. 爬虫如何抓取网页数据? # 4. Python爬虫的优势? 5. 学习路线 6. 爬虫的分类 6.1 通用爬虫: 6.2 聚焦爬虫: # 1. ...
Python爬虫-什么是爬虫？
百度百科是这样定义爬虫的: 网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本.另外一些不常使用的名字还有蚂 ...
python应用之爬虫实战1 爬虫基本原理
知识内容: 1.爬虫是什么 2.爬虫的基本流程 3.request和response 4.python爬虫工具参考:http://www.cnblogs.com/linhaifeng/article ...
Python爬虫与反爬虫（7）
[Python基础知识]Python爬虫与反爬虫(7) 很久没有补爬虫了,相信在白蚁二周年庆的活动大厅比赛中遇到了关于反爬虫的问题吧这节我会做个基本分享. 从功能上来讲,爬虫一般分为数据采集,处理, ...
python爬虫之认识爬虫和爬虫原理
python爬虫之基础学习(一) 网络爬虫网络爬虫也叫网络蜘蛛.网络机器人.如今属于数据的时代,信息采集变得尤为重要,可以想象单单依靠人力去采集,是一件无比艰辛和困难的事情.网络爬虫的产生就是代替人 ...

随机推荐

Python脚本控制的WebDriver 常用操作 <十七> 获取测试对象的属性及内容
测试用例场景获取测试对象的内容是前端自动化测试里一定会使用到的技术.比如我们要判断页面上是否显示了一个提示,那么我们就需要找到这个提示对象,然后获取其中的文字,再跟我们的预期进行比较.在webdri ...
Python数据结构——链表的实现
链表由一系列不必在内存中相连的结构构成,这些对象按线性顺序排序.每个结构含有表元素和指向后继元素的指针.最后一个单元的指针指向NULL.为了方便链表的删除与插入操作,可以为链表添加一个表头. 删除操作 ...
WPF 气泡尖角在左边、下面、右边、上面
由于项目需要,在弄一个气泡提示框,根据网上资料,使用Path可以将气泡画出来,下面是我画出来的. 1.气泡尖角在左边的: <Path Stroke="Black" Strok ...
JSON对象配合jquery.tmpl.min.js插件，手动攒出一个table
jquery.tmpl.min.js 首先下载这个插件 1.绑定json那头的键 //TemplateDDMX 这个是这段JS的ID,这个必须写!!!!!! //${}为json的键的值,必须要填写正 ...
管道和FIFO
pipe 子进程从终端读取一个文件名, 通过管道将文件名传递给父进程父进程收到文件名后, 读取文件内容并通过管道传递给子进程子进程接收到文件内容并输出到终端 #include <stdio. ...
awk简明教程
我在这里的教程并不想面面俱到,全是示例,基本无废话. 我只想达到两个目的: 1)你可以在乘坐公交地铁上下班,或是在坐马桶拉大便时读完(保证是一泡大便的工夫). 2)我只想让这篇博文像一个火辣的脱衣舞女 ...
python之函数嵌套
python很多特性与JavaScript是相似甚至相同的: 1. 无类型 2. 函数亦对象 .... 自然: python也允许函数嵌套, 这与JavaScript中函数闭包的作用一样....
多路选择器（multiplexer）简介
1.多路器简介简称:多路器功能:多输入单输出组合逻辑电路 2.verilog代码实现: module Mux_8(addr,in1,in2,in3,in4,in5,in6,in7,in8 ...
【转载】link和@import的区别
link和@import的区别原文地址:http://www.cnblogs.com/zbo/archive/2010/11/17/1879590.html 页面中使用CSS的方式主要有3种:行内添 ...
DB天气app冲刺二阶段第十天
昨天困到不行了所以就写了那么几句..所以今天好好写写了要.. 今天的收获了一个很重要的问题就还是api接口的事情,以前的那个接口虽然能用但是总是不稳定,今天由决定百度的一下然后就发现了一个很好用的 ...

python网络爬虫（一）：网络爬虫科普与URL含义

python网络爬虫（一）：网络爬虫科普与URL含义的更多相关文章

随机推荐

热门专题