Python3爬虫（一）HTTP相关基础

Infi-chu:

http://www.cnblogs.com/Infi-chu/

一、URI、URL、URN、HTTP

URI：统一资源标志符

URL：是URI的一个子集

URN：是URI的另一个子集，统一资源名称

HTTP协议：
　　超文本传输协议，是一个基于“请求与响应”模式的、无状态的引用层协议。
　　HTTP协议采用URL作为定位网络资源的标识。
　　URL格式 http://host[:port][path]

二、请求

1.请求方法

2.请求的网址

3.请求头

4.请求体

三、响应：

1.响应状态码

2.响应头

3.响应体

四、GET和POST的区别：

1.GET相对于POST较不安全，GET将参数包含在URL里面，POST是通过表单形式传输的，包含在请求体中。

2.GET最多提交的数据大小为1024字节，POST没有限制

3.GET效率较高与POST

五、DOM

1.含义：文档对象模型，定义了访问HTML和XML文档标准

2.DOM：

　　1.核心DOM：针对任何结构化文档的标准模型

　　2.XML DOM：针对XML文档的标准模型

　　3.HTML DOM：针对HTML文档的标准模型

　　　　a.整个文档是一个文档节点

　　　　b.每个HTML元素是元素节点

　　　　c.HTML元素内的文本是文本节点

　　　　d.每个HTML属性是属性节点

　　　　e.注释是注释节点

【注】

节点树中的节点，批次拥有层级关系，常用的有父节点（parent）、子节点（child）、兄弟节点（sibling）

六、爬虫爬取的步骤：

1.获取网页

2.提取信息

3.保存数据

4.自动化爬取程序

七、代理的作用：

1.突破自身IP访问限制，访问一些平时不能访问的站点

2.访问一些单位或团体的内部资源

3.提高访问速度

4.隐藏真实IP

八、代理的分类

1.根据协议分类：

　　协议　　一般开放端口

　　FTP　　21、2121

　　HTTP 80、8080、3128

　　SSL/TLS 443

　　RTSP　 554

　　Telnet　 23

　　POP3/SMTP　　110/25

　　SOCKS　　1080

2.根据匿名程度分类：

　　a.高度匿名代理

　　b.普通匿名代理

　　c.透明代理

　　d.间谍代理

Python3爬虫（一）HTTP相关基础的更多相关文章

Python 爬虫六性能相关
前面已经讲过了爬虫的两大基础模块: requests模块:用来伪造请求爬取数据 bs4模块:用来整理,提取数据当我们真正的开始有需求的时候通常都是批量爬取url这样的.那如何批量爬取呢? 按照正常的 ...
Python3 爬虫之 Scrapy 核心功能实现（二）
博客地址:http://www.moonxy.com 基于 Python 3.6.2 的 Scrapy 爬虫框架使用,Scrapy 的搭建过程请参照本人的另一篇博客:Python3 爬虫之 Scrap ...
Python3爬虫系列：理论+实验+爬取妹子图实战
Github: https://github.com/wangy8961/python3-concurrency-pics-02 ,欢迎star 爬虫系列: (1) 理论 Python3爬虫系列01 ...
python3爬虫系列19之反爬随机 User-Agent 和 ip代理池的使用
站长资讯平台:python3爬虫系列19之随机User-Agent 和ip代理池的使用我们前面几篇讲了爬虫增速多进程,进程池的用法之类的,爬虫速度加快呢,也会带来一些坏事. 1. 前言比如随着我们爬虫 ...
小白学 Python 爬虫（35）：爬虫框架 Scrapy 入门基础（三） Selector 选择器
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（38）：爬虫框架 Scrapy 入门基础（六） Item Pipeline
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（40）：爬虫框架 Scrapy 入门基础（七）对接 Selenium 实战
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（41）：爬虫框架 Scrapy 入门基础（八）对接 Splash 实战
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
Python3爬虫：（一）爬取拉勾网公司列表
人生苦短,我用Python 爬取原因:了解一下Python工程师在北上广等大中城市的薪资水平与入职前要求. Python3基础知识 requests,pyquery,openpyxl库的使用爬取前的 ...
Python爬虫入门有哪些基础知识点
1.什么是爬虫爬虫,即网络爬虫,大家可以理解为在网络上爬行的一直蜘蛛,互联网就比作一张大网,而爬虫便是在这张网上爬来爬去的蜘蛛咯,如果它遇到资源,那么它就会抓取下来.想抓取什么?这个由你来控制它咯. ...

随机推荐

MySQL之innochecksum初探
innochecksum是一个用于校验innodb表空间文件完整性的工具,这是一个官方自带的工具,关于它的介绍,可以查看MySQL官方文档,下文主要是通过innodb_ruby来对innochecks ...
Struts的学习-例子
一.新建空项目user和配置maven实现下面的页面 1.配置内容 2.编写struts.xml实现页面  <package name=&q ...
ul自适应li问题
内容提要: li浮动时ul高度为0,解决ul自适应高度的几种方法在网页设计中,常常需要对li标签做浮动效果,但是在不同浏览器中会遇到兼容性问题,比如IE中会出现ul高度为0的情况,是效果不能达到预期 ...
[EffectiveC++]item40：明智而审慎地使用多重继承
推荐一个Chrome扩展应用，能够自动去除CSDN广告
作为一个程序员,每天编程遇到问题时,少不了前往国内著名的CSDN网站上查信息,看是否有同行遇到类似问题.很多时候根据遇到问题的错误消息进行搜索,结果都是一篇篇CSDN博客.这些博客打开后都会显示很多广 ...
POJ 3734 生成函数
题意:一排n长度的砖,有四种颜色,红色绿色是偶数,有少染色方式. 分析: 泰勒展开式: chx = (e^x+e^(-x))/2 = 1 + x^2/2! + x^4/4! + x^6/6! + .. ...
[19/03/12-星期二] 数组_遍历(for-each)&复制&java.util.Arrays类
一.遍历 for-each即增强for循环,是JDK1.5新增加的功能,专门用于读取数组或集合中所有的元素,即对数组进行遍历. //数组遍历 for-each public class Test_03 ...
Golang Failpoint 的设计与实现
小结: 1. https://mp.weixin.qq.com/s/veIoupLjM4l5SUVC6h_Gkw Golang Failpoint 的设计与实现原创: 龙恒 PingCAP 今天
2018.10.14 MyBatis配置实现对用户的增删改查
记得导入对应的Jar包 ant-1.9.6.jar ant-launcher-1.9.6.jar asm-5.2.jar cglib-3.2.5.jar commons-logging-1.2.jar ...
javascript运算符——条件、逗号、赋值、()和void运算符（转载）
原文出自作者:小火柴的蓝色理想 javascript中运算符总共有46个,除了前面已经介绍过的算术运算符.关系运算符.位运算符.逻辑运算符之外,还有很多运算符.本文将介绍条件运算符.逗号运算符. ...

Python3爬虫（一）HTTP相关基础

Python3爬虫（一）HTTP相关基础的更多相关文章

随机推荐

热门专题