前言

还记得是大学2年级的时候，偶然之间看到了学长在学习python；我就坐在旁边看他敲着代码，感觉很好奇。感觉很酷，从那之后，我就想和学长一样的厉害，就想让学长教我，请他吃了一周的饭，他答应了。从此，我踏上了python编程的道路。在那之前，我成天到晚都是在打lol；但是从那天之后，几乎很少很少了。

然而到如今，这一学就是2年，我已经不再是一名小白。是的，我爱上了编程，爱上了python。如今，人工智能的时代已经来临，作为它的首选语言 python。我很自豪，今天给大家分享一下我当初学习爬虫的心得体会。

正文

〇. python 基础

先放上python 3 的官方文档:https://docs.python.org/3/ (看文档是个好习惯)

关于python 3 基础语法方面的东西,网上有很多,大家可以自行查找.

一. 最简单的爬取程序

爬取百度首页源代码:

来看上面的代码:

对于python 3来说,urllib是一个非常重要的一个模块，可以非常方便的模拟浏览器访问互联网,对于python 3 爬虫来说, urllib更是一个必不可少的模块,它可以帮助我们方便地处理URL.
urllib.request是urllib的一个子模块,可以打开和处理一些复杂的网址

The urllib.requestmodule defines functions and classes which help in opening URLs (mostly HTTP) in a complex world — basic and digest authentication, redirections, cookies and more.

urllib.request.urlopen()方法实现了打开url,并返回一个 http.client.HTTPResponse对象,通过http.client.HTTPResponse的read()方法,获得response body,转码最后通过print()打印出来.

urllib.request.urlopen(url, data=None, [timeout, ]***, cafile=None, capath=None, cadefault=False, context=None)For HTTP and HTTPS URLs, this function returns a http.client.HTTPResponseobject slightly modified.< 出自: https://docs.python.org/3/library/urllib.request.html >

decode('utf-8')用来将页面转换成utf-8的编码格式，否则会出现乱码

二模拟浏览器爬取信息

在访问某些网站的时候，网站通常会用判断访问是否带有头文件来鉴别该访问是否为爬虫，用来作为反爬取的一种策略。

先来看一下Chrome的头信息（F12打开开发者模式）如下：

如图，访问头信息中显示了浏览器以及系统的信息（headers所含信息众多，具体可自行查询）

Python中urllib中的request模块提供了模拟浏览器访问的功能，代码如下：

from urllib import requesturl = 'http://www.baidu.com'# page = request.Request(url)# page.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36')headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36'}page = request.Request(url, headers=headers)page_info = request.urlopen(page).read().decode('utf-8')print(page_info)

可以通过add_header(key, value) 或者直接以参数的形式和URL一起请求访问，urllib.request.Request()

urllib.request.Request(url, data=None, headers={}, origin_req_host=None, unverifiable=False, method=None)

三爬虫利器Beautiful Soup

Beautiful Soup是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.

文档中的例子其实说的已经比较清楚了，那下面就以爬取简书首页文章的标题一段代码来演示一下：

先来看简书首页的源代码：

可以发现简书首页文章的标题都是在<a/>标签中，并且class='title',所以，通过

find_all('a', 'title')

便可获得所有的文章标题，具体实现代码及结果如下：

# -*- coding:utf-8 -*-from urllib import requestfrom bs4 import BeautifulSoupurl = r'http://www.jianshu.com'# 模拟真实浏览器进行访问headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36'}page = request.Request(url, headers=headers)page_info = request.urlopen(page).read()page_info = page_info.decode('utf-8')# 将获取到的内容转换成BeautifulSoup格式，并将html.parser作为解析器soup = BeautifulSoup(page_info, 'html.parser') # 以格式化的形式打印html# print(soup.prettify())titles = soup.find_all('a', 'title') # 查找所有a标签中class='title'的语句# 打印查找到的每一个a标签的stringfor title in titles: print(title.string)

Beautiful Soup支持Python标准库中的HTML解析器,还支持一些第三方的解析器,下表列出了主要的解析器,以及它们的优缺点:

四将爬取的信息存储到本地

之前我们都是将爬取的数据直接打印到了控制台上，这样显然不利于我们对数据的分析利用，也不利于保存，所以现在就来看一下如何将爬取的数据存储到本地硬盘。

1 对.txt文件的操作

读写文件是最常见的操作之一，python3 内置了读写文件的函数：open

open(file, mode='r', buffering=-1, encoding=None, errors=None, newline=None, closefd=True, opener=None))Open file and return a corresponding file object. If the file cannot be opened, an OSErroris raised.

其中比较常用的参数为file和mode，参数file为文件的路径，参数mode为操作文件的方式（读/写），函数的返回值为一个file对象，如果文件操作出现异常的话，则会抛出一个OSError

还以简书首页文章题目为例，将爬取到的文章标题存放到一个.txt文件中，具体代码如下：

# -*- coding:utf-8 -*-from urllib import requestfrom bs4 import BeautifulSoupurl = r'http://www.jianshu.com'headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36'}page = request.Request(url, headers=headers)page_info = request.urlopen(page).read().decode('utf-8')soup = BeautifulSoup(page_info, 'html.parser')titles = soup.find_all('a', 'title')try: # 在E盘以只写的方式打开/创建一个名为 titles 的txt文件 file = open(r'E:	itles.txt', 'w') for title in titles: # 将爬去到的文章题目写入txt中 file.write(title.string + '
')finally: if file: # 关闭文件（很重要） file.close()

open中mode参数的含义见下表：

其中't'为默认模式，'r'相当于'rt',符号可以叠加使用，像'r+b'

另外，对文件操作一定要注意的一点是：打开的文件一定要关闭，否则会占用相当大的系统资源，所以对文件的操作最好使用try:...finally:...的形式。但是try:...finally:...的形式会使代码显得比较杂乱，所幸python中的with语句可以帮我们自动调用close（）而不需要我们写出来，所以，上面代码中的try:...finally:...可使用下面的with语句来代替：

with open(r'E:	itle.txt', 'w') as file: for title in titles: file.write(title.string + '
')

效果是一样的，建议使用with语句

2 图片的储存

有时候我们的爬虫不一定只是爬取文本数据，也会爬取一些图片，下面就来看怎么将爬取的图片存到本地磁盘。

我们先来选好目标，知乎话题：女生怎么健身锻造好身材？ (单纯因为图多，不要多想哦（# _ # ) ）

看下页面的源代码，找到话题下图片链接的格式，如图：

可以看到，图片在img标签中，且class=origin_image zh-lightbox-thumb，而且链接是由.jpg结尾，我们便可以用Beautiful Soup结合正则表达式的方式来提取所有链接，如下:

links = soup.find_all('img', "origin_image zh-lightbox-thumb",src=re.compile(r'.jpg$'))

提取出所有链接后，使用request.urlretrieve来将所有链接保存到本地

Copy a network object denoted by a URL to a local file. If the URL points to a local file, the object will not be copied unless filename is supplied. Return a tuple (filename, headers)where filename is the local file name under which the object can be found, and headers is whatever the info()method of the object returned by urlopen()returned (for a remote object). Exceptions are the same as for urlopen().

具体实现代码如下：

# -*- coding:utf-8 -*-import timefrom urllib import requestfrom bs4 import BeautifulSoupimport reurl = r'https://www.zhihu.com/question/22918070'headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36'}page = request.Request(url, headers=headers)page_info = request.urlopen(page).read().decode('utf-8')soup = BeautifulSoup(page_info, 'html.parser')# Beautiful Soup和正则表达式结合，提取出所有图片的链接（img标签中，class=**，以.jpg结尾的链接）links = soup.find_all('img', "origin_image zh-lightbox-thumb",src=re.compile(r'.jpg$'))# 设置保存的路径，否则会保存到程序当前路径local_path = r'E:Pic'for link in links: print(link.attrs['src']) # 保存链接并命名，time防止命名冲突 request.urlretrieve(link.attrs['src'], local_path+r'%s.jpg' % time.time())

运行结果

一入爬虫深似海，从此游戏是路人！总结我的python爬虫学习笔记！的更多相关文章

「一入 Java 深似海」系列课程
第一期「一入 Java 深似海」系列课程 - 第一期第一节:Java 语言基础
一入OI深似海 3 —— 纪念我最后一次PJ（上）
其实在比赛前一天中午上车前, 我还在机房打 I wanna, 感觉就是去杭州旅游的. 诶,还真是这样! 我和jwj在绍兴服务区买了金拱门, 拎着吃的回到车上的时候, 迎面而来羡慕的小眼神. 下午很早就 ...
一入OI深似海 4 —— 纪念我最后一次PJ（中）
不知道怎么回事,直到比赛前10分钟才放我们进考场. 考场在体育馆里面,很大很壮观. 我匆匆忙忙地找到位子,屁股还没坐热,被老师告知不能带水. what?! 于是我只好把水放在统一放私人物品的地方. 电 ...
一入OI深似海 2 —— 初中三年，颓废PJ
初中,OI似乎没有真正进入我的生活. 三年PJ在我的生活中占比很少. 每天都是平淡无奇的文化课,晚上在写完作业之后还能休息一会儿. 每周六下午的OI课很短暂, 大部分时间我还是把我的重心放在学习上. ...
一入OI深似海 1 —— 偶然遇见，命运选择
记得还是三年级(还是四年级?人老了都忘了)吧, 那时候我还是个愣头青, 学校的编程班在每个班强制招人, 我就屁颠屁颠被赶去去上课了. 一开始的课完全听不懂, 导致没过多久我同班的人一个个走了, 我为了 ...
「一入 Java 深似海」系列课程 - 第一期
10分30秒开始小马哥技术博客: https://mercyblitz.github.io/ github地址: https://github.com/mercyblitz 33分28 https: ...
一入 Java 深似海【目录】-----------------------------------------【目录】
[目录] 一.计算机相关知识 1. 2. 3. 二.Java 基础语法 1.Java 语言概述 2.数据类型 & 变量与常量 & 注释 3.运算符 4.流程控制语句之顺序结构 5. ...
一入Java深似海
Java的基础语法一个java程序可以认为是一系列对象的集合,而这些对象通过调用彼此的方法来写协同工作.下面简要介绍下类.对象.方法和实例变量的概念. 对象: 对象是一个类的实例,有状态和行为.例如 ...
python库学习笔记——爬虫常用的BeautifulSoup的介绍
1. 开启Beautiful Soup 之旅在这里先分享官方文档链接,不过内容是有些多,也不够条理,在此本文章做一下整理方便大家参考. 官方文档 2. 创建 Beautiful Soup 对象首先 ...

随机推荐

base64详解及实现
概述 base64 说起来大家应该都是很熟悉的,很多类型的数据都可以转成base64的编码规则,例如图片,pdf,文本,邮件内容等. 什么是base64 根据RFC2045的定义,base64被定义为 ...
Kruskal算法（题目还是：畅通工程）
那还是先把题目丢出来,是HDU上的一道题畅通工程 Time Limit: 1000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Jav ...
剑指Offer 19. 顺时针打印矩阵（其他）
题目描述输入一个矩阵,按照从外向里以顺时针的顺序依次打印出每一个数字,例如,如果输入如下4 X 4矩阵: 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 则依次打印出数 ...
I/O简介
用户空间是常规进程所在区域.JVM就是常规进程,驻守于用户空间.用户空间是非特权区域,在该区域执行的代码不能直接访问硬件设备. 内核空间是操作系统所在区域.内核代码有特别的权利:它能与设备控制器通讯, ...
erlang工作总结
总结下自己在做erlang的经验 1.不管什么样的情况下,一定要关注好函数的返回值再来使用,不知道返回值盲目的使用的话,不仅不能达到目标,而且不存在代码/报错提醒.得不偿失. 2.构思好自己的想法,定 ...
【转】@RequestBody注解出现的三点错误
错误1 { "timestamp": 1529747704259, "status": 415, "error": ...
QT | 记录自己遇到的报错
QT 常见报错,及相应对策 0. 遇到所有莫名其妙的问题(完全按照教程,但一直报错) 删除工程文件同级目录下的构建文件(以build开头的文件夹) 重新执行qmake 重新构建项目检查所有的路径问题 ...
[LeetCode&Python] Problem 844. Backspace String Compare
Given two strings S and T, return if they are equal when both are typed into empty text editors. # m ...
Linux搭建bugfree
1.xampp安装包地址: 链接:https://pan.baidu.com/s/1Th2QvF77jvIGzMROoF2rbg 密码:yoar 2.因为我用的是xshell5连接Linux服务器,直 ...
一款我常用到的手机app
我从初中开始接触电子书,后来渐渐养成了看电子书的习惯.在阅读电子书的过程中自然要接触到各种各样的阅读类的手机app,比如书旗.qq阅读.百度阅读器等等.个人感觉掌阅使用起来好一些. 首先,它的界面很简 ...

一入爬虫深似海，从此游戏是路人！总结我的python爬虫学习笔记！

正文

一入爬虫深似海，从此游戏是路人！总结我的python爬虫学习笔记！的更多相关文章

随机推荐

热门专题