【Python实例二】BeautifulSoup爬虫简单实践

前言

前面安装了BeautifulSoup库，现在就来实现一下吧。

一、Urllib库的使用

二、BeautifulSoup的使用

三、一个示例

------------------------------------------------------------------------------------------------------------

正文

一、Urllib库的使用

看了一些简单爬虫的资料，都用到了Urllib库，想必这也是与web爬取数据的基础，因此先去看了看Urllib库的相关内容。

按我自己的理解，爬取网页的内容其实就是先把页面的信息先通过Urllib库抓取到本地，然后再通过BeautifulSoup库来精细划分抓取得到的页面内容数据。

使用Urllib库的最基本方法其实就三行代码（如下）：

# -*- coding: utf-8 -*-

import urllib

res = urllib.urlopen("http://www.baidu.com")

print res.read()

具体解释：

urllib库一般安装完Python后就自带在其安装包里面了，所以直接使用"import urllib"语句就能直接使用了；
urllib.urlopen(url[, data[, proxies]]) :创建一个表示远程url的类文件对象，然后像本地文件一样操作这个类文件对象来获取远程数据。

（参数url表示远程数据的路径，一般是网址；参数data表示以post方式提交到url的数据）

urlopen()返回一个类文件对象（此处用res来获取该对象），它提供了如下方法：read() , readline() , readlines() , fileno() , close()
res.read()返回获取到的网页内容

最后输出的内容如下所示（相当于查看网页源码看到的内容）

二、BeautifulSoup的使用

在用Urllib库从网页上得到了网页数据后，就要开始使用BeautifulSoup了。

1. 首先创构造一个BeautifulSoup对象

下面有一些最简单的例子：

（1）通过字符串创建BeautifulSoup对象

# -*- coding: utf-8 -*-

from bs4 import BeautifulSoup

helloworld = '<p>Hello World</p>'

soup_string = BeautifulSoup(helloworld, "html.parser")

print soup_string

结果：

（2）通过类文件对象创建BeautifulSoup对象

# -*- coding: utf-8 -*-

import urllib

from bs4 import BeautifulSoup

url = "http://www.baidu.com"

page = urllib.urlopen(url)

soup = BeautifulSoup(page，"html.parser")

print soup

因为前面说的Urllib库用urlopen()返回的就是一个类文件对象，所以这里的结果和之前Urllib中对象调用read()得到的结果是一样的。

（3）通过本地文件对象创建BeautifulSoup对象

# -*- coding: utf-8 -*-

import urllib

from bs4 import BeautifulSoup

with open('index.html','r') as foo_file :

    soup_foo = BeautifulSoup(foo_file, "html.parser")

print soup_foo

【注意】以上的三种方法创建BeautifulSoup对象使用的语句是：BeautifulSoup(urllib库对象名, "html.parser")，其中标红的部分"html.parser"是我时间之后发现要加的，很多教程里面是直接使用 BeautifulSoup(urllib库对象名)来创建，但是我运行的时候会有一个warning：

于是就按照提示上说的，加上了"html.parser"，运行之后果然正常了，所以如果你也遇到一样的问题，就还是加上它吧:)

2.使用BeautifulSoup库的 find()和findAll()函数

在构造好BeautifulSoup对象后，借助find()和findAll()这两个函数，可以通过标签的不同属性轻松地把繁多的html内容过滤为你所想要的。

这两个函数的使用很灵活，可以：通过tag的id属性搜索标签、通过tag的class属性搜索标签、通过字典的形式搜索标签内容返回的为一个列表、通过正则表达式匹配搜索等等

基本使用格式：

pid = soup.find(attrs={"id":"aa"})

pid = soup.findAll('a',{'class':'sister'})

三. 一个示例

这个示例是我在查找资料的时候看到的，按照代码运行得出来，理解起来也简单，因此就借鉴一下

（原文地址：http://www.cnblogs.com/hearzeus/p/5151449.html）

下面是代码和效果：

# -*- coding: utf-8 -*-

import urllib

from bs4 import BeautifulSoup

res = urllib.urlopen("http://www.douban.com/tag/%E5%B0%8F%E8%AF%B4/?focus=book")

soup = BeautifulSoup(res,"html.parser")

book_div = soup.find(attrs={"id":"book"})

book_a = book_div.findAll(attrs={"class":"title"})

for book in book_a:

    print book.string

【Python实例二】BeautifulSoup爬虫简单实践的更多相关文章

kafka原理和实践（二）spring-kafka简单实践
系列目录 kafka原理和实践(一)原理:10分钟入门 kafka原理和实践(二)spring-kafka简单实践 kafka原理和实践(三)spring-kafka生产者源码 kafka原理和实践( ...
【Python实例二】之前期准备：Windows下的BeautifulSoup安装
前言一直久闻Python的爬虫很高效,而且操作便捷,因此决定开始练习爬虫的相关内容. 首先尝试的是Python的爬虫利器之一:BeautifulSoup.(这名字听起来就有种想要去探究的兴趣.... ...
python实例2-写一个爬虫下载小功能
主要是通过url,和re两个模块对一个网页的固定图片进行模糊匹配后下载下来. #! /usr/bin/python import re import urllib def gethtml(url): ...
opencv python 图像二值化/简单阈值化/大津阈值法
pip install matplotlib 1简单的阈值化 cv2.threshold第一个参数是源图像,它应该是灰度图像. 第二个参数是用于对像素值进行分类的阈值, 第三个参数是maxVal,它表 ...
python实例二
https://www.cnblogs.com/evablogs/p/6754974.html 题目:企业发放的奖金根据利润提成.利润(I)低于或等于10万元时,奖金可提10%:利润高于10万元,低于 ...
python学习笔记（二）之python简单实践
1 安装python开发环境 Linux环境下自动安装好了python,可以通过以下命令更新到python最新版本. #echo "alias python=/usr/bin/python3 ...
Python初学者之网络爬虫(二)
声明:本文内容和涉及到的代码仅限于个人学习,任何人不得作为商业用途.转载请附上此文章地址本篇文章Python初学者之网络爬虫的继续,最新代码已提交到https://github.com/octans ...
python beautifulsoup爬虫
爬虫这个听起来很 hack 的名字,是我学习 python 的诱因.当 python 基础学习到一定程度(基本语法,数据类型掌握) 就可以开启自己的小爬虫了.毕竟实践才是提高的最快途径.废话说完了,下 ...
初探爬虫 ——《python 3 网络爬虫开发实践》读书笔记
零.背景之前在 node.js 下写过一些爬虫,去做自己的私人网站和工具,但一直没有稍微深入的了解,借着此次公司的新项目,体系的学习下. 本文内容主要侧重介绍爬虫的概念.玩法.策略.不同工具的列举和 ...

随机推荐

TFTP & commons-net-3.3.jar
项目需求:上传文件到服务器,TFTP 了解TFTP http://wenku.baidu.com/link?url=MhRVgIySotFMkm5ar6B71zROPMoqC7cd5cSbKJo2kx ...
Anytime项目开发记录2
注册,登陆于密码找回.这是这次记录的主要内容. 首先,我们来看类图: 因为一直在改,所以与第二篇介绍项目框架时的图会有一些不一样. 代码都是非常简单的. 由于在注册和登陆这里,需要弹出一些对话框告诉用 ...
「日常训练」 Mike and Fun (CFR305D2B)
题意(CodeForces 548B) 每次对01矩阵中的一位取反,问每次操作后,单列中最长连续1的长度. 分析非常非常简单,但是我当时训练的时候WA了四次...无力吐槽了,人间不值得.jpg 代 ...
svm+voting
# encoding:utf-8 import getopt from sklearn.preprocessing import MinMaxScaler import os,time from mu ...
Visual Studio 2010安装包
点击下载
Alpha阶段展示
程序员杀产品经理祭天(SacrificePM)团队 1.团队成员简介和个人博客地址故事我们队伍的建立过程稍具戏剧性,大家看我们也颇为奇怪,这么一支8人队伍是怎么诞生的呢?其实我们原本分属三组,而第 ...
【转】Virtual DOM
前言 React 好像已经火了很久很久,以致于我们对于 Virtual DOM 这个词都已经很熟悉了,网上也有非常多的介绍 React.Virtual DOM 的文章.但是直到前不久我专门花时间去学习 ...
POI 导入一直报400问题
排查过程:1.400一般都是参数或者请求不对,但是我这个情况是本地好用,只是服务器有问题,所以排除了传值的格式等问题. 2.服务器和本地网络隔离,所以没办法比较代码,分两次全量覆盖了html和js部分 ...
安装和配置hadoop集群步骤
hadoop集群的安装步骤和配置 hadoop是由java语言编写的,首先我们肯定要在电脑中安装jdk,配置好jdk的环境,接下来就是安装hadoop集群的步骤了,在安装之前需要创建hadoop用户组 ...
【bzoj4619】[Wf2016]Swap Space 贪心
题目描述你有许多电脑,它们的硬盘用不同的文件系统储存数据.你想要通过格式化来统一文件系统.格式化硬盘可能使它的容量发生变化.为了格式化,你需要买额外的硬盘.当然,你想要买容量最小的额外储存设备以便省 ...

【Python实例二】BeautifulSoup爬虫简单实践

【Python实例二】BeautifulSoup爬虫简单实践的更多相关文章

随机推荐

热门专题