使用XPath爬取网页数据

　　我们以我的博客为例，来爬取我所有写过的博客的标题。

　　首先，打开我的博客页面，右键“检查”开始进行网页分析。我们选中博客标题，再次右键“检查”即可找到标题相应的位置，我们继续点击右键，选择Copy，再点击Copy XPath，即可获得对应的XPath编码，我们可以先将它保存在一个文本文档中。

　　我们再多次对各个标题重复以上操作，即可得到关于标题的XPath编码的规律。我们不难看出，对于我的博客的标题的XPath编码格式为“//*[@id="mainContent"]/div/div[n]/div[2]/a”。

　　又因为我的博客共有2页，所以我们还需找到网页url的规律，经过分析，我们发现格式为'https://www.cnblogs.com/Chen-K/default.html?page='+str(i+1)。

　　下面便可开始写代码：

import requests

from lxml import etree

for i in range(0,2):

    url = 'https://www.cnblogs.com/Chen-K/default.html?page='+str(i+1)

    html = requests.get(url)

    etree_html = etree.HTML(html.text)

    a = etree_html.xpath('//*[@id="mainContent"]/div/div/div[2]/a/text()') # 加text()是为了将结果以txt格式输出

    for j in a:

        print(j)

　　运行结果：

　　若是要爬取其他的数据，我们只需复制下来相应的XPath编码即可。操作过程大同小异，我们便不再多加赘述，下面我们以爬取每个博客的url为例：

import requests

from lxml import etree

for i in range(0,2):

    url = 'https://www.cnblogs.com/Chen-K/default.html?page='+str(i+1)

    html = requests.get(url)

    etree_html = etree.HTML(html.text)

    a = etree_html.xpath('//*[@id="mainContent"]/div/div/div[2]/a/@href')

    for j in a:

        print(j)

　　运行结果：

　　XPath与BeautifulSoup相比，操作更加简单，代码也更为简洁，如果需要爬取比较多的信息，使用XPath将会大大减少我们的工作量。当然，我们想要使用XPath，必须先安装lxml库，而我们有两个方法可以安装lxml库。

　　1、使用pip安装

　　我们只需打开命令行，输入指令“pip install lxml”，然后等待安装即可。

　　2、使用PyCharm安装

　　我们点击“文件”，找到设置，打开后点击右边的加号，然后在上面的搜索框中输入lxml，然后点击下方install，等待安装即可。

　　安装好lxml库之后，我们便可以使用其相关功能了。

使用XPath爬取网页数据的更多相关文章

爬虫系列4：Requests+Xpath 爬取动态数据
爬虫系列4:Requests+Xpath 爬取动态数据 [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]:参 ...
使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...
使用 Python 爬取网页数据
1. 使用 urllib.request 获取网页 urllib 是 Python 內建的 HTTP 库, 使用 urllib 可以只需要很简单的步骤就能高效采集数据; 配合 Beautiful 等 ...
03：requests与BeautifulSoup结合爬取网页数据应用
1.1 爬虫相关模块命令回顾 1.requests模块 1. pip install requests 2. response = requests.get('http://www.baidu.com ...
Selenium+Tesseract-OCR智能识别验证码爬取网页数据
1.项目需求描述通过订单号获取某系统内订单的详细数据,不需要账号密码的登录验证,但有图片验证码的动态识别,将获取到的数据存到数据库. 2.整体思路 1.通过Selenium技术,无窗口模式打开浏览器 ...
【推荐】oc解析HTML数据的类库（爬取网页数据）
TFhpple是一个用于解析html数据的第三方库,本人感觉功能还算可以,只不过在使用前必须配置项目. 配置 1.导入libxml2.tbd 2.设置编译路径使用这里使用一个例子来说明 http: ...
使用puppeteer爬取网页数据实践小结
简单介绍Puppeteer Puppeteer是一个Node库,它通过DevTools协议提供高级API来控制Chrome或Chromium.Puppeteer默认以无头方式运行,但可以配置为有头方式 ...

随机推荐

如何单独编译Linux内核的某个模块?
1. 配置该模块为[M] 2. 编译 make modules SUBDIRS=./drivers/rtc (5.3的内核为make modules M=./drivers/rtc) 3. 安装 ma ...
opencv_traincascade级联训练人脸数据
正负样本格式: 正样本灰度化 24*24 2000张负样本灰度化 50*50 1000张训练过程第一步:dir /b >pos.txt 以及dir /b >neg.txt ...
阶段5 3.微服务项目【学成在线】_day04 页面静态化_16-页面静态化-模板管理-模板制作
这是轮播图的原始文件运行门户需要把 nginx启动起来单独运行轮播图.把里面的css的引用都加上网址的url 这就是单独访问到的轮播图的效果轮播图模板的地址: 阶段5 3.微服务项目[学成在线] ...
Hadoop 部署之 ZooKeeper (二)
目录一.Zookeeper功能简介二.ZooKeeper基本概念 1.集群角色三.ZooKeeper 的安装 1.下载安装(在datanode节点安装) 2.配置ZooKeeper环境变量 3. ...
unity模型网址
http://www.rr-sc.com/thread-16476562-1-1.html
c++学习笔记_6
前言:本笔记所对应的课程为中国大学mooc中北京大学的程序设计与算法(三)C++面向对象程序设计,主要供自己复习使用,且本笔记建立在会使用c和java的基础上,只针对与c和java的不同来写多态虚 ...
elasticsearch基本概念理解+elasticsearch 的shards unassigned处理方法 -- 最佳运维实践 - 集群规划
1.es与MySQL的概念对比 2.概念理解 2.1 Index : 一个索引即是文档的集合 2.2 Document : 一个文档即是一个可被索引的基础单元信息,一条记录: 2.3 Replicas ...
jqGrid只向服务器请求一次的设置
也就是说,在表格初始化时请求一次服务器,以后翻页就不再请求服务器,翻页的也只是初始化数据. 一次复制别人的代码时,一直不知道为什么翻页不请求服务器. 搞到人都爆炸,原来只是一个设置的地方. loado ...
golang的定时器NewTimer、NewTicker使用
package main import ( "fmt" "sync" "time" ) /** *ticker只要定义完成,从此刻开始计时, ...
textarea文本域轻松实现高度自适应
转载:http://www.xuanfengge.com/textarea-on-how-to-achieve-a-high-degree-of-adaptive.html 今天需要些一个回复评论的页 ...

使用XPath爬取网页数据

使用XPath爬取网页数据的更多相关文章

随机推荐

热门专题