一、环境安装

下载lxml

pip install lxml

二、使用

XPath 使用路径表达式来选取 XML 文档中的节点或节点集。节点是通过沿着路径 (path) 或者步 (steps) 来选取的。

常用xpath表达式:

属性定位:
#找到class属性值为song的div标签
//div[@class="song"]
层级&索引定位:
#找到class属性值为tang的div的直系子标签ul下的第二个子标签li下的直系子标签a
//div[@class="tang"]/ul/li[2]/a
逻辑运算:
#找到href属性值为空且class属性值为du的a标签
//a[@href="" and @class="du"]
模糊匹配:
//div[contains(@class, "ng")]
//div[starts-with(@class, "ta")]
取文本:
# /表示获取某个标签下的文本内容
# //表示获取某个标签下的文本内容和所有子标签下的文本内容
//div[@class="song"]/p[1]/text()
//div[@class="tang"]//text()
取属性:
//div[@class="tang"]//li[2]/a/@href

xpath解析原理(编码流程):

  • - 实例化一个etree的对象,且将页面源码数据加载到该对象中
  • - 调用etree对象中的xpath方法实现标签定位和数据的提取
  • - 在xpath函数中必须作用xpath表达式

可以给浏览器安一个xpath插件--xpath.crx

  • 安装方式,打开浏览器开发者模式,直接将xpath.crx 拖进去
  • xpath插件的开启和关闭的快捷键:
    • ctrl+shift+x
  • 可进行xpath表达式的校验

xpath解析案例

  • 一、爬取煎蛋网图片数据http://jandan.net/ooxx

    • 图片src是加密的,加密方式封装在标签调用的函数中
    • 先爬取密文,然后根据加密方式解密。
# 需求,爬取煎蛋网图片数据, 图片的src加密了
import requests
from lxml import etree
import base64 # 对src加密的方法
from urllib import request
headers ={
'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.12 Safari/537.36'
}
url = "http://jandan.net/ooxx/page-64#comments"
page_text = requests.get(url,headers=headers).text # 解析图片src密文
tree = etree.HTML(page_text)
code_list = tree.xpath('//span[@class="img-hash"]/text()') # 获取密文
# 解析密文
for code in code_list:
img_url = "http:" + base64.b64decode(code).decode()
imgName = img_url.split('/')[-1]
request.urlretrieve(img_url, imgName)
print(imgName,"下载成功")

二、站长素材简历模板爬取

  • 报这个错::连接池的错误,高频访问占用连接对象。
  • HTTPConnectionPool(host:XX)Max retries exceeded with url:
  • 解决办法:
    • 1. 请求头中设置 'Connection':'close'

      • 如何让请求结束后马上断开连接且释放池中的连接资源: 'Connection':'close' # 请求成功之后马上断开连接
    • 2. 或使用代理ip
import requests
from lxml import etree
import random
import os
headers ={
'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.12 Safari/537.36',
'Connection':'close' # 请求成功之后马上断开连接
}
url_one = "http://sc.chinaz.com/jianli/free.html" # 定制一个通用url摸版
url_demo = "http://sc.chinaz.com/jianli/free_%d.html"
start_page = int(input("开始页"))
end_page = int(input("结束页")) for pageNum in range(start_page,end_page+1):
if pageNum == 1:
url = url_one
else:
url = format(url_demo%pageNum) response = requests.get(url=url,headers=headers)
response.encoding = 'utf-8' # 编码
page_text = response.text # 解析简历详情页的url
html = etree.HTML(page_text)
div_list = html.xpath('//div[@id="container"]/div')
for div in div_list:
name = div.xpath('./p/a/text()')[0]
url_detail = div.xpath('./p/a/@href')[0]
#对详情页的url发起请求,获取详情页的源码数据
detail_page_text = requests.get(url_detail,headers=headers).text
tree = etree.HTML(detail_page_text)
li_list = tree.xpath('//div[@class="clearfix mt20 downlist"]/ul/li')
#随机选取一个li标签(li标签中包含了下载地址的url)
download_url = random.choice(li_list).xpath('./a/@href')[0]
#进行简历数据的下载
data = requests.get(url=download_url,headers=headers).content
name = name+'.rar' # 压缩包
if not os.path.exists("./简历模板"):
os.mkdir("./简历模板")
with open(f"./简历模板/{name}", 'wb') as fp:
fp.write(data)
print(name,"下载成功")

数据解析之xpath的更多相关文章

  1. Python网络爬虫之三种数据解析方式 (xpath, 正则, bs4)

    引入 回顾requests实现数据爬取的流程 指定url 基于requests模块发起请求 获取响应对象中的数据 进行持久化存储 其实,在上述流程中还需要较为重要的一步,就是在持久化存储之前需要进行指 ...

  2. python爬虫数据解析之xpath

    xpath是一门在xml文档中查找信息的语言.xpath可以用来在xml文档中对元素和属性进行遍历. 在xpath中,有7中类型的节点,元素,属性,文本,命名空间,处理指令,注释及根节点. 节点 首先 ...

  3. Python爬虫:数据解析 之 xpath

    资料: W3C标准:https://www.w3.org/TR/xpath/all/ W3School:https://www.w3school.com.cn/xpath/index.asp 菜鸟教程 ...

  4. python爬虫的页面数据解析和提取/xpath/bs4/jsonpath/正则(1)

    一.数据类型及解析方式 一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值.内容一般分为两部分,非结构化的数据 和 结构化的数据. 非结构化数据:先有数据,再有结构, 结构化数 ...

  5. python爬虫数据解析的四种不同选择器Xpath,Beautiful Soup,pyquery,re

    这里主要是做一个关于数据爬取以后的数据解析功能的整合,方便查阅,以防混淆 主要讲到的技术有Xpath,BeautifulSoup,PyQuery,re(正则) 首先举出两个作示例的代码,方便后面举例 ...

  6. 爬虫-数据解析-xpath

    xpath 解析 模块安装 : pip install lxml xpath的解析原理 实例化一个etree类型的对象,且将页面源码数据加载到该对象中 需要调用该对象的xpath方法结合着不同形式的x ...

  7. 数据解析(XML和JSON数据结构)

    一   解析 二 XML数据结构 三 JSON 数据结构     一 解析 1  定义: 从事先规定好的格式中提取数据     解析的前提:提前约定好格式,数据提供方按照格式提供数据.数据获取方则按照 ...

  8. 【原】iOS学习38网络之数据解析

    1. 解析的基本的概念 解析:从事先规定好的格式中提取数据 解析前提:提前约定好格式,数据提供方按照格式提供数据.数据获取方则按照格式获取数据 iOS开发常见的解析:XML解析.JOSN解析 2. X ...

  9. iOS - XML 数据解析

    前言 @interface NSXMLParser : NSObject public class NSXMLParser : NSObject 1.XML 数据 XML(Extensible Mar ...

随机推荐

  1. DEV CheckComboboxEdit、CheckedListBoxControl(转)

    CheckComboboxEdit //先清空所有,若在窗体Load事件中,也可以不清空 //cbRWYs.Properties.Items.Clear(); var RwyList = tspro. ...

  2. 关于Pycharm中如何注释

    主要有三种方法: ①在程序行前面加“#” ②将需要注释的代码用'''----''' 包起来,此方法类似C的注释方法 ③将需要注释的代码选住然后利用“Ctrl+/”进行注释 # test=input(' ...

  3. C# XML文件操作

    C# XML文件操作 运行环境:Window7 64bit,.NetFramework4.61,C# 6.0: 编者:乌龙哈里 2017-02-09 参考 LINQ to XML System.Xml ...

  4. itemize,enumerate,description 用法【LaTeX 使用】

    itemize和enumerate还有description 是LaTeX里列举的三种样式,分别讲一些使用技巧.itemize(意为分条目):\begin{itemize}\item[*] a\ite ...

  5. 2-chrome无法添加扩展程序

    1.更多工具->拓展程序->打开开发者模式->重启浏览器 2.将拓展程序拖入,确认安装

  6. 如何撤回经由Outlook2016刚发出的邮件

    在Outlook2016中,刚发出了一封邮件,发现有问题,想撤回,如何处理? 在对方尚未查看和接收时,可撤回. 参考步骤 1.选中这封邮件,用鼠标双击打开 2.点Move旁边的下拉按钮 3.点击&qu ...

  7. Python 安装urllib3

    一.系统环境 操作系统:Win10 64位 Python版本:Python 3.7.0 二.报错信息 No module named 'urllib3' 三.安装参考 1.参照网上的安装方法通过pip ...

  8. MySql 获取服务提供的sakila数据库(Example Databases)

    关于这个数据库也就是样例数据库,数据库,数据库,最可怕的就是没有数据了,对吧?没有数据你学个什么呀. 可是,没有数据,咱会自己insert,那只能适用于初学者.对于数据库的优化方面的学习,还是有大数据 ...

  9. Ubuntu 复制 拷贝和自适应屏幕

    ubuntu 16.04安装vmtools实测无效!!!!!!11 1.解决VMware workstation与主机的粘贴.复制.文件拖拽问题. 2.解决VMware workstations中Ub ...

  10. Docker ubuntu镜像更换apt-get源

    在Dockerfile中添加 RUN sed -i s@/archive.ubuntu.com/@/mirrors.aliyun.com/@g /etc/apt/sources.list RUN ap ...