scrapy选择器主要用法

# 命令行输入:scrapy shell +链接,会自动请求url,得到的相应默认为response,开启命令行交互模式

scrapy shell http://doc.scrapy.org/en/latest/_static/selectors-sample1.html

In [1]: response#response为默认相应

Out[1]: <200 https://doc.scrapy.org/en/latest/_static/selectors-sample1.html>

In [2]: response.text#response.text相应的源代码

# 标准结构图如下:

response.text = '''

<html>

 <head>

  <base href='http://example.com/' />

  <title>Example website</title>

 </head>

 <body>

  <div id='images'>

   <a href='image1.html'>Name: My image 1 <br /><img src='image1_thumb.jpg' /></a>

   <a href='image2.html'>Name: My image 2 <br /><img src='image2_thumb.jpg' /></a>

   <a href='image3.html'>Name: My image 3 <br /><img src='image3_thumb.jpg' /></a>

   <a href='image4.html'>Name: My image 4 <br /><img src='image4_thumb.jpg' /></a>

   <a href='image5.html'>Name: My image 5 <br /><img src='image5_thumb.jpg' /></a>

  </div>

 </body>

</html>

'''

# 1:使用选择器response.selector.xpath()/response.selector.css()

In [5]: response.selector.xpath('//title/text()').extract_first()

Out[5]: 'Example website'

In [6]: response.selector.css('title::text').extract_first()

Out[6]: 'Example website'

# 2:使用选择器也可以简写为:response.xpath() / response.css()

In [9]: response.css('title::text')

Out[9]: [<Selector xpath='descendant-or-self::title/text()' data='Example website'>]

In [10]: response.xpath('//title/text()')

Out[10]: [<Selector xpath='//title/text()' data='Example website'>]

# 3:以上可知使用.xpath() .css()返回仍然是一个选择器,若要提取里面的数据,可以用extract()提取全部,extract_first提取首个

In [7]: response.xpath('//title/text()').extract_first()

Out[7]: 'Example website'

In [8]: response.css('title::text').extract_first()

Out[8]: 'Example website'

# 4:可以循环进行选择

# 获取div标签里面,id = 'images'的元素, 然后继续查找img标签属性为src的内容,最终提取出来

# 就是说,包含关系用中括号[],从属关系用斜杠 /

In [14]: response.xpath("//div[@id='images']").css('img::attr(src)').extract()

Out[14]:

['image1_thumb.jpg',

 'image2_thumb.jpg',

 'image3_thumb.jpg',

 'image4_thumb.jpg',

 'image5_thumb.jpg']

# extract_first还有default属性,如果查找不到对应的元素即返回default指定的值

In [16]: response.xpath("//div[@id='images']").css('img::attr(src)').extract_first(default='')

Out[16]: 'image1_thumb.jpg'

# 查找a标签下,属性为href的元素,提取出来

In [18]: response.xpath('//a/@href').extract()

Out[18]: ['image1.html', 'image2.html', 'image3.html', 'image4.html', 'image5.html']

In [19]: response.css('a::attr(href)').extract()

Out[19]: ['image1.html', 'image2.html', 'image3.html', 'image4.html', 'image5.html']

# 5:查找标签的文本

In [20]: response.xpath('//a/text()').extract()

Out[20]:

['Name: My image 1 ',

 'Name: My image 2 ',

 'Name: My image 3 ',

 'Name: My image 4 ',

 'Name: My image 5 ']

In [21]: response.css('a::text').extract()

Out[21]:

['Name: My image 1 ',

 'Name: My image 2 ',

 'Name: My image 3 ',

 'Name: My image 4 ',

 'Name: My image 5 ']

# 6:选取标签的属性

In [34]: response.css('a::attr(href)').extract()

Out[34]: ['image1.html', 'image2.html', 'image3.html', 'image4.html', 'image5.html']

In [39]: response.xpath('//a/@href').extract()

Out[39]: ['image1.html', 'image2.html', 'image3.html', 'image4.html', 'image5.html']

# 查找属性名称为href 包含image的标签的属性

In [24]: response.xpath('//a[contains(@href,"image")]/@href').extract()

Out[24]: ['image1.html', 'image2.html', 'image3.html', 'image4.html', 'image5.html']

In [25]: response.css('a[href*=image]::attr(href)').extract()

Out[25]: ['image1.html', 'image2.html', 'image3.html', 'image4.html', 'image5.html']

# 查找a标签里面属性名为href,包含image,包含img,属性为src的属性

In [27]: response.xpath('//a[contains(@href,"image")]/img/@src').extract()

Out[27]:

['image1_thumb.jpg',

 'image2_thumb.jpg',

 'image3_thumb.jpg',

 'image4_thumb.jpg',

 'image5_thumb.jpg']

In [28]: response.css('a[href*=image] img::attr(src)').extract()

Out[28]:

['image1_thumb.jpg',

 'image2_thumb.jpg',

 'image3_thumb.jpg',

 'image4_thumb.jpg',

 'image5_thumb.jpg']

# 7:可配合正则表达式,re_first表示取第一个满足正则表达式的

In [30]: response.css('a::text').re('Name\:(.*)')

Out[30]:

[' My image 1 ',

 ' My image 2 ',

 ' My image 3 ',

 ' My image 4 ',

 ' My image 5 ']

In [31]: response.css('a::text').re_first('Name\:(.*)')

Out[31]: ' My image 1 '

In [32]: response.css('a::text').re_first('Name\:(.*)').strip()#去除空格

Out[32]: 'My image 1'

scrapy选择器主要用法的更多相关文章

Scrapy选择器的用法
1.构造选择器: >>> response = HtmlResponse(url='http://example.com', body=body) >>> Sele ...
Scrapy框架中选择器的用法【转】
Python爬虫从入门到放弃(十四)之 Scrapy框架中选择器的用法请给作者点赞 --> 原文链接 Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpa ...
scrapy框架中选择器的用法
scrapy框架中选择器的用法 Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpath或者CSS表达式来选择HTML文件的某个部分Xpath是专门在XML文件中 ...
CSS中:before和:after选择器的用法
在线演示这次给大家带来的是对话气泡效果,主要是演示了 :before / :after 和 border 的用法,赶快来围观吧. 阅读原文:CSS中:before和:after选择器的用法
Python爬虫从入门到放弃（十四）之 Scrapy框架中选择器的用法
Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpath或者CSS表达式来选择HTML文件的某个部分Xpath是专门在XML文件中选择节点的语言,也可以用在HTM ...
Python之爬虫（十六） Scrapy框架中选择器的用法
Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpath或者CSS表达式来选择HTML文件的某个部分Xpath是专门在XML文件中选择节点的语言,也可以用在HTM ...
Scrapy中选择器的用法
官方文档:https://doc.scrapy.org/en/latest/topics/selectors.html Using selectors Constructing selectors R ...
4-----Scrapy框架中选择器的用法
Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpath或者CSS表达式来选择HTML文件的某个部分Xpath是专门在XML文件中选择节点的语言,也可以用在HTM ...
scrapy选择器归纳
python 爬虫: srcrapy框架xpath和css选择器语法 Xpath基本语法一.常用的路径表达式: 表达式描述实例 nodename 选取nodename节点的所有子节点 //div ...

随机推荐

有序的Map集合--LinkedHashMap
提出问题: 在写一个dao的时候,我的需求是这个dao是一个万能的,目前的方法只有一个查询出实体类对应的表中所有的数据,通过传入的对象,利用反射获取实体类中的属性名,属性类型,利用字符串拼接获取相应属 ...
Algorithm --> n位数去掉k位后找最小数
去掉K位求取最小数一个n位的数,去掉其中的k位,怎样使留下来的(n-k)位数按原来的前后顺序组成的数最小例如 8314925去掉4个数,留下125最小,注意有前后顺序要求,要是没有顺序当然是123 ...
c# 基于FTP协议的简易软件自动升级程序
最近在重写了一个老的产品条码扫描程序,客户端数越有30个,因为经常有更新,C/S维护非常不方便,所以做一个自动更新程序特别有必要. 在网上随便找了找自动更新的方案,大多使用VS的发布/更新功能,不太喜 ...
强烈推荐！！！Fiddler抓取https设置详解（图文）
很多实用fiddler抓包,对于http来说不需太多纠结,随便设置下就能用,但是抓取https就死活抓不了, 诸如以下问题: creation of the root certificate was ...
JAVA-基础语法篇
JAVA-基础语法篇一. 基础语法: 对大小写敏感类名的首字母大写方法名首字母小写,后面用驼峰发命名源文件名和类名要相同主方法入口: public static void main( ...
mysql的存储过程，函数，事件，权限，触发器，事务，锁，视图，导入导出
1.创建过程 1.1 简单创建 -- 创建员工表 DROP TABLE IF EXISTS employee; CREATE TABLE employee( id int auto_increment ...
vim的配置
修改根目录下.vimrc文件: 1.设定解码,支持中文 set fileencodings=utf-8,ucs-born,gb18030,gbk,gb2312,cp936 set termencodi ...
学号：201621123032 《Java程序设计》第6周学习总结
1:本周学习总结 1.1: 面向对象学习暂告一段落,请使用思维导图,以封装.继承.多态为核心概念画一张思维导图或相关笔记,对面向对象思想进行一个总结 2:书面作业 2.1: clone方法 2.1.1 ...
Java 中 compareTo方法问题
compareTo方法原理:先读取出字符串的第一个“字母”进行比较,比较的方法是ascii码表的值(字符所对应的十进制值),如果前面的大那么返回1,后面的大返回-1:此位置相同,继续比较下一位,直到最 ...
第三篇：Python字符编码
一 .了解字符编码的知识储备 1计算机基础知识 1.2文本编辑器存取文件的原理(nodepat++,Pycharm,word) #.打开编辑器就打开了启动了一个进程,是在内存中的,所以,用编辑器编写的 ...

scrapy选择器主要用法

scrapy选择器主要用法的更多相关文章

随机推荐

热门专题