用requests-html和SelectorGadget轻松精准抓取网页数据

我们在抓取网页数据时，最常採用Python的requests搭配BeautifulSoup的模式来完成。然而，requests-html整合了上述2个套件，又添加了新的功能，或许是抓取网页数据值得考虑的新选项。我们来看个实例，假设我们想要抓取stackoverflow网站上有关Python问题第1页的标题，先在网页上按"F12"查看网页原始码；我们会发现"a.s-link"可能会是个不错的CSS Selector。

因此，初步尝试撰写爬虫代码如下：

 1 from requests_html import HTMLSession

 2

 3 session = HTMLSession()

 4 keyword = 'Python'

 5 url = f'https://stackoverflow.com/questions/tagged/{keyword}'

 6 r = session.get(url)

 7 titles = r.html.find('a.s-link')

 8

 9 for title in titles:

10     print(title.text)

可是，程式执行之后；我们会看到数据的上方多了2行空白，下方的"Hot Network Quesions"又不是我们想要的数据。

显然，我们设定的CSS Selector不太正确。在修正这个问题之前，我们先把SelectorGadget这个Chrome浏览器的插件安装好，并钉选在工具列上以方便日后操作。启动SelectorGadget之后，点选stackoverflow页面上的任1个问题的标题；选中的标题会变成绿色，其他的标题会变成黄色；但同时会看到"Hot Network Quesions"也变成了黄色。此时，再点选"Hot Network Quesions"，会让"Hot Network Quesions"变成红色而被排除在外。

对SelectorGadget视窗左方的CSS Selector按滑鼠右键选"複製"，取代原先代码中的CSS Selector。

titles = r.html.find('#questions .s-link')

再次执行程式，我们会看到果然输出了正确的结果。

如果我们想要更进一步精准地从上面的标题中挑出含有"Python"的标题，也是非常容易地喔。只要在find()方法中添加containing参数即可。

有没有发现requests-html搭配SelectorGadget真得是超好用的呢？！

用requests-html和SelectorGadget轻松精准抓取网页数据的更多相关文章

java抓取网页数据，登录之后抓取数据。
最近做了一个从网络上抓取数据的一个小程序.主要关于信贷方面,收集的一些黑名单网站,从该网站上抓取到自己系统中. 也找了一些资料,觉得没有一个很好的,全面的例子.因此在这里做个笔记提醒自己. 首先需要一 ...
Asp.net 使用正则和网络编程抓取网页数据(有用)
Asp.net 使用正则和网络编程抓取网页数据(有用) Asp.net 使用正则和网络编程抓取网页数据(有用) /// <summary> /// 抓取网页对应内容 /// </su ...
使用HtmlAgilityPack批量抓取网页数据
原文:使用HtmlAgilityPack批量抓取网页数据相关软件点击下载登录的处理.因为有些网页数据需要登陆后才能提取.这里要使用ieHTTPHeaders来提取登录时的提交信息.抓取网页 Htm ...
web scraper 抓取网页数据的几个常见问题
如果你想抓取数据,又懒得写代码了,可以试试 web scraper 抓取数据. 相关文章: 最简单的数据抓取教程,人人都用得上 web scraper 进阶教程,人人都用得上如果你在使用 web s ...
c#抓取网页数据
写了一个简单的抓取网页数据的小例子,代码如下: //根据Url地址得到网页的html源码 private string GetWebContent(string Url) { string strRe ...
使用JAVA抓取网页数据
一.使用 HttpClient 抓取网页数据 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 ...
【iOS】正則表達式抓取网页数据制作小词典
版权声明:本文为博主原创文章,未经博主同意不得转载. https://blog.csdn.net/xn4545945/article/details/37684127 应用程序不一定要自己去提供数据. ...
01 UIPath抓取网页数据并导出Excel（非Table表单）
上次转载了一篇<UIPath抓取网页数据并导出Excel>的文章,因为那个导出的是table标签中的数据,所以相对比较简单.现实的网页中,有许多不是通过table标签展示的,那又该如何处理 ...
Node.js的学习--使用cheerio抓取网页数据
打算要写一个公开课网站,缺少数据,就决定去网易公开课去抓取一些数据. 前一阵子看过一段时间的Node.js,而且Node.js也比较适合做这个事情,就打算用Node.js去抓取数据. 关键是抓取到网页 ...
Java抓取网页数据（原网页+Javascript返回数据）
有时候由于种种原因,我们需要采集某个网站的数据,但由于不同网站对数据的显示方式略有不同! 本文就用Java给大家演示如何抓取网站的数据:(1)抓取原网页数据:(2)抓取网页Javascript返回的数 ...

随机推荐

element ui el-date-picker 禁止选择指定日期
1.日期选择器组件代码 <el-col :span="20"> <el-form-item label="活动起始日期值" prop=&quo ...
PX4源码地址和wiki
[源码] https://github.com/987419640/Firmware [wiki] https://dev.px4.io/v1.9.0/zh/concept/architecture. ...
修改Element - plus的样式
把显示再浏览器上的对应css选择器全部写上,并且添加 !important </script> <style lang='scss' scoped> //修改 element ...
mapreduce的使用
mapreduce的使用以下案例写之前需要导入jar包依赖: <dependencies> <dependency> <groupId>org.apache.ha ...
T-SQL——数字辅助表
目录 0.永久性的连续数字表 1.使用系统表:master..spt_values 2.使用递归CTE 3.使用0-9乘以量级交叉连接 4.使用2的次幂和CTE生成和交叉链接创建表值函数 5.数字辅 ...
Linux centos 代替方案： Rocky Linux （centos作者）
官网: Rocky Linux
三天吃透MySQL八股文（2023最新整理）
本文已经收录到Github仓库,该仓库包含计算机基础.Java基础.多线程.JVM.数据库.Redis.Spring.Mybatis.SpringMVC.SpringBoot.分布式.微服务.设计模式 ...
.net mvc 权限验证 Filter（过滤器）
一.知识了解 Asp.Net MVC提供了以下几种默认的Filter: 大家注意一点,Asp.Net MVC提供的ActionFilterAttribute默认实现了IActionFilter和IRe ...
SpringBoot2.6.x及以上版本整合swagger文档
SpringBoot的版本更新中引入了一些新的特性,并且Swagger的版本更新也同样引入了很多新的东西,这样就造成了许多配置无法实现一一对应的情况,因此高版本的SpringBoot集成Swagger ...
Python爬虫:原来微博上的视频下载链接在这啊
最近看了一下网页版的微博,觉得那上面的视频不错,想获取它上面的下载链接,于是就写了这篇博文. 1. 几个视频播放平台的下载链接的实现 1. 西瓜视频西瓜视频这个平台上面的视频下载链接一开始就存在于视 ...

用requests-html和SelectorGadget轻松精准抓取网页数据

用requests-html和SelectorGadget轻松精准抓取网页数据的更多相关文章

随机推荐

热门专题