使用puppeteer爬取网页数据实践小结

简单介绍Puppeteer

Puppeteer是一个Node库，它通过DevTools协议提供高级API来控制Chrome或Chromium。Puppeteer默认以无头方式运行，但可以配置为有头方式运行。Puppeteer中文”木偶”，很贴切，它可以使用node程序来模拟人操作浏览器的行为，比如点击某个按钮等。

Puppeteer可以做什么

在浏览器中手动执行的大多数操作都可以使用Puppeteer完成！例如：

生成页面的屏幕截图和PDF。
抓取SPA（单页面应用程序）并生成预渲染内容（即“SSR”（服务器端渲染））。
自动化表单提交，UI测试，键盘输入等。
创建最新的自动化测试环境。使用最新的JavaScript和浏览器功能直接在最新版本的Chrome中运行测试。
捕获时间线跟踪您的网站，以帮助诊断性能问题。
测试Chrome扩展程序。

官网（入门一定要看的）

https://pptr.dev

一定使用async await来写异步，这样会更简洁

我的应用场景

我老婆有一份list，list中有1000个item左右，每个item需要在网站中搜索，点击进入详情，然后切换tab，点击进入另一个详情，然后得到某些信息。如果手动操作，大概操作完一个需要3分钟左右，累计需要3000分钟（50小时），每天投入1-2小时（大量重复的操作非常无趣，而且累）。我见此情景，分析了下系统，发现很难使用一些ajax的接口就达到目的，看来系统本身做了一些处理。所以我打算使用Puppeteer来帮老婆完成这个工作，大概花了2-3天时间，对Puppeteer有了一些初步的了解，并且爬取了第一步的数据。我打算分步骤抓取数据，递进的去得到最终的一份清单。

几个我用到的对象的关系

遇到的一些问题

1. 安装问题

完整安装：npm i puppeteer --save 需要设置下淘宝镜像源

+ puppeteer_download_host = https://npm.taobao.org/mirrors

2. ElementHandle类型的对象click方法不管用处理方法

启动代码如下

小结

Puppeteer总体来说非常好用，只不过是用过程中需要不断去看文档熟悉接口，是用来爬取各种网页内容的”利器”。这次我也支持接触了Puppeteer的以小部分功能而已，以后争取能够在更多合适的场景去使用它。

作者：张雪飞
出处：https://zhangxuefei.site/p/2210
版权说明：欢迎转载，但必须注明出处，并在文章页面明显位置给出原文连接，否则保留追究法律责任的权利。

使用puppeteer爬取网页数据实践小结的更多相关文章

使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...
使用 Python 爬取网页数据
1. 使用 urllib.request 获取网页 urllib 是 Python 內建的 HTTP 库, 使用 urllib 可以只需要很简单的步骤就能高效采集数据; 配合 Beautiful 等 ...
03：requests与BeautifulSoup结合爬取网页数据应用
1.1 爬虫相关模块命令回顾 1.requests模块 1. pip install requests 2. response = requests.get('http://www.baidu.com ...
使用XPath爬取网页数据
我们以我的博客为例,来爬取我所有写过的博客的标题. 首先,打开我的博客页面,右键“检查”开始进行网页分析.我们选中博客标题,再次右键“检查”即可找到标题相应的位置,我们继续点击右键,选择Copy,再点 ...
Selenium+Tesseract-OCR智能识别验证码爬取网页数据
1.项目需求描述通过订单号获取某系统内订单的详细数据,不需要账号密码的登录验证,但有图片验证码的动态识别,将获取到的数据存到数据库. 2.整体思路 1.通过Selenium技术,无窗口模式打开浏览器 ...
pycharm爬取网页数据
1 python环境的配置 1.1 安装python文件包,放到可以找到的位置 1.2 右键计算机->属性->高级环境设置->系统变量->Path->编辑->复制p ...
【推荐】oc解析HTML数据的类库（爬取网页数据）
TFhpple是一个用于解析html数据的第三方库,本人感觉功能还算可以,只不过在使用前必须配置项目. 配置 1.导入libxml2.tbd 2.设置编译路径使用这里使用一个例子来说明 http: ...

随机推荐

React: React脚手架
一.简言 React开发目前已经非常流行,对于如何实现对React项目的管理和维护,React生态圈出现了大量可用的开发工具,例如Browserify.Gulp.Grunt.webpack等.其中,w ...
python同名函数同名参数问题
如果python有两个函数的函数名与参数列表都相同那么调用该函数时,哪个函数在后,则哪个被最终调用. 举例如下: def test(): print "before hello" ...
Jenkins 插件升级站点镜像好用的 2019年11月
这两天开始学Jenkins 用docker下载了一个镜像运行 , 版本太老了.初始化插件各种报错:版本低/ 更新失败等. dockerhub里面的版本才 2.60 然后又从Jenkins.io 官网上 ...
JVM GC系列 — GC收集器
一.前言前文学习了各种GC回收算法,掌握了GC回收的原理,但是真正的GC实现却尤为复杂,本篇文章将主要介绍各种GC收集器. 目前主流的HotSpot VM支持多种虚拟机,这些虚拟机也体现了GC的发展 ...
[IDA]批量载入结构体
我们之前介绍了如果单独定义一个C结构体并转换为IDA中的结构体. 但是,在内核中有很多庞大的结构体,一环接着一环,手动导入不现实. 还存在一个问题,可能大小格式不匹配. 之前有一位老哥推荐我一个工具: ...
java高并发系列 - 第13天:JUC中的Condition对象
本文目标: synchronized中实现线程等待和唤醒 Condition简介及常用方法介绍及相关示例使用Condition实现生产者消费者使用Condition实现同步阻塞队列 Object对 ...
从新手小白到老手大白的成长之路第二弹-WPF之UI界面之Grid面板
废话不多说,接下来直接开始介绍WPF-UI界面-Grid面板如图就是创建好了的一个WPF项目,整个界面被一个Window窗体包含起来,上面类似于什么什么网址什么的其实就相当于.net的命名空间,缺什 ...
练手WPF（三）——扫雷小游戏的简易实现（下）
十四.响应鼠标点击事件 (1)设置对应坐标位置为相应的前景状态 /// <summary> /// 设置单元格图样 /// </summary> /// <para ...
NET EF 连接Oracle 的配置方法记录
主要记录下如何在EF 中连接Oracle s数据库,很傻瓜式,非常简单,但是不知道的童鞋,也会搞得很难受,我自己就是 1.创一个控制台程序,并且添加 Oracle.ManagedDataAccess ...
javafx笔记----非javafx线程Platform.runLater赋值不生效情况
Platform.runLater(() -> { // }); Platform.runLater一些情况下没有赋值到fx页面上采用task方式 Task<SB> task = ...

使用puppeteer爬取网页数据实践小结

使用puppeteer爬取网页数据实践小结的更多相关文章

随机推荐

热门专题