爬虫利器 Puppeteer 实战

Puppeteer 介绍

Puppeteer 翻译是操纵木偶的人，利用这个工具，我们能做一个操纵页面的人。Puppeteer是一个Nodejs的库，支持调用Chrome的API来操纵Web，相比较Selenium或是PhantomJs,它最大的特点就是它的操作Dom可以完全在内存中进行模拟既在V8引擎中处理而不打开浏览器，而且关键是这个是Chrome团队在维护，会拥有更好的兼容性和前景。

`Puppeteer` 用处

利用网页生成PDF、图片
爬取SPA应用，并生成预渲染内容（即“SSR” 服务端渲染）
可以从网站抓取内容
自动化表单提交、UI测试、键盘输入等
帮你创建一个最新的自动化测试环境（chrome），可以直接在此运行测试用例6.捕获站点的时间线，以便追踪你的网站，帮助分析网站性能问题

Puppeteer 使用

安装 `Puppeteer`

由于封网，直接下载 Chromium 会失败，可以先阻止下载 Chromium 然后再手动下载它

# 安装命令

npm i puppeteer --save

# 错误信息

ERROR: Failed to download Chromium r515411! Set "PUPPETEER_SKIP_CHROMIUM_DOWNLOAD" env variable to skip download.

# 设置环境变量跳过下载 Chromium

set PUPPETEER_SKIP_CHROMIUM_DOWNLOAD=1 

# 或者可以这样干，只下载模块而不build

npm i --save puppeteer --ignore-scripts

# 成功安装模块

+ puppeteer@0.13.0

added 1 package in 1.77s

手动下载 Chromium，下载完后将压缩包解压，会有个 Chromium.app，将其放在你喜欢的目录下，例如 /Users/huqiyang/Documents/project/z/chromium/Chromium.app。正常安装包后 Chromium.app 会在 .local-chromium中

Tip：下载 Chromium 失败解决办法

更换国内Chromium源
PUPPETEER_DOWNLOAD_HOST=https://storage.googleapis.com.cnpmjs.org

npm i puppeteer
或者用 cnpm 安装
npm install -g cnpm --registry=https://registry.npm.taobao.org

cnpm i puppeteer

点击查阅 `Puppeteer` API

初试 `Puppeteer`，截个图吧

知识点

puppeteer.launch 启动浏览器实例
browser.newPage() 创建一个新页面
page.goto 进入指定网页
page.screenshot 截图

const puppeteer = require('puppeteer');

(async () => {

  const browser = await (puppeteer.launch({

    // 若是手动下载的chromium需要指定chromium地址, 默认引用地址为 /项目目录/node_modules/puppeteer/.local-chromium/

    executablePath: '/Users/huqiyang/Documents/project/z/chromium/Chromium.app/Contents/MacOS/Chromium',

    //设置超时时间

    timeout: 15000,

    //如果是访问https页面 此属性会忽略https错误

    ignoreHTTPSErrors: true,

    // 打开开发者工具, 当此值为true时, headless总为false

    devtools: false,

    // 关闭headless模式, 不会打开浏览器

    headless: false

  }));

  const page = await browser.newPage();

  await page.goto('https://www.jianshu.com/u/40909ea33e50');

  await page.screenshot({

    path: 'jianshu.png',

    type: 'png',

    // quality: 100, 只对jpg有效

    fullPage: true,

    // 指定区域截图，clip和fullPage两者只能设置一个

    // clip: {

    //   x: 0,

    //   y: 0,

    //   width: 1000,

    //   height: 40

    // }

  });

  browser.close();

})();

运行结果

image.png

进阶，获取网易云音乐的歌词和评论

网易云音乐的API经过AES和RSA算法加密，需要携带加密的信息通过POST方式请求才能获取到数据。但 Puppeteer 出现后，这些都不重要了，只要它页面上显示了，通过 Puppeteer 都能获取到该元素。

知识点

page.type 获取输入框焦点并输入文字
page.keyboard.press 模拟键盘按下某个按键，目前mac上组合键无效为已知bug
page.waitFor 页面等待，可以是时间、某个元素、某个函数
page.frames() 获取当前页面所有的 iframe，然后根据 iframe 的名字精确获取某个想要的 iframe
iframe.$('.srchsongst') 获取 iframe 中的某个元素
iframe.evaluate() 在浏览器中执行函数，相当于在控制台中执行函数，返回一个 Promise
Array.from 将类数组对象转化为对象
page.click() 点击一个元素
iframe.$eval() 相当于在 iframe 中运行 document.queryselector 获取指定元素，并将其作为第一个参数传递
iframe.$$eval 相当于在 iframe 中运行 document.querySelectorAll 获取指定元素数组，并将其作为第一个参数传递

const fs = require('fs');

const puppeteer = require('puppeteer');

(async () => {

  const browser = await (puppeteer.launch({ executablePath: '/Users/huqiyang/Documents/project/z/chromium/Chromium.app/Contents/MacOS/Chromium', headless: false }));

  const page = await browser.newPage();

  // 进入页面

  await page.goto('https://music.163.com/#');

  // 点击搜索框拟人输入 鬼才会想起

  const musicName = '鬼才会想';

  await page.type('.txt.j-flag', musicName, {delay: 0});

  // 回车

  await page.keyboard.press('Enter');

  // 获取歌曲列表的 iframe

  await page.waitFor(2000);

  let iframe = await page.frames().find(f => f.name() === 'contentFrame');

  const SONG_LS_SELECTOR = await iframe.$('.srchsongst');

  // 获取歌曲 鬼才会想起 的地址

  const selectedSongHref = await iframe.evaluate(e => {

    const songList = Array.from(e.childNodes);

    const idx = songList.findIndex(v => v.childNodes[1].innerText.replace(/\s/g, '') === '鬼才会想起');

    return songList[idx].childNodes[1].firstChild.firstChild.firstChild.href;

  }, SONG_LS_SELECTOR);

  // 进入歌曲页面

  await page.goto(selectedSongHref);

  // 获取歌曲页面嵌套的 iframe

  await page.waitFor(2000);

  iframe = await page.frames().find(f => f.name() === 'contentFrame');

  // 点击 展开按钮

  const unfoldButton = await iframe.$('#flag_ctrl');

  await unfoldButton.click();

  // 获取歌词

  const LYRIC_SELECTOR = await iframe.$('#lyric-content');

  const lyricCtn = await iframe.evaluate(e => {

    return e.innerText;

  }, LYRIC_SELECTOR);

  console.log(lyricCtn);

  // 截图

  await page.screenshot({

    path: '歌曲.png',

    fullPage: true,

  });

  // 写入文件

  let writerStream = fs.createWriteStream('歌词.txt');

  writerStream.write(lyricCtn, 'UTF8');

  writerStream.end();

  // 获取评论数量

  const commentCount = await iframe.$eval('.sub.s-fc3', e => e.innerText);

  console.log(commentCount);

  // 获取评论

  const commentList = await iframe.$$eval('.itm', elements => {

    const ctn = elements.map(v => {

      return v.innerText.replace(/\s/g, '');

    });

    return ctn;

  });

  console.log(commentList);

})();

运行结果

image.png

高级爬虫

爬取SPA应用，并生成预渲染内容（即“SSR” 服务端渲染），通俗讲就是在页面上显示的内容我们都能获取到。下面我们就通过爬取 瓜子二手车直卖网 的车辆信息来认识它。

首先通过 axios 来试试

const axios = require('axios');

const useAxios = () => {

  axios.get('https://www.guazi.com/hz/buy/')

    .then(((result) => {

      console.log(result.data);

    }))

    .catch((err) => {

      console.log(err);

    });

};

结果它返回给我这个玩意，这显然不是我要的内容

image.png

通过 Puppeteer 爬取

const fs = require('fs');

const puppeteer = require('puppeteer');

(async () => {

  const browser = await (puppeteer.launch({ executablePath: '/Users/huqiyang/Documents/project/z/chromium/Chromium.app/Contents/MacOS/Chromium', headless: true }));

  const page = await browser.newPage();

  // 进入页面

  await page.goto('https://www.guazi.com/hz/buy/');

  // 获取页面标题

  let title = await page.title();

  console.log(title);

  // 获取汽车品牌

  const BRANDS_INFO_SELECTOR = '.dd-all.clearfix.js-brand.js-option-hid-info';

  const brands = await page.evaluate(sel => {

    const ulList = Array.from($(sel).find('ul li p a'));

    const ctn = ulList.map(v => {

      return v.innerText.replace(/\s/g, '');

    });

    return ctn;

  }, BRANDS_INFO_SELECTOR);

  console.log('汽车品牌: ', JSON.stringify(brands));

  let writerStream = fs.createWriteStream('car_brands.json');

  writerStream.write(JSON.stringify(brands, undefined, 2), 'UTF8');

  writerStream.end();

  // await bodyHandle.dispose();

  // 获取车源列表

  const CAR_LIST_SELECTOR = 'ul.carlist';

  const carList = await page.evaluate((sel) => {

    const catBoxs = Array.from($(sel).find('li a'));

    const ctn = catBoxs.map(v => {

      const title = $(v).find('h2.t').text();

      const subTitle = $(v).find('div.t-i').text().split('|');

      return {

        title: title,

        year: subTitle[0],

        milemeter: subTitle[1]

      };

    });

    return ctn;

  }, CAR_LIST_SELECTOR);

  console.log(`总共${carList.length}辆汽车数据: `, JSON.stringify(carList, undefined, 2));

  // 将车辆信息写入文件

  writerStream = fs.createWriteStream('car_info_list.json');

  writerStream.write(JSON.stringify(carList, undefined, 2), 'UTF8');

  writerStream.end();

  browser.close();

})();

运行结果

image.png

资料

Puppeteer 官方文档
键名映射
网上的更多教程：Puppeteer 入门教程、Puppeteer 初探之前端自动化测试、使用puppeteer-autotest 来为cnodejs 做自动化测试.
多多关注 Puppeteer 的 issues 来解决问题

作者：淡就加点盐
链接：https://www.jianshu.com/p/a9a55c03f768
来源：简书

爬虫利器 Puppeteer 实战的更多相关文章

爬虫利器 Puppeteer
http://wintersmilesb101.online/2017/03/24/use-phantomjs-dynamic/ 一起学爬虫 Node.js 爬虫篇(三)使用 PhantomJS ...
web前端自动化测试/爬虫利器puppeteer介绍
web前端自动化测试/爬虫利器puppeteer介绍 Intro Chrome59(linux.macos). Chrome60(windows)之后,Chrome自带headless(无界面)模式很 ...
ETL利器Kettle实战应用解析系列一【Kettle使用介绍】
本系列文章主要索引如下: 一.ETL利器Kettle实战应用解析系列一[Kettle使用介绍] 二.ETL利器Kettle实战应用解析系列二 [应用场景和实战DEMO下载] 三.ETL利器Kettle ...
(转载)ETL利器Kettle实战应用解析系列一【Kettle使用介绍】
http://www.cnblogs.com/limengqiang/archive/2013/01/16/kettleapply1.html ETL利器Kettle实战应用解析系列一[Kettle使 ...
SuperSpider——打造功能强大的爬虫利器
SuperSpider——打造功能强大的爬虫利器 1.爬虫的介绍图1-1 爬虫(spider) 网络爬虫(web spider)是一个自动的通过网络抓取互联网上的网页的程序,在当今互联网中 ...
python爬虫利器Selenium使用详解
简介: 用pyhon爬取动态页面时普通的urllib2无法实现,例如下面的京东首页,随着滚动条的下拉会加载新的内容,而urllib2就无法抓取这些内容,此时就需要今天的主角selenium. Sele ...
(转)Python爬虫利器一之Requests库的用法
官方文档以下内容大多来自于官方文档,本文进行了一些修改和总结.要了解更多可以参考官方文档安装利用 pip 安装 $ pip install requests 或者利用 easy_install ...
infolite（中文检索系统）~爬虫利器
infolite 今天为大家分享一个爬虫利器-infolite.这是一个chrome浏览器的插件,如果你在写爬虫的时候对复杂繁琐的控件路径分析是深恶痛绝.那么infolite绝对是你最好的选择. 安装 ...
Python 爬虫利器 Selenium 介绍
Python 爬虫利器 Selenium 介绍转 https://mp.weixin.qq.com/s/YJGjZkUejEos_yJ1ukp5kw 前面几节,我们学习了用 requests 构造页 ...

随机推荐

Vue 学习(1)
<!DOCTYPE html> <html lang="en" dir="ltr"> <head> <meta cha ...
iptables 配置说明
#配置,禁止进,允许出,允许回环网卡 iptables -P INPUT DROP iptables -P OUTPUT ACCEPT iptables -A INPUT -i lo -j ACCEP ...
k8s创建pod流程
kubernetes 创建Pod 的工作流: step.1 kubectl 向 k8s api server 发起一个create pod 请求(即我们使用Kubectl敲一个create pod命 ...
Chrome 插件PPAPI 开发(一)环境搭建
前言:本文参考了其他已有的文章,在其基础上简化了一些没有必要的操作. 同时也记录一下chrome 插件ppapi环境的基础搭建.并且感谢已有文章作者的大无畏的分享精神! 在这附上参考文章链接:http ...
java调用webservice方法
由于项目的历史原因,webservice服务端是乙方公司开发的,我们自己开发的系统需要去调用乙方公司的webservice接口.前面用了网上提供的一种方法(非生成代理类),怎么也调用不成功(也许是因为 ...
Java简单操作Zookeeper
Zookeeper客户端链接 <dependency> <groupId>org.apache.zookeeper</groupId> <artifactId ...
mysql转移数据目录后无法启动问题
最近在学习mysql,将mysql的数据目录文件路径/var/lib/mysql转移到/data/mysql,然后通过软连接方式关联. 1. ln -s /data/mysql /var/lib/my ...
【笔记】Python基础一：变量，控制结构，运算符及数据类型之数字，字符串，列表，元组，字典
一,开发语言介绍高级语言:Java,C#,Python ==>产生字节码低级语言:C,汇编 ==>产生机器码高级语言开发效率高,低级语言运行效率 ...
java第一章抽象和封装
面向过程和面向对象有什么区别? 面向过程的核心是函数,以功能为中心,实现了函数级别的代码重用. 面向对象的核心是封装了属性和方法(行为)的类,以数据为中心,实现了类级别的代码重用. 面向对象因为采用了 ...
vue-computed计算属性用法
siytem函数可以当做变量在html中展现,列:{{siytem}} v-for(item in siytem)遍历也可以. 这个函数是从获取到的数据中,得到值后再次提取里面的数据,通过下标 me ...

爬虫利器 Puppeteer 实战

Puppeteer 介绍

Puppeteer 用处

Puppeteer 使用

安装 Puppeteer

点击查阅 Puppeteer API

初试 Puppeteer，截个图吧

进阶，获取网易云音乐的歌词和评论

高级爬虫

资料

爬虫利器 Puppeteer 实战的更多相关文章

随机推荐

热门专题

`Puppeteer` 用处

安装 `Puppeteer`

点击查阅 `Puppeteer` API

初试 `Puppeteer`，截个图吧