爬虫利器 Puppeteer 实战

Puppeteer 介绍

Puppeteer 翻译是操纵木偶的人，利用这个工具，我们能做一个操纵页面的人。Puppeteer是一个Nodejs的库，支持调用Chrome的API来操纵Web，相比较Selenium或是PhantomJs,它最大的特点就是它的操作Dom可以完全在内存中进行模拟既在V8引擎中处理而不打开浏览器，而且关键是这个是Chrome团队在维护，会拥有更好的兼容性和前景。

`Puppeteer` 用处

利用网页生成PDF、图片
爬取SPA应用，并生成预渲染内容（即“SSR” 服务端渲染）
可以从网站抓取内容
自动化表单提交、UI测试、键盘输入等
帮你创建一个最新的自动化测试环境（chrome），可以直接在此运行测试用例6.捕获站点的时间线，以便追踪你的网站，帮助分析网站性能问题

Puppeteer 使用

安装 `Puppeteer`

由于封网，直接下载 Chromium 会失败，可以先阻止下载 Chromium 然后再手动下载它

# 安装命令

npm i puppeteer --save

# 错误信息

ERROR: Failed to download Chromium r515411! Set "PUPPETEER_SKIP_CHROMIUM_DOWNLOAD" env variable to skip download.

# 设置环境变量跳过下载 Chromium

set PUPPETEER_SKIP_CHROMIUM_DOWNLOAD=1 

# 或者可以这样干，只下载模块而不build

npm i --save puppeteer --ignore-scripts

# 成功安装模块

+ puppeteer@0.13.0

added 1 package in 1.77s

手动下载 Chromium，下载完后将压缩包解压，会有个 Chromium.app，将其放在你喜欢的目录下，例如 /Users/huqiyang/Documents/project/z/chromium/Chromium.app。正常安装包后 Chromium.app 会在 .local-chromium中

Tip：下载 Chromium 失败解决办法

更换国内Chromium源
PUPPETEER_DOWNLOAD_HOST=https://storage.googleapis.com.cnpmjs.org

npm i puppeteer
或者用 cnpm 安装
npm install -g cnpm --registry=https://registry.npm.taobao.org

cnpm i puppeteer

点击查阅 `Puppeteer` API

初试 `Puppeteer`，截个图吧

知识点

puppeteer.launch 启动浏览器实例
browser.newPage() 创建一个新页面
page.goto 进入指定网页
page.screenshot 截图

const puppeteer = require('puppeteer');

(async () => {

  const browser = await (puppeteer.launch({

    // 若是手动下载的chromium需要指定chromium地址, 默认引用地址为 /项目目录/node_modules/puppeteer/.local-chromium/

    executablePath: '/Users/huqiyang/Documents/project/z/chromium/Chromium.app/Contents/MacOS/Chromium',

    //设置超时时间

    timeout: 15000,

    //如果是访问https页面 此属性会忽略https错误

    ignoreHTTPSErrors: true,

    // 打开开发者工具, 当此值为true时, headless总为false

    devtools: false,

    // 关闭headless模式, 不会打开浏览器

    headless: false

  }));

  const page = await browser.newPage();

  await page.goto('https://www.jianshu.com/u/40909ea33e50');

  await page.screenshot({

    path: 'jianshu.png',

    type: 'png',

    // quality: 100, 只对jpg有效

    fullPage: true,

    // 指定区域截图，clip和fullPage两者只能设置一个

    // clip: {

    //   x: 0,

    //   y: 0,

    //   width: 1000,

    //   height: 40

    // }

  });

  browser.close();

})();

运行结果

image.png

进阶，获取网易云音乐的歌词和评论

网易云音乐的API经过AES和RSA算法加密，需要携带加密的信息通过POST方式请求才能获取到数据。但 Puppeteer 出现后，这些都不重要了，只要它页面上显示了，通过 Puppeteer 都能获取到该元素。

知识点

page.type 获取输入框焦点并输入文字
page.keyboard.press 模拟键盘按下某个按键，目前mac上组合键无效为已知bug
page.waitFor 页面等待，可以是时间、某个元素、某个函数
page.frames() 获取当前页面所有的 iframe，然后根据 iframe 的名字精确获取某个想要的 iframe
iframe.$('.srchsongst') 获取 iframe 中的某个元素
iframe.evaluate() 在浏览器中执行函数，相当于在控制台中执行函数，返回一个 Promise
Array.from 将类数组对象转化为对象
page.click() 点击一个元素
iframe.$eval() 相当于在 iframe 中运行 document.queryselector 获取指定元素，并将其作为第一个参数传递
iframe.$$eval 相当于在 iframe 中运行 document.querySelectorAll 获取指定元素数组，并将其作为第一个参数传递

const fs = require('fs');

const puppeteer = require('puppeteer');

(async () => {

  const browser = await (puppeteer.launch({ executablePath: '/Users/huqiyang/Documents/project/z/chromium/Chromium.app/Contents/MacOS/Chromium', headless: false }));

  const page = await browser.newPage();

  // 进入页面

  await page.goto('https://music.163.com/#');

  // 点击搜索框拟人输入 鬼才会想起

  const musicName = '鬼才会想';

  await page.type('.txt.j-flag', musicName, {delay: 0});

  // 回车

  await page.keyboard.press('Enter');

  // 获取歌曲列表的 iframe

  await page.waitFor(2000);

  let iframe = await page.frames().find(f => f.name() === 'contentFrame');

  const SONG_LS_SELECTOR = await iframe.$('.srchsongst');

  // 获取歌曲 鬼才会想起 的地址

  const selectedSongHref = await iframe.evaluate(e => {

    const songList = Array.from(e.childNodes);

    const idx = songList.findIndex(v => v.childNodes[1].innerText.replace(/\s/g, '') === '鬼才会想起');

    return songList[idx].childNodes[1].firstChild.firstChild.firstChild.href;

  }, SONG_LS_SELECTOR);

  // 进入歌曲页面

  await page.goto(selectedSongHref);

  // 获取歌曲页面嵌套的 iframe

  await page.waitFor(2000);

  iframe = await page.frames().find(f => f.name() === 'contentFrame');

  // 点击 展开按钮

  const unfoldButton = await iframe.$('#flag_ctrl');

  await unfoldButton.click();

  // 获取歌词

  const LYRIC_SELECTOR = await iframe.$('#lyric-content');

  const lyricCtn = await iframe.evaluate(e => {

    return e.innerText;

  }, LYRIC_SELECTOR);

  console.log(lyricCtn);

  // 截图

  await page.screenshot({

    path: '歌曲.png',

    fullPage: true,

  });

  // 写入文件

  let writerStream = fs.createWriteStream('歌词.txt');

  writerStream.write(lyricCtn, 'UTF8');

  writerStream.end();

  // 获取评论数量

  const commentCount = await iframe.$eval('.sub.s-fc3', e => e.innerText);

  console.log(commentCount);

  // 获取评论

  const commentList = await iframe.$$eval('.itm', elements => {

    const ctn = elements.map(v => {

      return v.innerText.replace(/\s/g, '');

    });

    return ctn;

  });

  console.log(commentList);

})();

运行结果

image.png

高级爬虫

爬取SPA应用，并生成预渲染内容（即“SSR” 服务端渲染），通俗讲就是在页面上显示的内容我们都能获取到。下面我们就通过爬取 瓜子二手车直卖网 的车辆信息来认识它。

首先通过 axios 来试试

const axios = require('axios');

const useAxios = () => {

  axios.get('https://www.guazi.com/hz/buy/')

    .then(((result) => {

      console.log(result.data);

    }))

    .catch((err) => {

      console.log(err);

    });

};

结果它返回给我这个玩意，这显然不是我要的内容

image.png

通过 Puppeteer 爬取

const fs = require('fs');

const puppeteer = require('puppeteer');

(async () => {

  const browser = await (puppeteer.launch({ executablePath: '/Users/huqiyang/Documents/project/z/chromium/Chromium.app/Contents/MacOS/Chromium', headless: true }));

  const page = await browser.newPage();

  // 进入页面

  await page.goto('https://www.guazi.com/hz/buy/');

  // 获取页面标题

  let title = await page.title();

  console.log(title);

  // 获取汽车品牌

  const BRANDS_INFO_SELECTOR = '.dd-all.clearfix.js-brand.js-option-hid-info';

  const brands = await page.evaluate(sel => {

    const ulList = Array.from($(sel).find('ul li p a'));

    const ctn = ulList.map(v => {

      return v.innerText.replace(/\s/g, '');

    });

    return ctn;

  }, BRANDS_INFO_SELECTOR);

  console.log('汽车品牌: ', JSON.stringify(brands));

  let writerStream = fs.createWriteStream('car_brands.json');

  writerStream.write(JSON.stringify(brands, undefined, 2), 'UTF8');

  writerStream.end();

  // await bodyHandle.dispose();

  // 获取车源列表

  const CAR_LIST_SELECTOR = 'ul.carlist';

  const carList = await page.evaluate((sel) => {

    const catBoxs = Array.from($(sel).find('li a'));

    const ctn = catBoxs.map(v => {

      const title = $(v).find('h2.t').text();

      const subTitle = $(v).find('div.t-i').text().split('|');

      return {

        title: title,

        year: subTitle[0],

        milemeter: subTitle[1]

      };

    });

    return ctn;

  }, CAR_LIST_SELECTOR);

  console.log(`总共${carList.length}辆汽车数据: `, JSON.stringify(carList, undefined, 2));

  // 将车辆信息写入文件

  writerStream = fs.createWriteStream('car_info_list.json');

  writerStream.write(JSON.stringify(carList, undefined, 2), 'UTF8');

  writerStream.end();

  browser.close();

})();

运行结果

image.png

资料

Puppeteer 官方文档
键名映射
网上的更多教程：Puppeteer 入门教程、Puppeteer 初探之前端自动化测试、使用puppeteer-autotest 来为cnodejs 做自动化测试.
多多关注 Puppeteer 的 issues 来解决问题

作者：淡就加点盐
链接：https://www.jianshu.com/p/a9a55c03f768
来源：简书

爬虫利器 Puppeteer 实战的更多相关文章

爬虫利器 Puppeteer
http://wintersmilesb101.online/2017/03/24/use-phantomjs-dynamic/ 一起学爬虫 Node.js 爬虫篇(三)使用 PhantomJS ...
web前端自动化测试/爬虫利器puppeteer介绍
web前端自动化测试/爬虫利器puppeteer介绍 Intro Chrome59(linux.macos). Chrome60(windows)之后,Chrome自带headless(无界面)模式很 ...
ETL利器Kettle实战应用解析系列一【Kettle使用介绍】
本系列文章主要索引如下: 一.ETL利器Kettle实战应用解析系列一[Kettle使用介绍] 二.ETL利器Kettle实战应用解析系列二 [应用场景和实战DEMO下载] 三.ETL利器Kettle ...
(转载)ETL利器Kettle实战应用解析系列一【Kettle使用介绍】
http://www.cnblogs.com/limengqiang/archive/2013/01/16/kettleapply1.html ETL利器Kettle实战应用解析系列一[Kettle使 ...
SuperSpider——打造功能强大的爬虫利器
SuperSpider——打造功能强大的爬虫利器 1.爬虫的介绍图1-1 爬虫(spider) 网络爬虫(web spider)是一个自动的通过网络抓取互联网上的网页的程序,在当今互联网中 ...
python爬虫利器Selenium使用详解
简介: 用pyhon爬取动态页面时普通的urllib2无法实现,例如下面的京东首页,随着滚动条的下拉会加载新的内容,而urllib2就无法抓取这些内容,此时就需要今天的主角selenium. Sele ...
(转)Python爬虫利器一之Requests库的用法
官方文档以下内容大多来自于官方文档,本文进行了一些修改和总结.要了解更多可以参考官方文档安装利用 pip 安装 $ pip install requests 或者利用 easy_install ...
infolite（中文检索系统）~爬虫利器
infolite 今天为大家分享一个爬虫利器-infolite.这是一个chrome浏览器的插件,如果你在写爬虫的时候对复杂繁琐的控件路径分析是深恶痛绝.那么infolite绝对是你最好的选择. 安装 ...
Python 爬虫利器 Selenium 介绍
Python 爬虫利器 Selenium 介绍转 https://mp.weixin.qq.com/s/YJGjZkUejEos_yJ1ukp5kw 前面几节,我们学习了用 requests 构造页 ...

随机推荐

IDE 热部署配置
从eclipse切换到IDE,遇到应用不能热部署问题,解决如下 1.tomcat 中server配置下面三点需要注意 2.tomcat的deployment 中需要选择war exploded而不是 ...
用 Python 获取 B 站播放历史记录
用 Python 获取 B 站播放历史记录最近 B 站出了一个年度报告,统计用户一年当中在 B 站上观看视频的总时长和总个数.过去一年我居然在 B 站上看了2600+个视频,总计251个小时,居然花 ...
Java 基于WebMagic 开发的网络爬虫
第一次接触爬虫,之所以选择WebMagic,是因为文档齐全.用法简单.而且框架一直在维护. WebMagic是一个简单灵活的Java爬虫框架.基于WebMagic,我们可以快速开发出一个高效.易维护的 ...
04 Javascript的数据类型数组函数
javascript:包含ECMAscript DOM BOM 描述了以下内容: 语法类型语句关键字保留字运算符对象引入方式: <script> alert(123) < ...
MogoDB（6）--mongoDB高可用和4.0特性
5.1.MongoDB 用户管理 1.用户管理1.1.添加用户为 testdb 添加 tom 用户 use testdb db.createUser({user:"tom",pwd ...
001_angular4.0框架学习
1. Cannot find module 'angular2-in-memory-web-api' 报这个错误的时候是没有安装这个包要手动安装下包命令: npm i angular-in ...
frist Django app — 三、 View
前面已经说过了Django中model的一些用法,包括orm,以及操作的api,接下来就是搭一些简单的界面学习view——Django中的view.主要介绍以下两个方面: url映射请求处理模板文 ...
性能测试进阶指南——基础篇之磁盘IO
本文旨在帮助测试人员对性能测试常用指标做一个简单的讲解,主要包括CPU.内存.磁盘和网络带宽等系统资源,本文仅仅局限于Linux系统,Windows Server系统暂不做考虑. 使用iostat分析 ...
linux光标操作
看一个真正的专家操作命令行绝对是一种很好的体验-光标在单词之间来回穿梭,命令行不同的滚动. 在这里强烈建立适应GUI节目的开发者尝试一下在提示符下面工作. 但是事情也不是那么简单,还是需要知道“如何去 ...
进制与进制转换DAY2
进制和进制转换一.进制的基础 1.十进制(案例) 系数:0-9 进位规则:逢十进一权:基数的次幂基数:几进制基数就是几规律:右侧第一位的权是10的0次幂,每向左移动一位次幂会+1. 进制的表示 ...

爬虫利器 Puppeteer 实战

Puppeteer 介绍

Puppeteer 用处

Puppeteer 使用

安装 Puppeteer

点击查阅 Puppeteer API

初试 Puppeteer，截个图吧

进阶，获取网易云音乐的歌词和评论

高级爬虫

资料

爬虫利器 Puppeteer 实战的更多相关文章

随机推荐

热门专题

`Puppeteer` 用处

安装 `Puppeteer`

点击查阅 `Puppeteer` API

初试 `Puppeteer`，截个图吧