node - 简单的爬虫案例

cherrio模块

安装

cnpm install cherrio

使用方法

const cheerio = require('cheerio')

const $ = cheerio.load('<h2 class="title">Hello world</h2>')

$('h2.title').text('Hello there!')

$('h2').addClass('welcome')

$.html()

//=> <html><head></head><body><h2 class="title welcome">Hello there!</h2></body></html>

request模块

var request = require('request');

request('http://www.google.com', function (error, response, body) {

  console.log('error:', error); // Print the error if one occurred

  console.log('statusCode:', response && response.statusCode); // Print the response status code if a response was received

  console.log('body:', body); // Print the HTML for the Google homepage.

});

爬虫系统 request cheerio

爬取一个网站的内容信息
分析内容
储存数据下载图片

简单的爬虫

//发起服务端请求 请求一个网页

const request = require('request')

const  fs= require('fs')

const path= require('path')

const cheerio = require('cheerio')

//以百度为例

let url ='https://www.baidu.com/'

request(url,(err,response,body)=>{

 console.log(err)

 //把爬取到的body 写入新文件中

  fs.writeFile(path.join(__dirname,'./baidu.html'),body,(err)=>{

    if(err){

      console.log('爬取失败')

    }else{

      console.log('爬取成功')

    }

  })

//根据一个网址 下载对应的网页文件

const $ = cheerio.load(body)

let imgs = []

// 用正则判断数组中的路径是否存在https

var Reg = /(http[s]?|ftp)/;

$('img').each((index, ele) => {  // 遍历所有

    var src = $(e).attr('src');

    if (!Reg.test(src)) {

        src = src.replace(/\/{2}/, 'https://') //正则判断

    }

    imgs.push(src)

})

// 下载数组里的图片

for (let index = 0; index < imgs.length; index++) {

    if (imgs[index].indexOf('png') !== -1) {

        request(imgs[index]).pipe(fs.createWriteStream(`./img/${index}.png`))    //用下标命名，要建好img文件夹

    };

}

})

node - 简单的爬虫案例的更多相关文章

node 简单的爬虫
基于express爬虫, 1,node做爬虫的优势首先说一下node做爬虫的优势第一个就是他的驱动语言是JavaScript.JavaScript在nodejs诞生之前是运行在浏览器上的脚本语言, ...
简单python爬虫案例(爬取慕课网全部实战课程信息)
技术选型下载器是Requests 解析使用的是正则表达式效果图: 准备好各个包 # -*- coding: utf-8 -*- import requests #第三方下载器 import re ...
NodeJs实现简单的爬虫
1.爬虫:爬虫,是一种按照一定的规则,自动地抓取网页信息的程序或者脚本:利用NodeJS实现一个简单的爬虫案例,爬取Boss直聘网站的web前端相关的招聘信息,以广州地区为例: 2.脚本所用到的nod ...
每天几分钟跟小猫学前端之node系列：用node实现最简单的爬虫
先来段求分小视频: https://www.iesdouyin.com/share/video/6550631947750608142/?region=CN&mid=6550632036246 ...
用node.js从零开始去写一个简单的爬虫
如果你不会Python语言,正好又是一个node.js小白,看完这篇文章之后,一定会觉得受益匪浅,感受到自己又新get到了一门技能,如何用node.js从零开始去写一个简单的爬虫,十分钟时间就能搞定, ...
Python 简单爬虫案例
Python 简单爬虫案例 import requests url = "https://www.sogou.com/web" # 封装参数 wd = input('enter a ...
纯手工打造简单分布式爬虫(Python)
前言这次分享的文章是我<Python爬虫开发与项目实战>基础篇第七章的内容,关于如何手工打造简单分布式爬虫 (如果大家对这本书感兴趣的话,可以看一下试读样章),下面是文章的具体内容. ...
nodejs实现最简单的爬虫
本文将以抓取百度搜索结果中关键词的相关搜索为例子,教会大家以nodejs制作最简单的爬虫: 开始之前呢,先来个公众号求粉: 将使用的node模块及属性介绍: request: ...
视频博文结合的教程：用nodejs实现简单的爬虫
教学视频地址: https://v.qq.com/x/page/b0643tut4ze.html 前言本喵最近工作中需要使用node,并也想晋升为全栈工程师,所以开始了node学习之旅,在学习过 ...

随机推荐

哪些工具可以提升PHP开发效率
本文就我自己在开发过程中的一点经验,谈谈如何利用工具来提升开发工作的编码效率, IDE(phpstorm 收费) 一个好的IDE真的可以给开发人员节省大量的时间,我从最开始使用editplus 到su ...
Elasticsearch系列---结构化搜索
概要结构化搜索针对日期.时间.数字等结构化数据的搜索,它们有自己的格式,我们可以对它们进行范围,比较大小等逻辑操作,这些逻辑操作得到的结果非黑即白,要么符合条件在结果集里,要么不符合条件在结果集之外 ...
18年第一弹射和网络有关；艾曲塞嗯诶系列篇 one
1:当指定接口运行在RIP2组播方式时,以下说法正确的是 2个答案 A 只接收RIPv2组播报文 B 不接收RIPV1 广播报文 2 下面哪条命令是把PPP的认证方式设置为PAP? C ppp au ...
HCNA 2017年01月26日
[Huawei]ping 127.0.0.1 PING 127.0.0.1: 56 data bytes, press CTRL_C to break Reply from 127.0.0.1: by ...
web api 的安全认证问题，对外开放的时候需要考虑到安全的问题
关于 OWIN OAuth , web api的认证,全局验证, 安全方面的验证有必要去自己捣鼓一下.
Ubuntu16手动安装OpenStack
记录大佬的博客全文转载于https://www.voidking.com/dev-ubuntu16-manual-openstack-env/ 前言 <Ubuntu16安装OpenStack&g ...
if continue的用法（跳过本次循环，执行下一个循环）
Python continue 语句跳出本次循环当需要跳过本次循环的时候,使用continue能跳过本次循环,直接下一个循环如下脚本: for url in alllink: if url == ...
AttributeError: module 'cv2' has no attribute 'SIFT'解决总结
AttributeError: module 'cv2' has no attribute 'SIFT' 遇到该问题时,网友多是建议补个包,即pip install opencv-contrib-py ...
js----UTC时间于本地时间相差8小时问题
js----UTC时间于本地时间相差8小时问题 js获取周几有两个方法getDay() getUTCDay(),但是它们是有区别的,前者返回的本地时间,后者返回的UTC时间,一般情况下,两者相差8个小 ...
java实现字符串翻转
public class StringReverse { /*一共写了三个函数func1 func2 func3 * 时间: 2019年9月12日9:00 * func1用的反向输出到一个新的字符串中 ...

node - 简单的爬虫案例

cherrio模块

安装

使用方法

request模块

爬虫系统 request cheerio

简单的爬虫

node - 简单的爬虫案例的更多相关文章

随机推荐

热门专题