node爬虫扒小说

Step 1: 万年不变的初始化项目，安装依赖

cnpm i express cheerio superagent superagent-charset async -S

express 就不用多说了，比较流行的node框架

cheerio 页面数据解析模块。一般都习惯称它node版的jquery,专门用来操作网页dom元素，使用方式和jquery基本相同。

superagent superagent是nodejs里一个非常方便的客户端请求代码模块，superagent是一个轻量级的，渐进式的ajax API，可读性好，学习曲线低，内部依赖nodejs原生的请求API,适用于nodejs环境下。

superagent-charset 很明显，处理编码的。

async 见名知意，node的异步模块。

Step 2: 编写node程序

/*

   以爬取起点小说某文为例

*/

// 1. 首先引入模块

const cheerio = require('cheerio')

const express = require('express')

const app = express()

const superagent = require('superagent')

require('superagent-charset')(superagent)

const async = require('async');

let total = 0 // 总章节数

let id = 0 // 计数器

const chapter = 10 // 爬取多少章

const url = 'https://book.qidian.com/info/1011146676#Catalog' // 章节列表页面


// 处理请求

app.get('/',(req,response,next)=>{

    superagent.get(url).charset('UTF-8').end((err,res)=>{

        var $ = cheerio.load(res.text); // 读取章节列表页面

        let urls = []

        total = $(".volume-wrap li").length // 获取所以章节元素拿到总章节数
　　　　　// 循环获取每个章节的页面url并push进urls

        $('.volume-wrap li').each(function(i,v){

            if(i < chapter){

                urls.push('http:' + $(v).find("a").attr('href'))

            }

        })

　　　　　// 通过async去请求urls里的地址，并通过fetchUrl方法拆分数据。这里的async.mapLimit方法有点类似es6里的promise.all　

        async.mapLimit(urls,chapter,(url,callback)=>{

            id++

            fetchUrl(url,callback,id);

        },(err,results)=>{

            response.send(results);

        })

    })

})

// 去空格和空格转义字符

function trim(str){

  return str.replace(/(^\s*)|(\s*$)/g, '').replace(/&nbsp;/g, '')

}

// 将Unicode转汉字

function reconvert(str) {

  str = str.replace(/(&#x)(\w{1,4});/gi, function ($0) {

    return String.fromCharCode(parseInt(escape($0).replace(/(%26%23x)(\w{1,4})(%3B)/g, "$2"), 16));

  });

  return str

}

// 加载每个章节并拆分数据返回

function fetchUrl(url,callback,id){

    superagent.get(url)

        .charset('UTF-8')

        .end(function(err,res){

            let $ = cheerio.load(res.text);

            let arr = []

            let content = reconvert($(".read-content").html())

            const obj = {

                id: id,

                err: 0,

                bookName: $('.text-info a').eq(0).text().substring(1),

                title: $('.j_chapterName').text(),

                content: content.toString()

            }

            callback(null,obj)

        })

}

// 监听窗口

const PORT = 8080

app.listen(PORT,function(){

    console.log("server listening on " + PORT)

})

最后，运行node程序，本地打开localhost:8080 就可以看到数据了

node爬虫扒小说的更多相关文章

继续node爬虫 — 百行代码自制自动AC机器人日解千题攻占HDOJ
前言不说话,先猛戳 Ranklist 看我排名. 这是用 node 自动刷题大概半天的 "战绩",本文就来为大家简单讲解下如何用 node 做一个 "自动AC机&quo ...
Node爬虫
Node爬虫参考 http://www.cnblogs.com/edwardstudy/p/4133421.html 所谓的爬虫就是发送请求,并将响应的数据做一些处理只不过不用浏览器来发送请求需 ...
python爬虫之小说网站--下载小说(正则表达式)
python爬虫之小说网站--下载小说(正则表达式) 思路: 1.找到要下载的小说首页,打开网页源代码进行分析(例:https://www.kanunu8.com/files/old/2011/244 ...
node爬虫gbk中文乱码问题
刚入坑node 写第二个node爬虫时,遇到了这个坑,记录一下. 主要步骤: 1.安装iconv-lite 输入npm install iconv-lite 2.将接收到的网页源码以二进制的方式存储下 ...
简单的node爬虫练手，循环中的异步转同步
简单的node爬虫练手,循环中的异步转同步转载:https://blog.csdn.net/qq_24504525/article/details/77856989 看到网上一些基于node做的爬虫 ...
node爬虫（简版）
做node爬虫,首先像如何的去做这个爬虫,首先先想下思路,我这里要爬取一个页面的数据,要调取网页的数据,转换成页面格式(html+div)格式,然后提取里面独特的属性值,再把你提取的值,传送给你的页面 ...
node 爬虫 --- 批量下载图片
步骤一:创建项目 npm init 步骤二:安装 request,cheerio,async 三个模块 request 用于请求地址和快速下载图片流. https://github.com/reque ...
node爬虫的几种简易实现方式
说到爬虫大家可能会觉得很NB的东西,可以爬小电影,羞羞图,没错就是这样的.在node爬虫方面,我也是个新人,这篇文章主要是给大家分享几种实现node 爬虫的方式.第一种方式,采用node,js中的 s ...
有趣的Node爬虫，数据导出成Excel
最近一直没更新了诶,因为学习Backbone好头痛,别问我为什么不继续AngularJs~因为2.0要出来了啊,妈蛋!好,言归正传,最近帮我的好基友扒数据,他说要一些股票债券的数据.我一听,那不就是要 ...

随机推荐

php生成mysql数据字典
<?php /** * 生成mysql数据字典 */ // 配置数据库 $database = array(); $database['DB_HOST'] = '127.0.0.1'; $dat ...
分析MySQL中哪些情况下数据库索引会失效
要想分析MySQL查询语句中的相关信息,如是全表查询还是部分查询,就要用到explain. 一.explain 用法:explain +查询语句. id:查询语句的序列号,上面图片中只有一个selec ...
[USACO13DEC] Optimal Milking
Description n个点排成一排,点有点权,要求支持两种操作: 修改某个点的点权询问取出任意多且不相邻的点的点权和最大值 Solution 跟最大子段和一样,可以用分治做,用线段树记录一下左右 ...
windows 安装 keras
pip install keras 报错了,看报错信息是卡在scipy上了,查了一下 https://stackoverflow.com/questions/42240720/python-scipy ...
Layui上传图片带接口
layui.use('upload', function () { var upload = layui.upload; upload.render({ elem: '#LAY_avatarUploa ...
oracle创建用户、创建表空间、授权、建表
2.然后我就可以来创建用户了. create user zzg identified by zzg123; 3.创建好用户我们接着就可以修改用户的密码. alter user zzg identifi ...
在visual studio中设置点击左边选项卡中的类文件,右侧解决方案跳到对应的文件
在visual studio中如何设置点击左边选项卡中的类文件,右侧解决方案跳到对应的文件?比如说,VS上方的选项卡文件较多,我点击选项卡上的任一文件,解决方案中对应的文件突出显示 ...
140 - The 12th Zhejiang Provincial Collegiate Programming Contest（第三部分）
Earthstone Keeper Time Limit: 4 Seconds Memory Limit: 65536 KB Earthstone Keeper is a famous ro ...
Hybris IMPEX.
1.Impex是基于java Model的一种面向对象的数据操作手段,因此写impex代码前需要理清java Model之间的依赖关系. 2.基本语法:mode type[modifier=val ...
blfs（systemv版本）学习笔记-编译安装sudo并创建普通用户配置sudo权限
我的邮箱地址:zytrenren@163.com欢迎大家交流学习纠错! blfs书中sudo的安装配置章节:http://www.linuxfromscratch.org/blfs/view/8.3/ ...

node爬虫扒小说

node爬虫扒小说的更多相关文章

随机推荐

热门专题