[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件

接着这篇文章[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件继续，在这篇文章中实现了采集与静态文件的生成，在实际的采集项目中，应该是先入库再选择性的生成静态文件。

那么我选择的数据库是mongodb,为什么用这个数据库，因为这个数据库是基于集合，数据的操作基本是json，与dom模块cheerio具有非常大的亲和力，cheerio处理过滤出来的数据，可以直接插入mongodb,不需要经过任何的处理，非常的便捷，当然跟node.js的亲和力那就不用说了，更重要的是，性能很棒。这篇文章我就不具体写mongodb的基本用法，到时候会另起文章从0开始写mongodb基本常用用法.先看下入库的效果与生成静态文件的效果:

我在这个阶段，把爬虫分离成2个模块，采集入库( crawler.js ), 生成静态文件(makeHtml.js).

crawler.js：

 var http = require('http');

 var cheerio = require('cheerio');

 var mongoose = require('mongoose');

 mongoose.Promise = global.Promise;

 var DB_URL = 'mongodb://localhost:27017/crawler';

 var aList = []; //博客文章列表信息

 var aUrl = []; //博客所有的文章url

 var db = mongoose.createConnection(DB_URL);

 db.on('connected', function (err) {

     if (err) {

         console.log(err);

     } else {

         console.log('db connected success');

     }

 });

 var Schema = mongoose.Schema;

 var arcSchema = new Schema({

     id: Number, //文章id

     title: String, //文章标题

     url: String, //文章链接

     body: String, //文章内容

     entry: String, //摘要

     listTime: Date //发布时间

 });

 var Article = db.model('Article', arcSchema);

 function saveArticle(arcInfo) {

     var arcModel = new Article(arcInfo);

     arcModel.save(function (err, result) {

         if (err) {

             console.log(err);

         } else {

             console.log(`${arcInfo['title']}   插入成功`);

         }

     });

 }

 function filterArticle(html) {

     var $ = cheerio.load(html);

     var arcDetail = {};

     var title = $("#cb_post_title_url").text();

     var href = $("#cb_post_title_url").attr("href");

     var re = /\/(\d+)\.html/;

     var id = href.match(re)[1];

     var body = $("#cnblogs_post_body").html();

     return {

         id: id,

         title: title,

         url: href,

         body: body

     };

 }

 function crawlerArc(url) {

     var html = '';

     var str = '';

     var arcDetail = {};

     http.get(url, function (res) {

         res.on('data', function (chunk) {

             html += chunk;

         });

         res.on('end', function () {

             arcDetail = filterArticle(html);

             saveArticle(arcDetail);

             if ( aUrl.length ) {

                 setTimeout(function () {

                     if (aUrl.length) {

                         crawlerArc(aUrl.shift());

                     }

                 }, 100);

             }else {

                 console.log( '采集任务完成' );

                 return;

             }

         });

     });

 }

 function filterHtml(html) {

     var $ = cheerio.load(html);

     var arcList = [];

     var aPost = $("#content").find(".post-list-item");

     aPost.each(function () {

         var ele = $(this);

         var title = ele.find("h2 a").text();

         var url = ele.find("h2 a").attr("href");

         ele.find(".c_b_p_desc a").remove();

         var entry = ele.find(".c_b_p_desc").text();

         ele.find("small a").remove();

         var listTime = ele.find("small").text();

         var re = /\d{4}-\d{2}-\d{2}\s*\d{2}[:]\d{2}/;

         listTime = listTime.match(re)[0];

         arcList.push({

             title: title,

             url: url,

             entry: entry,

             listTime: listTime

         });

     });

     return arcList;

 }

 function nextPage(html) {

     var $ = cheerio.load(html);

     var nextUrl = $("#pager a:last-child").attr('href');

     if (!nextUrl) return getArcUrl(aList);

     var curPage = $("#pager .current").text();

     if (!curPage) curPage = 1;

     var nextPage = nextUrl.substring(nextUrl.indexOf('=') + 1);

     if (curPage < nextPage) crawler(nextUrl);

 }

 function crawler(url) {

     http.get(url, function (res) {

         var html = '';

         res.on('data', function (chunk) {

             html += chunk;

         });

         res.on('end', function () {

             aList.push(filterHtml(html));

             nextPage(html);

         });

     });

 }

 function getArcUrl(arcList) {

     for (var key in arcList) {

         for (var k in arcList[key]) {

             aUrl.push(arcList[key][k]['url']);

         }

     }

     crawlerArc(aUrl.shift());

 }

 var url = 'http://www.cnblogs.com/ghostwu/';

 crawler(url);

其他的核心模块没有怎么改动，主要增加了数据库连接，数据库创建，集合创建( 集合相当于关系型数据库中的表 )，Schema( 相当于关系型数据库的表结构 ).
mongoose操作数据库( save:插入数据 ).分离了文件生成模块.

makeHtml.js文件

 var fs = require('fs');

 var jade = require('jade');

 var mongoose = require('mongoose');

 mongoose.Promise = global.Promise;

 var DB_URL = 'mongodb://localhost:27017/crawler';

 var allArc = [];

 var count = 0;

 var db = mongoose.createConnection(DB_URL);

 db.on('connected', function (err) {

     if (err) {

         console.log(err);

     } else {

         console.log('db connected success');

     }

 });

 var Schema = mongoose.Schema;

 var arcSchema = new Schema({

     id: Number, //文章id

     title: String, //文章标题

     url: String, //文章链接

     body: String, //文章内容

     entry: String, //摘要

     listTime: Date //发布时间

 });

 var Article = db.model('Article', arcSchema);

 function makeHtml(arcDetail) {

     str = jade.renderFile('./views/layout.jade', arcDetail);

     ++count;

     fs.writeFile('./html/' + count + '.html', str, function (err) {

         if (err) {

             console.log(err);

         }

         console.log( `${arcDetail['id']}.html创建成功` + count );

         if ( allArc.length ){

             setTimeout( function(){

                 makeHtml( allArc.shift() );

             }, 100 );

         }

     });

 }

 function getAllArc(){

     Article.find( {}, function( err, arcs ){

         allArc = arcs;

         makeHtml( allArc.shift() );

     } ).sort( { 'id' : 1 } );

 }

 getAllArc();

[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件的更多相关文章

[js高手之路]Node.js+jade+mongoose实战todolist(分页,ajax编辑,删除)
该系列文章索引: [js高手之路]node js系列课程-创建简易web服务器与文件读写 [js高手之路]node js系列课程-图解express+supervisor+ejs用法 [js高手之路] ...
[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件
这个周末,恶补了一下jade模板引擎,就为生成静态html文件,这篇文章需要知道jade以及看过我的上篇文章,我先给出他们的参考链接: [js高手之路]Node.js模板引擎教程-jade速学与实战1 ...
[js高手之路]Node.js+jade+express+mongodb+mongoose+promise实现todolist
promise主要是用来解决异步回调问题,其实还有好几种比promise更好的方案,后面再说,这节,我们先用promise来改造下,我以前写的一篇文章[js高手之路]javascript腾讯面试题学习 ...
[js高手之路]Node.js实现简易的爬虫-抓取博客文章列表信息
抓取目标:就是我自己的博客:http://www.cnblogs.com/ghostwu/ 需要实现的功能: 抓取文章标题,超链接,文章摘要,发布时间需要用到的库: node.js自带的http库 ...
[js高手之路]Node.js实现简易的爬虫-抓取博客所有文章列表信息
抓取目标:就是我自己的博客:http://www.cnblogs.com/ghostwu/ 需要实现的功能: 抓取博客所有的文章标题,超链接,文章摘要,发布时间需要用到的库: node.js自带的h ...
[js高手之路]Node.js模板引擎教程-jade速学与实战2-流程控制,转义与非转义
一.转义与非转义 jade模板文件代码: doctype html html head meta(charset='utf-8') title jade学习-by ghostwu body h3 转义 ...
[js高手之路]Node.js模板引擎教程-jade速学与实战1
环境准备: 全局安装jade: npm install jade -g 初始化项目package.json: npm init --yes 安装完成之后,可以使用 jade --help 查看jade ...
[js高手之路]Node.js模板引擎教程-jade速学与实战1-基本用法
环境准备: 全局安装jade: npm install jade -g 初始化项目package.json: npm init --yes 安装完成之后,可以使用 jade --help 查看jade ...
[js高手之路]node js系列课程-图解express+supervisor+ejs用法
上文通过node js自带的http模块搭建了一个简易的服务器,实际在开发中,一般用的是express框架,本文我们就来讲讲项目开发中必备不可少的几样东西: 服务器( express ) 路由( ex ...

随机推荐

css3类选择器之结合元素选择器和多类选择器
css3类选择器之结合元素选择器和多类选择器用法: <!DOCTYPE html> <html lang="en"> <head> <me ...
学习笔记TF049:TensorFlow 模型存储加载、队列线程、加载数据、自定义操作
生成检查点文件(chekpoint file),扩展名.ckpt,tf.train.Saver对象调用Saver.save()生成.包含权重和其他程序定义变量,不包含图结构.另一程序使用,需要重新创建 ...
VMware Workstation 12 Pro 之安装XP系统
使用VMware Workstation 12 Pro 安装XP系统 ... <个人觉得现在没有必要再给自己的电脑装XP系统了.虽然XP很小..但是功能相比现在的Windows差很多.兼容性与 ...
Windows7 中常用的一些DOS命令总结
Windows7 中常用的一些DOS命令总结... ----------------------- -------------------------------------------- dos,是 ...
composer安装报错Composer throws [ReflectionException] Class Fxp\Composer\AssetPlugin\Repository\NpmRepository does not exist
解决方法:删除C:\Users\Administrator\AppData\Roaming\Composer\vendor\fxp下的文件
java中 this 的三种用法
Java中this的三种用法调用属性 (1)this可以调用本类中的任何成员变量调用方法(可省略) (2)this调用本类中的成员方法(在main方法里面没有办法通过this调用) 调用构造方法 ...
渗透常用手工SQL注入语句合集
1.判断有无注入点; and 1=1 and 1=2 2.猜表一般的表的名称无非是admin adminuser user pass password 等..and 0<>(select ...
Json简介1
使用Notepad++编程: <!DOCTYPE html><html><head><meta charset="UTF-8">&l ...
C++基础：二维数组动态的申请内存和释放内存
使用二维数组的时候,有时候事先并不知道数组的大小,因此就需要动态的申请内存.常见的申请内存的方法有两种:malloc/free 和 new/delete. 一.malloc/free (1)申请一维数 ...
tomcat配置不用访问工程名
<Host name="localhost" appBase="/server/webapps" unpackWARs="true" ...

[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件

[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件的更多相关文章

随机推荐

热门专题