[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件

接着这篇文章[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件继续，在这篇文章中实现了采集与静态文件的生成，在实际的采集项目中，应该是先入库再选择性的生成静态文件。

那么我选择的数据库是mongodb,为什么用这个数据库，因为这个数据库是基于集合，数据的操作基本是json，与dom模块cheerio具有非常大的亲和力，cheerio处理过滤出来的数据，可以直接插入mongodb,不需要经过任何的处理，非常的便捷，当然跟node.js的亲和力那就不用说了，更重要的是，性能很棒。这篇文章我就不具体写mongodb的基本用法，到时候会另起文章从0开始写mongodb基本常用用法.先看下入库的效果与生成静态文件的效果:

我在这个阶段，把爬虫分离成2个模块，采集入库( crawler.js ), 生成静态文件(makeHtml.js).

crawler.js：

 var http = require('http');

 var cheerio = require('cheerio');

 var mongoose = require('mongoose');

 mongoose.Promise = global.Promise;

 var DB_URL = 'mongodb://localhost:27017/crawler';

 var aList = []; //博客文章列表信息

 var aUrl = []; //博客所有的文章url

 var db = mongoose.createConnection(DB_URL);

 db.on('connected', function (err) {

     if (err) {

         console.log(err);

     } else {

         console.log('db connected success');

     }

 });

 var Schema = mongoose.Schema;

 var arcSchema = new Schema({

     id: Number, //文章id

     title: String, //文章标题

     url: String, //文章链接

     body: String, //文章内容

     entry: String, //摘要

     listTime: Date //发布时间

 });

 var Article = db.model('Article', arcSchema);

 function saveArticle(arcInfo) {

     var arcModel = new Article(arcInfo);

     arcModel.save(function (err, result) {

         if (err) {

             console.log(err);

         } else {

             console.log(`${arcInfo['title']}   插入成功`);

         }

     });

 }

 function filterArticle(html) {

     var $ = cheerio.load(html);

     var arcDetail = {};

     var title = $("#cb_post_title_url").text();

     var href = $("#cb_post_title_url").attr("href");

     var re = /\/(\d+)\.html/;

     var id = href.match(re)[1];

     var body = $("#cnblogs_post_body").html();

     return {

         id: id,

         title: title,

         url: href,

         body: body

     };

 }

 function crawlerArc(url) {

     var html = '';

     var str = '';

     var arcDetail = {};

     http.get(url, function (res) {

         res.on('data', function (chunk) {

             html += chunk;

         });

         res.on('end', function () {

             arcDetail = filterArticle(html);

             saveArticle(arcDetail);

             if ( aUrl.length ) {

                 setTimeout(function () {

                     if (aUrl.length) {

                         crawlerArc(aUrl.shift());

                     }

                 }, 100);

             }else {

                 console.log( '采集任务完成' );

                 return;

             }

         });

     });

 }

 function filterHtml(html) {

     var $ = cheerio.load(html);

     var arcList = [];

     var aPost = $("#content").find(".post-list-item");

     aPost.each(function () {

         var ele = $(this);

         var title = ele.find("h2 a").text();

         var url = ele.find("h2 a").attr("href");

         ele.find(".c_b_p_desc a").remove();

         var entry = ele.find(".c_b_p_desc").text();

         ele.find("small a").remove();

         var listTime = ele.find("small").text();

         var re = /\d{4}-\d{2}-\d{2}\s*\d{2}[:]\d{2}/;

         listTime = listTime.match(re)[0];

         arcList.push({

             title: title,

             url: url,

             entry: entry,

             listTime: listTime

         });

     });

     return arcList;

 }

 function nextPage(html) {

     var $ = cheerio.load(html);

     var nextUrl = $("#pager a:last-child").attr('href');

     if (!nextUrl) return getArcUrl(aList);

     var curPage = $("#pager .current").text();

     if (!curPage) curPage = 1;

     var nextPage = nextUrl.substring(nextUrl.indexOf('=') + 1);

     if (curPage < nextPage) crawler(nextUrl);

 }

 function crawler(url) {

     http.get(url, function (res) {

         var html = '';

         res.on('data', function (chunk) {

             html += chunk;

         });

         res.on('end', function () {

             aList.push(filterHtml(html));

             nextPage(html);

         });

     });

 }

 function getArcUrl(arcList) {

     for (var key in arcList) {

         for (var k in arcList[key]) {

             aUrl.push(arcList[key][k]['url']);

         }

     }

     crawlerArc(aUrl.shift());

 }

 var url = 'http://www.cnblogs.com/ghostwu/';

 crawler(url);

其他的核心模块没有怎么改动，主要增加了数据库连接，数据库创建，集合创建( 集合相当于关系型数据库中的表 )，Schema( 相当于关系型数据库的表结构 ).
mongoose操作数据库( save:插入数据 ).分离了文件生成模块.

makeHtml.js文件

 var fs = require('fs');

 var jade = require('jade');

 var mongoose = require('mongoose');

 mongoose.Promise = global.Promise;

 var DB_URL = 'mongodb://localhost:27017/crawler';

 var allArc = [];

 var count = 0;

 var db = mongoose.createConnection(DB_URL);

 db.on('connected', function (err) {

     if (err) {

         console.log(err);

     } else {

         console.log('db connected success');

     }

 });

 var Schema = mongoose.Schema;

 var arcSchema = new Schema({

     id: Number, //文章id

     title: String, //文章标题

     url: String, //文章链接

     body: String, //文章内容

     entry: String, //摘要

     listTime: Date //发布时间

 });

 var Article = db.model('Article', arcSchema);

 function makeHtml(arcDetail) {

     str = jade.renderFile('./views/layout.jade', arcDetail);

     ++count;

     fs.writeFile('./html/' + count + '.html', str, function (err) {

         if (err) {

             console.log(err);

         }

         console.log( `${arcDetail['id']}.html创建成功` + count );

         if ( allArc.length ){

             setTimeout( function(){

                 makeHtml( allArc.shift() );

             }, 100 );

         }

     });

 }

 function getAllArc(){

     Article.find( {}, function( err, arcs ){

         allArc = arcs;

         makeHtml( allArc.shift() );

     } ).sort( { 'id' : 1 } );

 }

 getAllArc();

[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件的更多相关文章

[js高手之路]Node.js+jade+mongoose实战todolist(分页,ajax编辑,删除)
该系列文章索引: [js高手之路]node js系列课程-创建简易web服务器与文件读写 [js高手之路]node js系列课程-图解express+supervisor+ejs用法 [js高手之路] ...
[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件
这个周末,恶补了一下jade模板引擎,就为生成静态html文件,这篇文章需要知道jade以及看过我的上篇文章,我先给出他们的参考链接: [js高手之路]Node.js模板引擎教程-jade速学与实战1 ...
[js高手之路]Node.js+jade+express+mongodb+mongoose+promise实现todolist
promise主要是用来解决异步回调问题,其实还有好几种比promise更好的方案,后面再说,这节,我们先用promise来改造下,我以前写的一篇文章[js高手之路]javascript腾讯面试题学习 ...
[js高手之路]Node.js实现简易的爬虫-抓取博客文章列表信息
抓取目标:就是我自己的博客:http://www.cnblogs.com/ghostwu/ 需要实现的功能: 抓取文章标题,超链接,文章摘要,发布时间需要用到的库: node.js自带的http库 ...
[js高手之路]Node.js实现简易的爬虫-抓取博客所有文章列表信息
抓取目标:就是我自己的博客:http://www.cnblogs.com/ghostwu/ 需要实现的功能: 抓取博客所有的文章标题,超链接,文章摘要,发布时间需要用到的库: node.js自带的h ...
[js高手之路]Node.js模板引擎教程-jade速学与实战2-流程控制,转义与非转义
一.转义与非转义 jade模板文件代码: doctype html html head meta(charset='utf-8') title jade学习-by ghostwu body h3 转义 ...
[js高手之路]Node.js模板引擎教程-jade速学与实战1
环境准备: 全局安装jade: npm install jade -g 初始化项目package.json: npm init --yes 安装完成之后,可以使用 jade --help 查看jade ...
[js高手之路]Node.js模板引擎教程-jade速学与实战1-基本用法
环境准备: 全局安装jade: npm install jade -g 初始化项目package.json: npm init --yes 安装完成之后,可以使用 jade --help 查看jade ...
[js高手之路]node js系列课程-图解express+supervisor+ejs用法
上文通过node js自带的http模块搭建了一个简易的服务器,实际在开发中,一般用的是express框架,本文我们就来讲讲项目开发中必备不可少的几样东西: 服务器( express ) 路由( ex ...

随机推荐

JAVAWEB项目如何实现验证码 (转)
JAVAWEB项目如何实现验证码 2012-12-21 21:19 56026人阅读评论(36) 收藏举报 .embody { padding: 10px 10px 10px; margin: 0 ...
js 获取当前日期所在周的周一
function week(date,n) { var checkDate = StringToDate(date); checkDate.setDate(checkDate.getDate() + ...
一个想法照进现实-《IT连》创业项目：聊聊最近两三事
今天打算写一篇断流水式的作文,哈,不按常规的写格式文了. 话说创业到现在,也快近半年了,时间那是飘的一个字:快! 从设想的很多很远,到被人不断告知要单点突破:从美好的远景,到现实艰难的执行:创业更像是 ...
【Linux】windows-linux、linux-linux文件互传
一.Linux下文件互传,scp命令实例 1.Linux下目录复制:本机->远程服务器 scp -r /home/abc/test1(本机目录路径) root@192.168.0.1:/hom ...
python+selenium自动化软件测试(第13章)：selenium面试题
前言最近看到群里有小伙伴贴出一组面试题,最近又是跳槽黄金季节,小编忍不住抽出一点时间总结了下一.selenium中如何判断元素是否存在?expected_conditions模块提供了16种判断方法 ...
java实现邮箱找密码
SMTP,POP3,IMAP POP3 POP3是Post Office Protocol 3的简称,即邮局协议的第3个版本,它规定怎样将个人计算机连接到Internet的邮件服务器和下载电子邮件的电 ...
使用javaconfig配置freemarker
package com.yy.config; import org.springframework.context.annotation.Bean; import org.springframewor ...
UI设计基础知识和JavaScript
[PS基础案例] 人物修图.调整画布大小,建立3个图层,并列放到画布中,用修补工具修掉中间的人物,再用橡皮章盖掉边缘的人物,然后扣出人物,放上新的蓝天,用橡皮擦调整透明度,擦掉水天交接的地方,然后调整 ...
JavaScript学习日志（二）：面向对象的程序设计
1,ECMAScript不像其他面向对象的语言那样有类的概念,它的对象与其他不同. 2,ECMAScript有两种属性:数据属性和访问器属性.([[]]这种双中括号表示属性为内部属性,外部不可直接访问 ...
AFN和SDWebImage请求网络图片的一点问题
问题1.AFN 处理有关图片相关的请求的问题在使用AFN Post网络图片的时候发现NSLocalizedDescription=Request failed: unacceptable conte ...

[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件

[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件的更多相关文章

随机推荐

热门专题