[js高手之路]Node.js实现简易的爬虫-抓取博客文章列表信息

抓取目标：就是我自己的博客：http://www.cnblogs.com/ghostwu/

需要实现的功能：

抓取博客所有的文章标题，超链接，文章摘要，发布时间

需要用到的库：

node.js自带的http库

第三方库:cheerio，这个库就是用来处理dom节点的，他的用法几乎跟jquery用法一模一样，所以有了这个利器，写一个爬虫就非常简单

准备工作：

1，npm init --yes 初始化package.json

2，安装cheerio:npm install cheerio --save-dev

实现的目标，是要把每篇文章需要抓取的部分( 抓取文章标题，超链接，文章摘要，发布时间 )整理成一个对象，放在数组中，如:

[ { title: '[置顶][js高手之路]从零开始打造一个javascript开源框架gdom与插件开发免费视频教程

连载中',

    url: 'http://www.cnblogs.com/ghostwu/p/7470038.html',

    entry: '摘要: 百度网盘下载地址：https://pan.baidu.com/s/1kULNXOF 优酷土豆观看地址：htt

p://v.youku.com/v_show/id_XMzAwNTY2MTE0MA==.html?spm=a2h0j.8191423.playlist_content.5!3~5~

5~A&&f',

    listTime: '2017-09-05 17:08' },

  { title: '[js高手之路]Vue2.0基于vue-cli+webpack Vuex用法详解',

    url: 'http://www.cnblogs.com/ghostwu/p/7521097.html',

    entry: '摘要: 在这之前，我已经分享过组件与组件的通信机制以及父子组件之间的通信机制，而

我们的vuex就是为了解决组件通信问题的 vuex是什么东东呢？ 组件通信的本质其实就是在组件之间传

递数据或组件的状态（这里将数据和状态统称为状态），但可以看到如果我们通过最基本的方式来进行

通信，一旦需要管理的状态多了，代码就会',

    listTime: '2017-09-14 15:51' },

  { title: '[js高手之路]Vue2.0基于vue-cli+webpack同级组件之间的通信教程',

    url: 'http://www.cnblogs.com/ghostwu/p/7518158.html',

    entry: '摘要: 我们接着上文继续，本文我们讲解兄弟组件的通信，项目结构还是跟上文一样. 在

src/assets目录下建立文件EventHandler.js，该文件的作用在于给同级组件之间传递事件 EventHandl

er.js代码: 2，在Components目录下新建一个组件Brother1.vue 。通过Eve',

    listTime: '2017-09-13 22:49' },

   ]

思路讲解：

1，获取目标地址：http://www.cnblogs.com/ghostwu/ 所有的html内容

2，提取所有的文章html内容

3，提取每篇文章下面对应的( 文章标题，超链接，文章摘要，发布时间 )

 var http = require('http');

 var cheerio = require('cheerio');

 var url = 'http://www.cnblogs.com/ghostwu/';

 function filterHtml(html) {

     var $ = cheerio.load(html);

     var arcList = [];

     var aPost = $("#content").find(".post-list-item");

     aPost.each(function () {

         var ele = $(this);

         var title = ele.find("h2 a").text();

         var url = ele.find("h2 a").attr("href");

         ele.find(".c_b_p_desc a").remove();

         var entry = ele.find(".c_b_p_desc").text();

         ele.find("small a").remove();

         var listTime = ele.find("small").text();

         var re = /\d{4}-\d{2}-\d{2}\s*\d{2}[:]\d{2}/;

         listTime = listTime.match( re )[0];

         arcList.push({

             title: title,

             url: url,

             entry: entry,

             listTime: listTime

         });

     });

     return arcList;

 }

 http.get(url, function (res) {

     var html = '';

     var arcList = [];

     // var arcInfo = {};

     res.on('data', function (chunk) {

         html += chunk;

     });

     res.on('end', function () {

         arcList = filterHtml( html );

         console.log( arcList );

     });

 });

有几个关键的地方要讲解下：

1，res.on( 'data', function(){} )

http模块发送get请求之后，就会源源不断的抓取目标网页的源代码内容, 所以，我在on中监听data事件， chunk就是传输的数据，把这些数据累加到html这个变量，当数据传输完之后就会触发end事件，你可以在end事件中打印一下console.log( html ) 就能发现，他就是目标地址的所有html源代码，这样就解决了我们的第一个问题：获取目标地址：http://www.cnblogs.com/ghostwu/ 所有的html内容

2，有了完整的html内容之后，接下来我封装了一个函数filterHTML用来过滤我所需要的结果( 每篇文章的信息 )

3，var $ = cheerio.load(html); 把html内容通过cheerio的load方法加载进来，就可以用cheerio的节点操作了，为了亲和jquery的操作，我用美元符号$保存了这个文档对象

4，var aPost = $("#content").find(".post-list-item"); 这个是所有的文章节点信息，拿到之后，通过each方法挨个遍历并抓取需要的信息，整理成对象，然后放在一个数组中

  arcList.push({

 21             title: title,

 22             url: url,

 23             entry: entry,

 24             listTime: listTime

 25         });

这样就处理完了，结果已经在上面展示了，如果博客样式跟我的博客样式一样，应该都能抓取了,

接着完善分页抓取，这样就能把整个博客爬下来了

 var http = require('http');

 var cheerio = require('cheerio');

 var url = 'http://www.cnblogs.com/ghostwu/';

 function filterHtml(html) {

     var $ = cheerio.load(html);

     var arcList = [];

     var aPost = $("#content").find(".post-list-item");

     aPost.each(function () {

         var ele = $(this);

         var title = ele.find("h2 a").text();

         var url = ele.find("h2 a").attr("href");

         ele.find(".c_b_p_desc a").remove();

         var entry = ele.find(".c_b_p_desc").text();

         ele.find("small a").remove();

         var listTime = ele.find("small").text();

         var re = /\d{4}-\d{2}-\d{2}\s*\d{2}[:]\d{2}/;

         listTime = listTime.match(re)[0];

         arcList.push({

             title: title,

             url: url,

             entry: entry,

             listTime: listTime

         });

     });

     return arcList;

 }

 function nextPage( html ){

     var $ = cheerio.load(html);

     var nextUrl = $("#pager a:last-child").attr('href');

     if ( !nextUrl ) return ;

     var curPage = $("#pager .current").text();

     if( !curPage ) curPage = 1;

     var nextPage = nextUrl.substring( nextUrl.indexOf( '=' ) + 1 );

     if ( curPage < nextPage ) crawler( nextUrl );

 }

 function crawler(url) {

     http.get(url, function (res) {

         var html = '';

         var arcList = [];

         res.on('data', function (chunk) {

             html += chunk;

         });

         res.on('end', function () {

             arcList = filterHtml(html);

             console.log( arcList );

             nextPage( html );

         });

     });

 }

 crawler( url );

[js高手之路]Node.js实现简易的爬虫-抓取博客文章列表信息的更多相关文章

[js高手之路]Node.js实现简易的爬虫-抓取博客所有文章列表信息
抓取目标:就是我自己的博客:http://www.cnblogs.com/ghostwu/ 需要实现的功能: 抓取博客所有的文章标题,超链接,文章摘要,发布时间需要用到的库: node.js自带的h ...
[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件
这个周末,恶补了一下jade模板引擎,就为生成静态html文件,这篇文章需要知道jade以及看过我的上篇文章,我先给出他们的参考链接: [js高手之路]Node.js模板引擎教程-jade速学与实战1 ...
[js高手之路]Node.js+jade+mongoose实战todolist(分页,ajax编辑,删除)
该系列文章索引: [js高手之路]node js系列课程-创建简易web服务器与文件读写 [js高手之路]node js系列课程-图解express+supervisor+ejs用法 [js高手之路] ...
[js高手之路]Node.js+jade+mongodb+mongoose实现爬虫分离入库与生成静态文件
接着这篇文章[js高手之路]Node.js+jade抓取博客所有文章生成静态html文件继续,在这篇文章中实现了采集与静态文件的生成,在实际的采集项目中, 应该是先入库再选择性的生成静态文件.那么我选 ...
[js高手之路]Node.js+jade+express+mongodb+mongoose+promise实现todolist
promise主要是用来解决异步回调问题,其实还有好几种比promise更好的方案,后面再说,这节,我们先用promise来改造下,我以前写的一篇文章[js高手之路]javascript腾讯面试题学习 ...
[js高手之路]node js系列课程-创建简易web服务器与文件读写
web服务器至少有以下几个特点: 1.24小时不停止的工作,也就是说这个进程要常驻在内存中 2.24小时在某一端口监听,如: http://localhost:8080, www服务器默认端口80 3 ...
[js高手之路]node js系列课程-图解express+supervisor+ejs用法
上文通过node js自带的http模块搭建了一个简易的服务器,实际在开发中,一般用的是express框架,本文我们就来讲讲项目开发中必备不可少的几样东西: 服务器( express ) 路由( ex ...
[js高手之路]Node.js模板引擎教程-jade速学与实战2-流程控制,转义与非转义
一.转义与非转义 jade模板文件代码: doctype html html head meta(charset='utf-8') title jade学习-by ghostwu body h3 转义 ...
[js高手之路]Node.js模板引擎教程-jade速学与实战4-模板引用,继承,插件使用
一.block 模块复用把需要复用的模块用block定义 block后面跟上模块的名字,引用一次block 内容就会被复用一次编译之后的结果: 二,继承模板(extends) 在实际开发中,网站的 ...

随机推荐

HDU 6043 KazaQ's Socks （规律）
Description KazaQ wears socks everyday. At the beginning, he has nn pairs of socks numbered from 11 ...
Making the Grade (bzoj1592)
题目描述 FJ打算好好修一下农场中某条凹凸不平的土路.按奶牛们的要求,修好后的路面高度应当单调上升或单调下降,也就是说,高度上升与高度下降的路段不能同时出现在修好的路中. 整条路被分成了N ...
Unity 继承MonoBehaviour脚本执行顺序详解
先看结果 Awake ->OnEnable-> Start ->-> FixedUpdate-> Update -> LateUpdate ->OnGUI ...
ASP.NET Core - Razor页面之Handlers处理方法
简介在前一篇文章中,我们讨论了Razor页面.今天我们来谈谈处理方法(Handlers). 我们知道可以将代码和模型放在 .cshtml 文件里面或与 .cshtml 匹配的 .cshtml.cs ...
Android护眼模式功能小记
最近自己在做一个小说阅读器,看到某阅有护眼模式功能,别人都有,我怎么能没有? 现在这功能已经不稀奇了,很多手机都带有这个功能. 实现起来不难,用一个蒙版遮在界面上面就行. 至于蒙版,可以用Window ...
org.apache.commons.io——FileUtils学习笔记
FileUtils类的应用 1.写入一个文件: 2.从文件中读取: 3.创建一个文件夹,包括文件夹: 4.复制文件和文件夹: 5.删除文件和文件夹: 6.从URL地址中获取文件: 7.通过文件过滤器和 ...
再起航，我的学习笔记之JavaScript设计模式09(原型模式)
我的学习笔记是根据我的学习情况来定期更新的,预计2-3天更新一章,主要是给大家分享一下,我所学到的知识,如果有什么错误请在评论中指点出来,我一定虚心接受,那么废话不多说开始我们今天的学习分享吧! 我们 ...
python join 和 split的常用使用方法
函数:string.join()Python中有join()和os.path.join()两个函数,具体作用如下: join(): 连接字符串数组.将字符串.元组.列表中的元素以指定的字符 ...
Go语言循环判断的使用~
Go 语言条件语句条件语句需要开发者通过指定一个或多个条件,并通过测试条件是否为 true 来决定是否执行指定语句,并在条件为 false 的情况在执行另外的语句. 下图展示了程序语言中条件语句的结 ...
noip普及组2005 采药
采药描述辰辰是个天资聪颖的孩子,他的梦想是成为世界上最伟大的医师.为此,他想拜附近最有威望的医师为师.医师为了判断他的资质,给他出了一个难题.医师把他带到一个到处都是草药的山洞里对他说:" ...

[js高手之路]Node.js实现简易的爬虫-抓取博客文章列表信息

[js高手之路]Node.js实现简易的爬虫-抓取博客文章列表信息的更多相关文章

随机推荐

热门专题