nodejs http小爬虫

本课程用nodejs写一个http小爬虫，首先科普一下，爬虫就是把网上的网页代码给弄下来，然后纳为己用。目前最大的爬虫：百度快照等的。

下面直接上代码

示例一：



var http = require('http');

var url = "http://www.imooc.com/learn/348";

http.get(url, function(res) {

var html = '';  //http get去请求url ,url是慕课网

res.on('data', function(data) {

html += data; //请求数据赋值给前面定义的html

});

res.on('end', function() {

console.log(html); //结束后打印出html

});

}).on('error', function() {

conslole.log('请求出错');//出错打印

});

保存imooc-crawler.js，然后运行：node imooc-crawler.js , 注意路径。

文件下载 imooc-crawler.js右击另存

最后结果可是打印了满满的窗口啊，就不上图了。

示例二：

首先要安装一下小插件，cheerio ，该插件就是node里面的jquery，api地址点击这里http://www.imlwj.com/blog/?p=39

安装cheerio，在控制台输入命令：npm install cheerio 等待一会儿。

首先来看看http://www.imooc.com/learn/348的dom结构

var http = require('http');
var cheerio=require('cheerio');//引用安装成功的cheerio
var url = "http://www.imooc.com/learn/348";

//过滤方法



function filterChapters(html){

var $=cheerio.load(html);

var chapters=$('.learnchapter');//和jquery 里面的方法一样，直接得到目录块，通过learnchapter类获取

// [{

// chapterTitle:'',

// videos:[

// title:'',

// id:''

// ]

// }]

var courseData=[];//定义一个数组，用来存储一级目录标题和二级目录标题以及二级目录的id

chapters.each(function(item){

var chapter=$(this);

var chapterTitle=chapter.find('strong').text();//一级目录表示是放在一个strong标签里面的，所以轻易的就可以拿到

var videos=chapter.find('.video').children('li');//拿到二级目录块

var chapterData={//一级目录里面包括它本身的标题，还包括二级目录的标题和二级目录id,所以二级目录也定义成数组

chapterTitle:chapterTitle,

videos:[]

};

videos.each(function(item){

var video=$(this).find('.studyvideo');//获取二级目录标题所在的a标签

var videoTitle=video.text();//得到二级目录标题

var id=video.attr('href').split('video/')[1];//获取a标签的href属性值，然后进行分割，获取id值，以‘' video/ ’分割，取第二部分，数组的下标是从0开始，所以是[1]

chapterData.videos.push({//数组push值，加入二级标题，二级id

title:videoTitle,

id:id

});

});

courseData.push(chapterData);//对我们需要的内容数组push值

});

return courseData;//把过滤结果返回

}

function printCourseInfo(courseData){

courseData.forEach(function(item){//遍历数组

var chapterTitle=item.chapterTitle;//获取一级标题

console.log(chapterTitle+'\n');//打印一级标题

item.videos.forEach(function(video){ //二级目录也是数组，同样要遍历

console.log(' ['+video.id+'] '+video.title+'\n');//打印二级标题和id

});

});

}

http.get(url, function(res) {

var html = '';

res.on('data', function(data) {

html += data;

});

res.on('end', function() {

var courseData=filterChapters(html);//对示例一的html进行过滤，过滤出我们需要的内容

printCourseInfo(courseData);//打印出过滤后的内容

});

}).on('error', function() {

console.log('请求出错');

});

保存crawler.js，然后运行：node crawler.js , 注意路径。

文件下载 crawler.js右击另存

下图是打印结果

视频是慕课网：http://www.imooc.com/learn/348

个人总结：本课程的主要还是在于对jquery的学习，这里也就是对cheerio的学习，能够熟练的操作dom，其他都没有啥问题了。

cheerio学习地址：http://www.imlwj.com/blog/?p=39

转载本站文章请注明出处：爱开发 http://www.imlwj.com/blog/?p=41

nodejs http小爬虫的更多相关文章

NodeJs编写小爬虫
一,爬虫及Robots协议爬虫,是一种自动获取网页内容的程序.是搜索引擎的重要组成部分,因此搜索引擎优化很大程度上就是针对爬虫而做出的优化. robots.txt是一个文本文件,robots是一个协 ...
nodejs .http模块, cheerio模块实现小爬虫.
代码: var http = require("http"); var cheerio = require("cheerio"); var url = 'htt ...
nodejs的简单爬虫
闲聊好久没写博客了,前几天小颖在朋友的博客里看到了用nodejs的简单爬虫.所以小颖就自己试着做了个爬博客园数据的demo.嘻嘻...... 小颖最近养了条泰日天,自从养了我家 ...
node.js 开发简易的小爬虫
node.js 开发简易的小爬虫最近公司开发一款医药类的软件,所以需要一些药品的基础数据,所以本人就用node.js写一个简易的小爬虫,并写记录这个Demo以供大家参考. 一.开发前的准备: 1, ...
一次使用NodeJS实现网页爬虫记
前言几个月之前,有同事找我要PHP CI框架写的OA系统.他跟我说,他需要学习PHP CI框架,我建议他学习大牛写的国产优秀框架QeePHP. 我上QeePHP官网,发现官方网站打不开了,GOOGL ...
Java豆瓣电影爬虫——小爬虫成长记（附源码）
以前也用过爬虫,比如使用nutch爬取指定种子,基于爬到的数据做搜索,还大致看过一些源码.当然,nutch对于爬虫考虑的是十分全面和细致的.每当看到屏幕上唰唰过去的爬取到的网页信息以及处理信息的时候, ...
放养的小爬虫--豆瓣电影入门级爬虫(mongodb使用教程~)
放养的小爬虫--豆瓣电影入门级爬虫(mongodb使用教程~) 笔者声明:只用于学习交流,不用于其他途径.源代码已上传github.githu地址:https://github.com/Erma-Wa ...
放养的小爬虫--京东定向爬虫(AJAX获取价格数据)
放养的小爬虫--京东定向爬虫(AJAX获取价格数据) 笔者声明:只用于学习交流,不用于其他途径.源代码已上传github.githu地址:https://github.com/Erma-Wang/Sp ...
Python练习，网络小爬虫（初级）
最近还在看Python版的rcnn代码,附带练习Python编程写一个小的网络爬虫程序. 抓取网页的过程其实和读者平时使用IE浏览器浏览网页的道理是一样的.比如说你在浏览器的地址栏中输入 www ...

随机推荐

Node.js 蚕食计划（五）—— Koa 基础项目搭建
Koa 是由 Express 原班人马打造的超轻量服务端框架与 Express 相比,除了自由度更高,可以自行引入中间件之外,更重要的是使用了 ES6 + async,从而避免了回调地狱不过也是因 ...
Lambda 表达式，Java中应用Lambda 表达式
一.Lambda 表达式简单来说,编程中提到的 lambda 表达式,通常是在需要一个函数,但是又不想费神去命名一个函数的场合下使用,也就是指匿名函数. 链接:知乎先举一个普通的 Python 例 ...
微信小程序之使用本地接口开发
本文主要讲解如何使用本地接口进行开发,很多人都会遇到这个问题,特别是小程序上线后. 一.解决思路在小程序开发工具设置网络代理,然后再通过Charles设置代理,将https域名转为本地接口进行访问. ...
socket对象放在一个datagridview的row的tag里面在拿出来为什么是已释放
socket对象放在一个datagridview的row的tag里面在拿出来为什么是已释放
chrome console的使用：异常和错误的处理 – Break易站
本文内容来自:chrome console的使用 : 异常和错误的处理 – Break易站利用 Chrome DevTools 提供的工具,您可以修复引发异常的网页和在 JavaScript 中调试 ...
在Ubuntu14.04上搭建自己的OpenVPN服务器并通过它上网
背景学校宿舍端口可以配置静态IP连校内网,也可以连到实验室的服务器:实验室的服务器可以连外网:但宿舍要连外网就要花钱买PPPoE账号了.作为壮哉我大计院的一员,本着发扬专(neng)业(sheng) ...
STM32f103x IAP远程升级小结
最近在面试的时候遇到一个关于IAP远程程序升级的问题,由于之前所做的项目没有涉及到远程升级需求,当时一脸懵呆,不过回答的还是不错的,今天针对STM32F103系列调试了IAP的程序,这里做一下小结,如 ...
from Require.js to Webpack(why)
写在前面: 本文主要参考 From Require.js to Webpack - Part 1 (the reasons),原文作者将项目从 require.js 转移到了 webpack 并详细说 ...
sublime text3安装、注册及常用插件
由于换电脑,重装系统等问题,总要重装sublime.每次都要查来查去,不如自己记下来,以后再装也方便. 一.下载官网下载安装包(http://www.sublimetext.com/) :然后直接点 ...
Zabbix实战-简易教程--低层次发现（LLD）
一.概述自动发现(LLD)提供了一种在为不同实体自动创建监控项,触发器和图形的方法.例如,Zabbix可以在你的机器上自动监控磁盘或网卡,而无需为每个磁盘或网卡手动创建监控项.(LLD) 此外,可以 ...

nodejs http小爬虫

nodejs http小爬虫的更多相关文章

随机推荐

热门专题