node小爬虫

这一章主利用node的http模块制作一个网页的小爬虫来爬去网页信息，其中对于后端html的节点的获取采用了cheerio模块，这

/**

 * Created by Administrator on 2016/9/16.

 */

var http = require('http');

var cheerio = require('cheerio');

var url = 'http://www.imooc.com/learn/348';

function filterChapters(html){

      var $ = cheerio.load(html);// 要使用cheerio模块先要用npm install cheerio加载进来，然后再前面引入(var cheerio = require('cheerio');)

      var chapters = $('.chapter');

    var courseData = [];

    chapters.each(function(item){

        var chapter = $(this);

        var chapterTitle = chapter.find('strong').text();

        var videos = chapter.find('.video').children('li');

        var chapterData = {

            chapterTitle:chapterTitle,

            videos:[]

        }

        videos.each(function(item){

            var video = $(this).find('.J-media-item');

            var videoTitle = video.text();

            var id = video.attr('href').split('video/')[1];

            chapterData.videos.push({

                title:videoTitle,

                id:id,

            })

        })

        courseData.push(chapterData);

    })

    return courseData;

}

function printCourseInfo(courseData){

    courseData.forEach(function(item){

         var chapterTitle = item.chapterTitle;

        console.log(chapterTitle );

        item.videos.forEach(function(video){

            console.log(video.id)

            //console.log(' 【'+ video.id + '】 '+ video.title + '\n');

        })

    })

}

http.get(url,function(res){

    var html = '';

    res.on('data',function(data){ res会监听data事件的发生

        html += data;

    });

    res.on('end',function(){

        var courseData = filterChapters(html);

        printCourseInfo(courseData);

    })

}).on('error',function(){

    console.log('获取课程出错！')

})

个模块可以在后端获取html页面的元素

，获取方法类似于jquery

代码如下

node小爬虫的更多相关文章

【原】小玩node+express爬虫-2
上周写了一个node+experss的爬虫小入门.今天继续来学习一下,写一个爬虫2.0版本. 这次我们不再爬博客园了,咋玩点新的,爬爬电影天堂.因为每个周末都会在电影天堂下载一部电影来看看. talk ...
node.js 开发简易的小爬虫
node.js 开发简易的小爬虫最近公司开发一款医药类的软件,所以需要一些药品的基础数据,所以本人就用node.js写一个简易的小爬虫,并写记录这个Demo以供大家参考. 一.开发前的准备: 1, ...
Java豆瓣电影爬虫——小爬虫成长记（附源码）
以前也用过爬虫,比如使用nutch爬取指定种子,基于爬到的数据做搜索,还大致看过一些源码.当然,nutch对于爬虫考虑的是十分全面和细致的.每当看到屏幕上唰唰过去的爬取到的网页信息以及处理信息的时候, ...
node.js爬虫爬取拉勾网职位信息
简介用node.js写了一个简单的小爬虫,用来爬取拉勾网上的招聘信息,共爬取了北京.上海.广州.深圳.杭州.西安.成都7个城市的数据,分别以前端.PHP.java.c++.python.Androi ...
nodejs http小爬虫
本课程用nodejs写一个http小爬虫,首先科普一下,爬虫就是把网上的网页代码给弄下来,然后纳为己用.目前最大的爬虫:百度快照等的. 下面直接上代码示例一: var http = require( ...
nodejs .http模块, cheerio模块实现小爬虫.
代码: var http = require("http"); var cheerio = require("cheerio"); var url = 'htt ...
node：爬虫爬取网页图片
代码地址如下:http://www.demodashi.com/demo/13845.html 前言周末自己在家闲着没事,刷着微信,玩着手机,发现自己的微信头像该换了,就去网上找了一下头像,看着图片 ...
Node.js 爬虫批量下载美剧 from 人人影视 HR-HDTV
这两天发现了一个叫看知乎的站点.是知乎的苏莉安做的,当中爬虫使用的 Node.js.这里就针对上一篇博客中的美剧小爬虫,改用 nodejs 进行实现一下.体验一下强大的 Node.js. 假设之前没实 ...
放养的小爬虫--豆瓣电影入门级爬虫(mongodb使用教程~)
放养的小爬虫--豆瓣电影入门级爬虫(mongodb使用教程~) 笔者声明:只用于学习交流,不用于其他途径.源代码已上传github.githu地址:https://github.com/Erma-Wa ...

随机推荐

【树状数组】2019徐州网络赛 query
(2)首先成倍数对的数量是nlogn级别的,考虑每一对[xL,xR](下标的位置,xL < xR)会对那些询问做出贡献,如果qL <= xL && qR >= xR, ...
接口自动化与UI自动化两者的可行性
1.首先接口测试是跳过前端界面对服务端的测试,UI测试是对前端界面的测试,从分层测试的角度考虑,两者不应该是可以互相取代的关系. 2.从公司开展自动化的的角度考虑,可以重点关注这个项目开展接口自动 ...
Python爬虫：
python中selenium操作下拉滚动条方法汇总 UI自动化中经常会遇到元素识别不到,找不到的问题,原因有很多,比如不在iframe里,xpath或id写错了等等:但有一种是在当前显示的页面元 ...
fis3 相关
fis3 静态资源存放 windows: C:\Users\Administrator\AppData\Local\.fis3-tmp
突然看到原来除了jar包还有war包啊？？？？？
先来说说区别: 首先,jar包呢,是一个压缩文件,可以由很多文件压缩而成,,简单来说就是,jar包是别人写好的一些类,然后对这些类进行打包,这就是jar包,你可以直接用这些 jar包,使用里面的类 ...
题解 P2719 【搞笑世界杯】
其实懂了之后很简单,但是刚开始真的很难想.. d[a][b]表示剩a张A类票和b张B类票时,最后两张票相同的概率那么此时的排队的第一个人只有两种选择拿A类票或者B类票抛硬币得到的可能性当然是二分 ...
C读取json格式字符串
python调用C库时参数太多,约定传json格式字符串,C解析 #include<stdio.h> #include<string.h> #include<stdlib ...
第09组 Beta版本演示
组长博客本组(组名)所有成员短学号姓名 2236 王耀鑫(组长) 2210 陈超颖 2209 陈湘怡 2228 许培荣 2204 滕佳 2205 何佳琳 2237 沈梓耀 2233 陈志荣 22 ...
ThreadLocal 简单解析
ThreadLocal 简单解析基于jdk1.8 ThreadLocal一定不陌生,开发中常用,也是面试里的常客了,但是往往我们可能只是知道该类的作用.学习该类对于个人的多线程编码能力是大有裨益的, ...
kubelet证书过期解决方法
昨天收到报警短信:集群中某node状态为notReady,由于是长期不用的,所以放到今天才有空处理,以下记录处理过程. 查看kubelet日志,发现不停的打印证书过期相关提示信息. 以下操作基于kub ...

node小爬虫

node小爬虫的更多相关文章

随机推荐

热门专题