代码地址如下:
http://www.demodashi.com/demo/12368.html

1 概述

本实例主要使用Node.js去抓取电影的节目单,方便大家使用下载。

2 node package

  1. fs
  2. cheerio
  3. superagent
  4. superagent-charset
  5. express
  6. path

fs 用来读写文件

cherrio 类似jquery

superagent (ajax http模块)

superagent-charset 解决中文乱码问题

express 搭建server

path 路径

统一安装这些包,可以使用一下命令:

npm i express cheerio superagent superagent-charset path fs --save-dev

如果想深入了解这些包 可以去下面这个网址了解下

find package

3 步骤

第一步:

利用express 搭建本地服务

const app = require('express')();
const port = 3000; app.get('/', (req, res)=>{
res.send('hello world');
}); app.listen(port, ()=>{
console.log('listening port on', port);
});

打开浏览器 输入localhost:3000

看到下面页面,说明初步成功

第二步

先试用superagent(http模块)去获取页面的数据,然后用cheerio(类似jquery)去获取页面数据。

具体代码如下

var item = [];
function getMovies() {
item = [];
var url = 'http://www.dytt8.net';
superagent.get(url + '/index.htm').charset().end((err, sres) => {
if (err) {
throw err;
}
var $ = cherrio.load(sres.text);
$('.bd3rl .co_area2').each(function (i, n) {
if (i > 1) return;
var $n = $(n);
var obj = {
name: $n.find('.title_all strong').text(),
data: []
};
$n.find('tr').each(function (i, m) {
var $m = $(m);
var childUrl = url + $m.find('.inddline').eq(0).find('a').eq(1).attr('href');
obj.data.push({
title: $m.find('.inddline').eq(0).text(),
href: url + $m.find('.inddline').eq(0).find('a').eq(1).attr('href'),
date: $m.find('.inddline').eq(1).text(),
download_url: ''
});
});
item.push(obj);
});
fs.writeFile(path.join(__dirname, './doc', 'dy.txt'), '', function () { });
item.forEach(n => {
n.data.forEach((m, i) => {
superagent.get(m.href).charset().end((err, cres) => {
var _$ = cherrio.load(cres.text);
var download_url = _$('#Zoom table a').text();
var title = _$('.bd3r .title_all').text();
title = title.substring(title.indexOf('《') + 1, title.indexOf('》'));
// console.log(title)
var total_movie = title + '~~' + download_url + '\n';
// var total_movie = download_url.split(']')[1].substr(1) + '~~' + download_url + '\n';
var buff = new Buffer(total_movie);
fs.appendFile(path.join(__dirname, './doc', 'dy.txt'), buff, function () { });
});
});
});
});
}

superagent.get()类似ajax get请求,cheerio.load() 类似jquery,获取数据的方法其实就是jquery的方法。

获取完首页的链接,一般我们需要进去详情页才能看得到ftp的地址,可是现在我们做了第二次的轮询请求,就直接得到了ftp的地址,无需进到详情页,节省很多时间。

最终我们会存到本地文件夹里

接下来我们会把这些数据呈现到页面中:

代码实现:

app.get('/dy', function (req, res, next) {
var url_data = [];
var img_url = 'https://raw.githubusercontent.com/huainanhai/EXE/master/sevenDay/doc/wz.jpg';
fs.readFile(path.join(__dirname, './doc', 'dy.txt'), 'utf-8', (err, data) => {
if (err) throw err;
url_data = data.split('\n').filter(function (n) {
return n != '';
});
var str = '<div style="width:50%;">';
str += '<h4 style="padding-left:10px;">(温馨提示:复制ftp开头的路径到‘迅雷极速版’(邮件附件里面有)就会自动下载电影了, 最新免费电影节目单不定时更新,福利呦)</h4>'
item.forEach(m => {
str += '<h3 style="padding-left:10px;">' + m.name + '</h3>';
m.data.forEach((n) => {
url_data.forEach(j => {
var name = j.split('~~')[0];
name = name.split('.')[0];
if (n.title.indexOf(name) > -1) {
n.download_url = j.split('~~')[1];
}
});
str += '<div style="">' +
'<a href="' + n.href + '" style="height:30px;display:inline-block;vertical-align: middle;text-decoration:none;margin-left:6px;" target="_blank">' + n.title + '</a>' +
'<span style="height:30px;display:inline-block;vertical-align: middle;color: red;float:right;">' + n.date + '</span>' +
'</div>';
str += '<div style="background:#fdfddf;border:1px solid #ccc;padding:3px 10px;margin-bottom:10px;">' + n.download_url + '</div>';
});
});
str += '<img src="' + img_url + '" width="540" height="748" />';
str += '</div>';
res.send(str);
})
});

4 源码截图

如果要下载本实例,解压 然后 npm install 即可安装所需依赖包,下次我们讲解如果把数据发送到自己的邮箱(或者群发更多人的邮箱)!

Node.js 抓取电影天堂新上电影节目单及ftp链接

代码地址如下:
http://www.demodashi.com/demo/12368.html

注:本文著作权归作者,由demo大师代发,拒绝转载,转载需要作者授权

Node.js 抓取电影天堂新上电影节目单及ftp链接的更多相关文章

  1. Node.js抓取网页

    前几天四六级成绩出来(然而我没考),用Node.js做了一个模拟表单提交并抓取数据的Web 总结一下用到的知识,简单的网页抓取大概就是这个流程了 发送Get或Post请求 表单提交,首先弄到原网页提交 ...

  2. 使用node.js抓取有路网图书信息(原创)

    之前写过使用python抓取有路网图书信息,见http://www.cnblogs.com/dyf6372/p/3529703.html. 最近想学习一下Node.js,所以想试试手,比较一下http ...

  3. node.js抓取数据(fake小爬虫)

    在node.js中,有了 cheerio 模块.request 模块,抓取特定URL页面的数据已经非常方便. 一个简单的就如下 var request = require('request'); va ...

  4. node.js 抓取网页数据

    var $ = require('jquery'); var request = require('request'); request({ url: 'http:\\www.baidu.com',/ ...

  5. node.js 抓取

    http://blog.csdn.net/youyudehexie/article/details/11910465 http://www.tuicool.com/articles/z2YbAr ht ...

  6. node.js抓取网上图片保存到本地

    用到两个模块,http和fs var http = require("http");var fs = require("fs"); var server = h ...

  7. node.js爬取数据并定时发送HTML邮件

    node.js是前端程序员不可不学的一个框架,我们可以通过它来爬取数据.发送邮件.存取数据等等.下面我们通过koa2框架简单的只有一个小爬虫并使用定时任务来发送小邮件! 首先我们先来看一下效果图 差不 ...

  8. 爬虫:selenium + phantomjs 解决js抓取问题(一)

    selenium模块主要用来做测试,模拟键盘.鼠标来操作浏览器. phantomjs 就像一个无界面的浏览器一样. 两个结合能很好的解决js抓取的问题. 测试代码: #coding=utf-8 fro ...

  9. node.js服务端程序在Linux上持久运行

    如果要想在服务端部署node.js程序,让其持久化运行,就不能单单使用npm start命令运行,当然了,这样运行是毫无问题的,但是当关闭xshell窗口或者是关闭进程的时候(其实关闭xshell窗口 ...

随机推荐

  1. 【Luogu】P3320寻宝游戏(Splay)

    题目链接 其实这题用Set就完事了但我不会Set 智商-=inf 求虚树上所有边权和的两倍. 具体方式就是splay把所有在虚树上的点存一下,(按照DFS序排序的)每次插入/删除会更新前驱和它.后继和 ...

  2. 【04】【转】Nodejs学习笔记(四)--- 与MySQL交互(felixge/node-mysql)

    目录 简介和安装 测试MySQL 认识一下Connection Options MYSQL CURD 插入 更新 查询 删除 Nodejs 调用带out参数的存储过程,并得到out参数返回值 结束数据 ...

  3. 序列统计(bzoj 4403)

    Description 给定三个正整数N.L和R,统计长度在1到N之间,元素大小都在L到R之间的单调不降序列的数量.输出答案对10^6+3取模的结果. Input 输入第一行包含一个整数T,表示数据组 ...

  4. pat 团体天梯 L3-011. 直捣黄龙

    L3-011. 直捣黄龙 时间限制 150 ms 内存限制 65536 kB 代码长度限制 8000 B 判题程序 Standard 作者 陈越 本题是一部战争大片 —— 你需要从己方大本营出发,一路 ...

  5. kernel thread vs user thread

    The most important difference is they use different memory, the kernel mode thread can access any ke ...

  6. repeater绑定数组、哈希表、字典 ArrayList/HashTable,Dictionary为datasource

    原文发布时间为:2009-11-19 -- 来源于本人的百度文章 [由搬家工具导入] repeater绑定数组、哈希表、字典datasource为ArrayList/HashTable,Diction ...

  7. scrapy实战

    采用scrapy实现对股票网站的爬取 功能描述: 技术路线:scrapy 目标:获取上交所和深交所所有股票名称和交易信息并存储 实例编写: 步骤1:建立工程和spider爬虫模板 步骤2:编写spid ...

  8. The C programming language [book]

    1 A12.3 Macro Definition and Expansion A control line of the form #define identifier token-sequence ...

  9. fprintf与fscanf

    #include <stdio.h> int main() { //printf("Please input the value a:\n"); 等于下一句 fprin ...

  10. html table 使用总结

    html中的table是一个历史相当悠久的标签,它能够很方便的实现数据的表格展示.虽然table是个很基础的标签,但是想用好还是对css相关知识有要求的. 由于table标签中自带的属性操作起来略为麻 ...