第一个nodejs爬虫：爬取豆瓣电影图片

第一个nodejs爬虫：爬取豆瓣电影图片存入本地：

首先在命令行下 npm install request cheerio express -save;

代码：

var http = require('https'); //使用https模块

var fs = require('fs');//文件读写

var cheerio = require('cheerio');//jquery写法获取所得页面dom元素

var request = require('request');//发送request请求

var i = 0;

var url = "https://movie.douban.com/subject/1889243/?from=subject-page";

//初始url

function fetchPage(x) { //封装一层函数,方便递归调用

    startRequest(x);

}

function startRequest(x) {

    //采用http模块向服务器发起一次get请求

    http.get(x, function(res) { //get到x网址，成功执行回调函数

        var html = ''; //用来存储请求网页的整个html内容

        res.setEncoding('utf-8'); //防止中文乱码

        //监听data事件，每次取一块数据

        res.on('data', function(chunk) {

            html += chunk;

        });

        //监听end事件，如果整个网页内容的html都获取完毕，就执行回调函数

        res.on('end', function() {

            var $ = cheerio.load(html); //采用cheerio模块解析html

            var news_item = {

                //获取电影的标题

                title: $('.related-info h2 i').text().trim(),

                //i是用来判断获取页数

                i: i = i + 1,

            };

            console.log(news_item); //打印新闻信息

            var news_title = $('.related-info h2 i').text().trim();

            savedContent($, news_title); //存储每篇文章的内容及文章标题

            savedImg($, news_title); //存储每篇文章的图片及图片标题

            //下一篇电影的url

            nextLink = $(".recommendations-bd dl:last-child dd a").attr('href');

            if(i <= 10) { //爬取10页

                fetchPage(nextLink);

            }

        });

    }).on('error', function(err) { //http模块的on data,on end ,on error事件

        console.log(err);

    });

}

//存储标题函数

function savedContent($, news_title) {

    $('#link-report span').each(function(index, item) {

        var x = $(this).text();

        x = x + '\n';

        //将新闻文本内容一段一段添加到/data文件夹下，并用新闻的标题来命名文件

        fs.appendFile('./data/' + news_title + '.txt', x, 'utf-8', function(err) {

            if(err) {

                console.log(err);

            }

        });

    })

}

//该函数的作用：在本地存储所爬取到的图片资源

function savedImg($, news_title) {

    $('#mainpic img').each(function(index, item) {

        var img_title = $('#content h1 span').text().trim(); //获取图片的标题

        if(img_title.length > 35 || img_title == "") { //图片标题太长

            img_title = "Null";

        }

        var img_filename = img_title + '.jpg';

        var img_src = $(this).attr('src'); //获取图片的url

        //采用request模块，向服务器发起一次请求，获取图片资源

        request.head(img_src, function(err, res, body) {

            if(err) {

                console.log(err);

            }

        });

        request(img_src).pipe(fs.createWriteStream('./image/' + news_title + '---' + img_filename));

        //通过流的方式，把图片写到本地/image目录下，并用标题和图片的标题作为图片的名称。

    })

}

fetchPage(url); //主程序开始运行

第一个nodejs爬虫：爬取豆瓣电影图片的更多相关文章

写一个python 爬虫爬取百度电影并存入mysql中
目标是利用python爬取百度搜索的电影在类型地区年代各个标签下电影的名字评分和图片连接以及电影连接首先我们先在mysql中建表 create table liubo4( id in ...
python 爬虫&爬取豆瓣电影top250
爬取豆瓣电影top250from urllib.request import * #导入所有的request,urllib相当于一个文件夹,用到它里面的方法requestfrom lxml impor ...
Python爬虫爬取豆瓣电影之数据提取值xpath和lxml模块
工具:Python 3.6.5.PyCharm开发工具.Windows 10 操作系统.谷歌浏览器目的:爬取豆瓣电影排行榜中电影的title.链接地址.图片.评价人数.评分等网址:https:// ...
python3 爬虫---爬取豆瓣电影TOP250
第一次爬取的网站就是豆瓣电影 Top 250,网址是:https://movie.douban.com/top250?start=0&filter= 分析网址'?'符号后的参数,第一个参数's ...
Scrapy-redis分布式爬虫爬取豆瓣电影详情页
平时爬虫一般都使用Scrapy框架,通常都是在一台机器上跑,爬取速度也不能达到预期效果,数据量小,而且很容易就会被封禁IP或者账号,这时候可以使用代理IP或者登录方式爬,然而代理IP很多时候都很鸡肋, ...
Python爬虫爬取豆瓣电影名称和链接，分别存入txt，excel和数据库
前提条件是python操作excel和数据库的环境配置是完整的,这个需要在python中安装导入相关依赖包: 实现的具体代码如下: #!/usr/bin/python# -*- coding: utf ...
python爬虫-爬取豆瓣电影数据
#!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:27# 文件 :spider_05.py# IDE :PyChar ...
Python爬虫-爬取豆瓣电影Top250
#!usr/bin/env python3 # -*- coding:utf-8-*- import requests from bs4 import BeautifulSoup import re ...
scrapy爬虫框架教程（二）-- 爬取豆瓣电影TOP250
scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250 前言经过上一篇教程我们已经大致了解了Scrapy的基本情况,并写了一个简单的小demo.这次我会以爬取豆瓣电影TOP250为例进一步为大 ...

随机推荐

51nod——2476 小b和序列（预处理思维）
对于每一个元素,预处理出它作为最小值,两边可以作用到的最大位置.比如下标∈[0,8]的这个数组:1 8 6 2 5 4 3 8 7,1可以作用到所有区间,2可以作用到区间[1,8],第一个8可以作用到 ...
Linux入门-第八周
1.用shell脚本实现自动登录机器 #!/usr/bin/expectset ip 192.168.2.192set user rootset password rootspawn ssh $use ...
16.2--Jenkins+Maven+Gitlab+Tomcat 自动化构建打包、部署
分类: Linux服务篇,Linux架构篇一.环境需求本帖针对的是Linux环境,Windows或其他系统也可借鉴.具体只讲述Jenkins配置以及整个流程的实现. 1.JDK(或JRE)及J ...
Ajax基础知识梳理
Ajax用一句话来说就是无须刷新页面即可从服务器取得数据.注意,虽然Ajax翻译过来叫异步JavaScript与XML,但是获得的数据不一定是XML数据,现在服务器端返回的都是JSON格式的文件. 完 ...
第1章 VMware中安装CentOS7
目录 1.1 下载CentOS7安装包 1.2 VMware中新建虚拟机 1.3 安装操作系统本章讲解在VMware中安装CentOS虚拟机的步骤.使用的VMware Workstation版本为1 ...
Redis之set类型操作
接口: package com.net.test.redis.base.dao; /** * @author*** * @Time:2017年8月10日下午2:32:12 * @version 1. ...
linux下安装VMware出错：Gtk-Message: Failed to load module "canberra-gtk-module"解决方法
最近又有兴趣在linux下搭建个虚拟机,于是去找了个VMWorkstation,安装的过程中报了两个错误 Gtk-Message: Failed to load module "pk-gtk ...
STM32启动文件：startup_stm32f10x_hd.s等启动文件的简单描述
在官方的库文件中,分别有如下文件: startup │ │ │ ├─arm │ │ │ │ startup_stm32f10x_cl.s │ │ │ │ startup_stm32f10x_hd.s ...
BFS：Nightmare（可返回路径）
解题心得: 1.point:关于可以返回路径的BFS的标记方法,并非是简单的0-1,而是可以用时间比较之后判断是否push. 2.queue创建的地点(初始化问题),在全局中创建queue在一次调用B ...
RDD算子、RDD依赖关系
RDD:弹性分布式数据集, 是分布式内存的一个抽象概念 RDD:1.一个分区的集合, 2.是计算每个分区的函数 , 3.RDD之间有依赖关系 4.一个对于key-value的RDD的Partit ...

第一个nodejs爬虫：爬取豆瓣电影图片

第一个nodejs爬虫：爬取豆瓣电影图片的更多相关文章

随机推荐

热门专题