node.js+mongodb 爬虫
demo截图:

本demo爬瓜子二手车北京区的数据 (注:需要略懂 node.js / mongodb 不懂也没关系 因为我也不懂啊~~~)
之所以选择爬瓜子二手车网站有两点:
一、网站无需登录,少做模拟登录;
二、数据链接没有加密,直接可以用;
网上很多node.js爬虫的栗子
但大多是一个页面的栗子,很少跟数据库结合的 所以我这个栗子是糖炒的
我的基本思路是这样的
1、先在mongodb里存所有页的链接地址的集合
2、在根据这些链接地址 一个一个的把详细信息爬下来
第一步在搜索页找到翻页的规律
像搜索页北京区第一页就是
https://www.guazi.com/bj/buy/o1/
第二页
https://www.guazi.com/bj/buy/o2/
规律就是
https://www.guazi.com/bj/buy/o + number
然后第一页的时候你就可以知道最多50页
这样你就可以循环这些链接在把每个页面的车的详情链接存到mongodb的集合里
第二步读mongodb的集合找出所有的链接 循环链接爬详情页数据
项目目录:

目录讲解:
reptile.js //爬所有链接的;
carinfo.js //爬车辆详情页;
package.json //配置文件
package.json:
{
"name": "sell-car",
"version": "1.0.0",
"description": "",
"main": "index.js",
"scripts": {
"test": "echo \"Error: no test specified\" && exit 1"
},
"author": "",
"license": "ISC",
"devDependencies": {
"cheerio": "^0.22.0",
"mongoose": "^4.7.1"
}
}
reptile.js 存mongodb集合 在cmd执行的 node reptile.js
'use strict';
var http = require('https'); //node https 模块;
var cheerio = require('cheerio'); //解析html模块;
var mongoose = require('mongoose'); //操作mongodb数据库模块;
mongoose.connect('mongodb://localhost/car'); //链接数据库; var num = 0; //当前第几页;
var maxNum = 0; //最大页数; var url = 'https://www.guazi.com/bj/buy/o'; //瓜子二手车搜索页北京区; var PersonSchema = new mongoose.Schema({ //json的结构;
address:String //定义一个属性name,类型为String
}); var sellCar = mongoose.model('sell_car', PersonSchema ); //创建model fetchPage(url+1); //主程序开始运行 function fetchPage(x) { //封装了一层函数
startRequest(x);
} function startRequest(x) {
//采用http模块向服务器发起一次get请求
http.get(x, function (res) { var html = ''; //用来存储请求网页的整个html内容
var titles = [];
res.setEncoding('utf-8'); //防止中文乱码
//监听data事件,每次取一块数据
res.on('data', function (chunk) { html += chunk; }); //监听end事件,如果整个网页内容的html都获取完毕,就执行回调函数
res.on('end', function () { var $ = cheerio.load(html); //采用cheerio模块解析html var $a_src = $('.imgtype'); //读取出当前搜索页每辆车详情的地址; $a_src.each(function(i,obj){ //循环每地址链接存入数据库; var _src = $(obj).attr('href'); var carHref = new sellCar({ address: _src }); //存入mongodb;
carHref.save(function (err) {
if (err) {
console.log(err);
}
}); }) num++; //页码增加; if( num == 1 ){ //判断是第一次,给最大页数赋值;
maxNum = $('.pageLink li').eq($('.pageLink li').length-2).find('span').text();
} if( num == maxNum ){ //页数等于最大页数等值程序;
return ;
} fetchPage(url+num); }); });
}
carinfo.js 车辆详情 在cmd执行 node carinfo.js
'use strict';
var http = require('https'); //node https 模块;
var cheerio = require('cheerio'); //解析html模块;
var mongoose = require('mongoose'); //操作mongodb数据库模块;
mongoose.connect('mongodb://localhost/car'); //链接数据库; var readCarPer = new mongoose.Schema({ //json的结构;
address:String
}); var PersonSchema = new mongoose.Schema({ //定义json类型;
info:String, //车;
money:String, //价钱;
phone:String, //电话号码;
time:String, //上牌时间;
mileage:String, //公里数;
gearbox:String, //变速箱;
emission:String, //排放标准;
location:String, //上牌地;
imgs:Array //图片;
}); var num = 0;
var readCar = mongoose.model('sell_cars',readCarPer);
var sellCarInfo = mongoose.model('sell_carInfo', PersonSchema ); var json = null;
var url = 'https://www.guazi.com'; //补链接前边的链接;
var time = null; //间隔时间;
var maxNum = 0; readCar.find({},function(err, character){ //查找数据; console.log('成功读取地址'); if(err){
console.log(err);
}else{
json = character;
maxNum = json.length; calls(); } }) function calls(){
num++;
if( num > maxNum ){ //判断是否霸区成功;
console.log('数据爬去完成~~~');
return false;
} clearTimeout(time);
var lu = json[num].address; time = setTimeout(function(){ fetchPage(url+lu); //主程序开始运行 },5000); } function fetchPage(x) { //封装了一层函数
startRequest(x);
} function startRequest(x) {
console.log(x);
//采用http模块向服务器发起一次get请求
http.get(x, function (res) { var html = ''; //用来存储请求网页的整个html内容
var titles = [];
res.setEncoding('utf-8'); //防止中文乱码
//监听data事件,每次取一块数据
res.on('data', function (chunk) { html += chunk; }); //监听end事件,如果整个网页内容的html都获取完毕,就执行回调函数
res.on('end', function () { var $ = cheerio.load(html); //采用cheerio模块解析html var info = $('.dt-titletype').text() //车名;
var money = $('.numtype').text(); //钱;
var phone = $('.teltype').eq(0).text(); //电话
var time = $('.assort li').eq(0).find('b').text(); //上牌时间
var mileage = $('.assort li').eq(1).find('b').text(); //里程数
var gearbox = $('.assort li').eq(2).find('b').text(); //变速箱
var emission = $('.assort li').eq(3).find('b').text(); //排放标准
var location = $('.assort li').eq(4).find('b').text(); //上牌地 var $imgs = $('.dt-pictype img');
var imgs = []; $imgs.each(function(i,obj){ //图片循环赋值;
var img_src = $(obj).attr('data-original');
imgs.push(img_src);
}); var carInfos = new sellCarInfo({ //保存数据;
info:info,
money:money,
phone:phone,
time:time,
mileage:mileage,
gearbox:gearbox,
emission:emission,
location:location,
imgs:imgs
}); carInfos.save(function (err) {
if (err) {
console.log(err);
} else {
console.log('成功数据!~~~');
calls();
}
}); }); });
}
当时爬数据的截屏:

后记:
这里我没说 mongodb 安装、启动、设置存储地址 是因为 mongodb本身在window和mac其实是不一样的所以需要你自己在找找别的文章看看怎么配置(注:window跑真的挺蛋疼的。。。。欢迎去感受一下)
这个栗子的第一个条件就是你要现在cmd里跑起来mongodb 要不剩下的都是白瞎
简单的mongodb的增删改查看看 菜鸟教程 就行 实在不行用Robomongo图形界面也行
说一个小问题
就是我在爬搜索的车辆链接的时候 因为下一页设置的间隔时间比较短 原本2000条的数据最后只爬下来1160,所以爬车辆详情的时候把间隔调成了5秒 需要注意一下;
如图:

参考资料:
小小石头的那些事儿 : http://blog.csdn.net/yezhenxu1992/article/details/50820629
菜鸟教程 : http://www.runoob.com/mongodb/mongodb-tutorial.html
node.js+mongodb 爬虫的更多相关文章
- 8 步搭建 Node.js + MongoDB 项目的自动化持续集成
任何事情超过 90 秒就应该自动化,这是程序员的终极打开方式.Automating shapes smarter future. 这篇文章中,我们通过创建一个 Node.js + MongoDB 项目 ...
- 《Node.js+MongoDB+AngularJS Web开发》读书笔记及联想
总体介绍 <Node.js+MongoDB+AngularJS Web开发>,于2015年6月出版,是一本翻译过来的书,原书名为<Node.js,MongoDB and Angula ...
- Node.JS + MongoDB技术浅谈
看到一个Node.JS + MongoDB的小样例,分享给大家.魔乐科技软件学院(www.mldnjava.cn)的讲座 Node.JS + MongoDB技术讲座 云计算 +大数据 ...
- AngularJS + Node.js + MongoDB开发
AngularJS + Node.js + MongoDB开发的基于位置的通讯录(by vczero) 一.闲扯 有一天班长说了,同学们希望我开发一个可以共享位置的通讯录,于是自己简单设计了下功能.包 ...
- node.js + mongodb
node.js + mongodb 这次内容是结合bootstrap把登陆注册做好,还有就是express的中间件等问题. 看这篇博客之前建议先看我上篇写的那篇博客http://www.cnblogs ...
- 用Node.JS+MongoDB搭建个人博客(页面模板)(五)(结束)
<差不多先生> 我是差不多先生,我的差不多是天生.也代表我很天真,也代表我是个闲人.这差不多的人生,总是见缝插针. 求学的道路上总是孤独的,即使别人不理解我,认为我是奇葩!但没关系,我会坚 ...
- 用Node.js写爬虫,撸羞羞的图片
说到爬虫,很多人都认为是很高大上的东西.哇塞,是不是可以爬妹纸图啊,是不是可以爬小片片啊.答案就是对的.爬虫可以完成这些东西的操作.但是,作为一个正直的程序员,我们要在法律允许范围内用爬虫来为我们服务 ...
- CentOS 7部署Node.js+MongoDB:在VPS上从安装到Hello world
写好代码,花钱买了VPS,看着Charges一直上涨却无从下手?记一位新手司机从购买VPS到成功访问的过程 0.购买VPS 首先,选择VPS提供商,部署一个新的服务器(Deploy New Serve ...
- 基于node.js制作爬虫教程
前言:最近想学习node.js,突然在网上看到基于node的爬虫制作教程,所以简单学习了一下,把这篇文章分享给同样初学node.js的朋友. 目标:爬取 http://tweixin.yueyishu ...
随机推荐
- Vue—组件传值及vuex的使用
一.父子组件之间的传值 1.父组件向子组件传值: 子组件在props中创建一个属性,用以接收父组件传来的值 父组件中注册子组件 在子组件标签中添加子组件props中创建的属性 把需要传给子组件的值赋给 ...
- Could not retrieve mirrorlist http://mirrorlist.centos.org/?release=7&arch=x86_64&repo=os&infra=stock32 error was 14: curl#6 - "Could not resolve host: mirrorlist.centos.org; Unknown error"
今天安装完带图形界面的CentOS 7后,在Terminal中运行yum安装命令时报了以下错误: 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 ...
- 在vue 里使用腾讯ditu
https://www.cnblogs.com/mrer/p/7144705.html
- Async/Await 学习与示例
参考:Async/await学习 es 7 提供了对 promise 对象的更好的操作,省去了很多丧心病狂的链式异步请求,promise 是回调地狱的福音,而 Async/Await 则是 promi ...
- win10双系统安装卸载ubuntu
安装 1. 官网下载需要安装的Ubuntu版本 2. 格式化U盘,用UltraISO软件将Ubuntu写入U盘 3. 设置电脑U盘启动,重启电脑安装,注意安装时关闭在线下载,否则会安装很久 4. 安装 ...
- ES6 对象增强
对象字面量语法扩展: 1, 属性初始化语法简写:给一个属性赋一个变量值,如果变量名和属性名相同,可以省略变量名和冒号,直接写属性名,js引擎在执行代码的时候,自动查找 和属性命名相同的变量并赋值. l ...
- 【AGC030F】Permutation and Minimum DP
题目大意 有一个长度为序列 \(a\),其中某些位置的值是 \(-1\). 你要把 \(a\) 补成一个排列. 定义 \(b_i=\min(a_{2i-1},a_{2i})\),求有多少种可能的 \( ...
- hyper发送表单数据
前言 某个美丽的下午,运维把服务器上的nginx升级了,http协议也变成了http2.0,我本地的requests再也连接不到服务器,然后就找到了额hyper 但是hyper的文档写的很简单,而且相 ...
- Ticwatch2_3G版省电优化
设置 --> 网络与连接 --> 云消息同步(禁用) 设置 --> 声音与震动 --> 铃声与音量(静音) 设置 --> 声音与震动 --> 闹钟音量(静音) 设置 ...
- Vue(小案例_vue+axios仿手机app)_购物车(计算商品总金额)
一.前言 1.计算总金额 2.点击删除按钮,删除对应的商品信息 3.当还没结算的时候,当用户跳到其他页面 ...