Cola：一个分布式爬虫框架

Cola：一个分布式爬虫框架 - 系统架构 - Python4cn(news, jobs)

Cola：一个分布式爬虫框架

发布时间：2013-06-17 14:58:27，关注：+2034，赞美：+4，不爽：+2

本文标签：爬虫分布式

原始出处：残阳似血的博客
由于早先写的WeiboCrawler问题很多，而且当时我有提到，其实可以实现一个通用的爬虫框架。最近由于要抓取新的数据，于是我就写了这个cola。下面的文字来自wiki。

Cola是一个分布式的爬虫框架，用户只需编写几个特定的函数，而无需关注分布式运行的细节。任务会自动分配到多台机器上，整个过程对用户是透明的。

依赖

由于Cola配置文件使用的yaml，所以Cola只依赖于pyyaml，安装easy_install或者pip工具后，则可以：
pip install pyyaml
安装

下载或者用git clone源码，假设在目录/to/pth/cola，将该路径添加到Python path中。

一种简单的方法是在site-packages中添加pth文件。site-packages因系统而异，如果是windows，假设python装在C:\python27，那么就是C:\python27\Lib\site-packages；如果是linux，那么应该是/usr/local/lib/pythonX.X/dist-packages。

在site-packages下新建一个cola.pth文件，里面写上路径：/to/path/cola。

运行

Cola集群需要一个master和若干个worker，对于每台机器，只能启动一个worker。但是，集群不是必须的，在单机模式下亦可以运行。

Cola目前自带了两个爬虫，分别是维基百科和新浪微博。在项目根目录下的contrib中。

下面就wiki为例，分别说明如何在单机和分布式环境下运行。

依赖

无论是维基百科还是新浪微博的实现，数据都存放在MongoDB中，所以要确保MongoDB的安装。

在wiki下的wiki.yaml和sina下的sina.yaml中可以配置MongoDB的主机和端口。

维基百科和新浪微博实现依赖于下面的几个包：

mechanize

python-dateutil

BeautifulSoup4

mongoengine

rsa（仅新浪微博需要）

可以使用pip或者easy_install来安装。

单机模式

单机模式非常简单，只需运行contrib/wiki/__init__.py即可。
cd /to/path/cola/contrib/wiki

python __init__.py
要运行新浪微博的爬虫，需要在sina.yaml中配置登录的用户名和密码。这里要注意，要保证这个用户名和密码在登录时不需要验证码。

分布式模式

首先需要启动cola master和cola workers。分别运行根目录下bin中的start_master.py和start_worker.py

启动cola master：
cd /to/path/cola

python bin/start_master.py --data /my/path/data
如果不指定--data，那么数据文件会防止在项目根目录下的data文件夹中。

启动cola worker：
python bin/start_worker.py --master  --data /my/path/data
--data选项同master。如果不指定master，会询问是否连接到本机master，输入yes连接。

最后使用bin下的coca.py来运行指定的Cola job：
python bin/coca.py -m  -runLocalJob /to/path/cola/contrib/wiki
-runLocalJob选项是要运行的job所在文件夹的绝对路径。输入命令后，该job会被提交到Cola集群来运行。

停止Cola Job或集群

停止整个集群，则可以运行：
python bin/coca.py -stopAll
而停止一个Job，则需要查询得到Job的名称：
python bin/coca.py -showRunningJobsNames
得到名称后，再运行：
python bin/coca.py -stopRunningJobByName [job name]
编写自定义Cola Job

见wiki编写自定义Cola Job。

问题

Cola还不够稳定，目前会处于持续改进的状态。且Cola还没有在较大规模的集群上测试，但是接下来我会把Cola应用到新项目中，并逐步完善。也希望大家也能给我反馈，并帮助改进。

Todo

实现一个web接口，可以查看运行的cola job以及运行情况

实现一个opener能够运行JS代码和执行AJAX请求。

支持增量抓取机制。

简化安装，支持easy_install或者pip安装。增加解决依赖库安装的机制。

Cola：一个分布式爬虫框架 - 系统架构 - Python4cn(news, jobs)的更多相关文章

分布式爬虫框架XXL-CRAWLER
<分布式爬虫框架XXL-CRAWLER> 一.简介 1.1 概述 XXL-CRAWLER 是一个分布式爬虫框架.一行代码开发一个分布式爬虫,拥有"多线程.异步.IP动态代理.分布 ...
基于redis的简易分布式爬虫框架
代码地址如下:http://www.demodashi.com/demo/13338.html 开发环境 Python 3.6 Requests Redis 3.2.100 Pycharm(非必需,但 ...
分布式链路跟踪系统架构SkyWalking和zipkin和pinpoint
Net和Java基于zipkin的全链路追踪 https://www.cnblogs.com/zhangs1986/p/8966051.html 在各大厂分布式链路跟踪系统架构对比中已经介绍了几大框 ...
Dubbo[一个分布式服务框架
http://alibaba.github.io/dubbo-doc-static/User+Guide-zh.htm#UserGuide-zh-API%E9%85%8D%E7%BD%AE http: ...
Dubbo 是一个分布式服务框架
Dubbo 是一个分布式服务框架-----http://www.cnblogs.com/chanshuyi/p/5144288.html
2020年大厂Java面试题（基础+框架+系统架构+分布式+实战）
前言作为一个Java开发者,Java架构师应该是大家的一个职业目标了吧. 要成为Java架构师,首先你要是一个高级Java工程师,熟练使用各种框架,并知道它们实现的原理.jvm虚拟机原理.调优,懂得 ...
设计一个分布式RPC框架
0 前言提前先祝大家春节快乐!好了,先简单聊聊. 我从事的是大数据开发相关的工作,主要负责的是大数据计算这块的内容.最近Hive集群跑任务总是会出现Thrift连接HS2相关问题,研究了解了下内部原 ...
【网络爬虫】【python】网络爬虫（四）：scrapy爬虫框架（架构、win/linux安装、文件结构）
scrapy框架的学习,目前个人觉得比较详尽的资料主要有两个: 1.官方教程文档.scrapy的github wiki: 2.一个很好的scrapy中文文档:http://scrapy-chs.rea ...
Scrapy+Scrapy-redis+Scrapyd+Gerapy 分布式爬虫框架整合
简介:给正在学习的小伙伴们分享一下自己的感悟,如有理解不正确的地方,望指出,感谢~ 首先介绍一下这个标题吧~ 1. Scrapy:是一个基于Twisted的异步IO框架,有了这个框架,我们就不需要等待 ...

随机推荐

mysql sql学习（一）mysql连接
mysql -h 192.168.3.103 -uroot -p123456 //连接数据库 \s :查看数据库状态 show databases; 查看是数据库 create database if ...
javascript正则表达式/g与/i及/gi的意义
regularexpression=/pattern/[switch] 这个switch就有三种值 g: 全局匹配 i: 忽略大小写 gi: 全局匹配 + 忽略大小写 JScript 语言参考 --- ...
关于AJAX+HTML5+ASHX进行全静态页面的数据交互
及时总结项目中使用到的知识,知识在于积累. 1.HTML代码 <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN ...
poj 1141 Brackets Sequence（区间DP）
题目:http://poj.org/problem?id=1141 转载:http://blog.csdn.net/lijiecsu/article/details/7589877 定义合法的括号序列 ...
N沟道增强型MOS管双向低频开关电路
MOS-N 场效应管双向电平转换电路 -- 适用于低频信号电平转换的简单应用如上图所示,是 MOS-N 场效应管双向电平转换电路.双向传输原理: 为了方便讲述,定义 3.3V 为 A 端,5.0 ...
setPluginsEnabled(true) 谁知道android的4.3之后为什么会报错
我也是最近才遇到这个问题的,查了下资料,setPluginEnable已经弃用了,使用webSettings.setPluginState(WebSettings.PluginState.ON);可以 ...
Boost.Asio c++ 网络编程翻译（14）
保持活动假如,你须要做以下的操作: io_service service; ip::tcp::socket sock(service); char buff[512]; ... read(sock, ...
spring NotWritablePropertyException异常
Caused by: org.springframework.beans.NotWritablePropertyException: Invalid property 'userDao' of bea ...
SQL学习之高级数据过滤
一.高级数据过滤之IN操作符 IN 操作符用来指定条件范围,范围中的每个条件都可以进行匹配.IN取一组由逗号分隔.括在圆括号中的合法值.代码如下: select ItemId,ItemName,Che ...
Web定时执行某个方法-网页获取
实现该功能用到的是System.Timers.Timer 将定时的方法添加到Global.ascx.cs中 public class Global : System.Web.HttpApplicati ...

Cola：一个分布式爬虫框架 - 系统架构 - Python4cn(news, jobs)

依赖

安装

运行

编写自定义Cola Job

问题

Todo

Cola：一个分布式爬虫框架 - 系统架构 - Python4cn(news, jobs)的更多相关文章

随机推荐

热门专题