#!/usr/bin/env python
#coding=utf-8
import threading
import urllib
import re
import time cur=0
last=0
totalcount=0
depth=0
t_mutex=threading.Condition() class Mycrawler:
def __init__(self,crawlername,seeds,threadnum):
self.crawlername=crawlername
self.seeds=seeds
self.crawqueue=CrawQueue()
self.initQueue(self.seeds)
self.threadnum=threadnum
self.threadpools=[]
self.logfile=file('log2.txt','w')
def initQueue(self,seeds):
if isinstance(seeds,str):
self.crawqueue.push(seeds)
elif isinstance(seeds,list):
for seed in seeds:
self.crawqueue.push(seed)
global last
global totalcount
totalcount=self.crawqueue.getQueueCount()
last=totalcount
def crawling(self):
global cur
global depth
global last
global totalcount
self.log(">>>Depth "+str(depth)+":\n")
while self.crawqueue.getQueueCount()!=0:
url=self.crawqueue.pop()
self.log(url)
if url==None:
continue
self.crawqueue.addToVisited(url)
links=self.getLinks(url)
if links==None:
print 'None'
self.crawqueue.failed.append(url)
continue
beforenum = self.crawqueue.getQueueCount()
self.crawqueue.addLinks(links)
afternum = self.crawqueue.getQueueCount()
totalcount+=afternum-beforenum
cur+=1
if cur==last:
depth+=1
self.log(">>>Depth "+str(depth)+":\n")
last=totalcount
def crawling2(self):
global last
global totalcount
global depth
self.log(">>>Depth "+str(depth)+":\n")
totalcount=self.crawqueue.getQueueCount()
last=totalcount
while self.crawqueue.getQueueCount()!=0:
for i in range(self.threadnum):
url=self.crawqueue.pop()
if url==None:
break
crawthread=crawlerThread(url,i,self)
self.threadpools.append(crawthread)
crawthread.start()
for i in range(len(self.threadpools)):
crawthread=self.threadpools[i]
crawthread.join(30)
def log(self,content):
self.logfile.write(content+"\n")
class crawlerThread(threading.Thread):
def __init__(self,url,tid,mycrawler):
threading.Thread.__init__(self)
self.url=url
self.tid=tid
self.mycrawler=mycrawler
def run(self):
global t_mutex
global cur
global last
global totalcount
global depth
t_mutex.acquire()
self.mycrawler.log(self.url)
t_mutex.release()
links=self.getLinks(self.url)
if links==None:
t_mutex.acquire()
self.mycrawler.crawqueue.addToVisited(self.url)
self.mycrawler.crawqueue.addToFailed(self.url)
t_mutex.release()
else:
t_mutex.acquire()
self.mycrawler.crawqueue.addToVisited(self.url)
beforenum=self.mycrawler.crawqueue.getQueueCount()
self.mycrawler.crawqueue.addLinks(links)
afternum =self.mycrawler.crawqueue.getQueueCount()
totalcount+=afternum-beforenum
t_mutex.release()
t_mutex.acquire()
cur+=1
if cur==last:
depth+=1
self.mycrawler.log(">>>Depth "+str(depth)+":\n")
last=totalcount
t_mutex.release()
def getLinks(self,url):
try:
page=urllib.urlopen(url)
html=page.read()
reg=r'"(http://.+?)"'
regob=re.compile(reg,re.DOTALL)
links=regob.findall(html)
return links
except:
print 'Failed downloading and saving',url
return None
class CrawQueue:
def __init__(self):
self.queue=[]
self.visited=[]
self.failed=[]
def getQueue(self):
return self.queue
def getVisited(self):
return self.visited
def getFailed(self):
return self.failed
def push(self,url):
if url!="" and url not in self.queue and url not in self.visited:
self.queue.insert(0,url)
def pop(self):
if len(self.queue)==0:
#print 'failed to pop: queue is empty'
return None
else:
return self.queue.pop()
def isEmpty(self):
if len(self.queue)==0:
return 1
else:
return 0
def addToVisited(self,url):
self.visited.append(url)
def addToFailed(self,url):
self.failed.append(url)
def remove(self,url):
self.queue.remove(url)
def getVisitedCount(self):
return len(self.visited)
def getQueueCount(self):
return len(self.queue)
def addLinks(self,links):
for link in links:
self.push(link) if __name__=="__main__":
seeds="http://www.douban.com/"
threadnum=int(raw_input("设置线程数:"))
crawlername="小小爬虫"
mycrawler=Mycrawler(crawlername,seeds,threadnum)
mycrawler.crawling2()

多线程网页爬虫 python 实现(二)的更多相关文章

  1. 多线程网页爬虫 python 实现

    采用了多线程和锁机制,实现了广度优先算法的网页爬虫. 对于一个网络爬虫,如果要按广度遍历的方式下载,它就是这样干活的:         1.从给定的入口网址把第一个网页下载下来         2.从 ...

  2. python网页爬虫开发之二

    1.网站robots robotparser模块首先加载robots.txt文件,然后通过can_fetch()函数确定指定的用户代理是否允许访问网页. 2.识别网站技术 3.下载网页 使用urlli ...

  3. python 网页爬虫+保存图片+多线程+网络代理

    今天,又算是浪费了一天了.python爬虫,之前写过简单的版本,那个时候还不懂原理,现在算是收尾吧. 以前对网页爬虫不了解,感觉非常神奇,但是解开这面面纱,似乎里面的原理并不是很难掌握.首先,明白一个 ...

  4. Python爬虫初学(二)—— 爬百度贴吧

    Python爬虫初学(二)-- 爬百度贴吧 昨天初步接触了爬虫,实现了爬取网络段子并逐条阅读等功能,详见Python爬虫初学(一). 今天准备对百度贴吧下手了,嘿嘿.依然是跟着这个博客学习的,这次仿照 ...

  5. Python 网页爬虫 & 文本处理 & 科学计算 & 机器学习 & 数据挖掘兵器谱(转)

    原文:http://www.52nlp.cn/python-网页爬虫-文本处理-科学计算-机器学习-数据挖掘 曾经因为NLTK的缘故开始学习Python,之后渐渐成为我工作中的第一辅助脚本语言,虽然开 ...

  6. Python网页爬虫(一)

    很多时候我们想要获得网站的数据,但是网站并没有提供相应的API调用,这时候应该怎么办呢?还有的时候我们需要模拟人的一些行为,例如点击网页上的按钮等,又有什么好的解决方法吗?这些正是python和网页爬 ...

  7. Python爬虫学习:二、爬虫的初步尝试

    我使用的编辑器是IDLE,版本为Python2.7.11,Windows平台. 本文是博主原创随笔,转载时请注明出处Maple2cat|Python爬虫学习:二.爬虫的初步尝试 1.尝试抓取指定网页 ...

  8. 【Python】Python 网页爬虫 & 文本处理 & 科学计算 & 机器学习 & 数据挖掘兵器谱

    本文转载自:https://www.cnblogs.com/colipso/p/4284510.html 好文 mark http://www.52nlp.cn/python-%E7%BD%91%E9 ...

  9. Python 3实现网页爬虫

    1 什么是网页爬虫 网络爬虫( 网页蜘蛛,网络机器人,网页追逐者,自动索引,模拟程序)是一种按照一定的规则自动地抓取互联网信息的程序或者脚本,从互联网上抓取对于我们有价值的信息.Tips:自动提取网页 ...

随机推荐

  1. 剑指Offer(书):二叉树的镜像

    题目:操作给定的二叉树,将其变换为源二叉树的镜像. public void Mirror(TreeNode root) { if (root == null) { return ; } if (roo ...

  2. int (*a)[10] 和 int *a[10] 的区别

    int *a[10] :指针数组.数组a里存放的是10个int型指针 int (*a)[10] :数组指针.a是指针,指向一个数组.此数组有10个int型元素 int *a[10] 先找到声明符a,然 ...

  3. java读写串口数据

    本博文参考自https://www.cnblogs.com/Dreamer-1/p/5523046.html 最近接触到了串口及其读写,在此记录java进行串口读写的过程. 1.导入串口支持包 需要下 ...

  4. ython——杂货铺

    三目运算: >>> 1 if 5>3 else 0 1 >>> 1 if 5<3 else 0 0 深浅拷贝: 一.数字和字符串 对于 数字 和 字符串 ...

  5. ubuntu搭建LAMP全教程

    http://jingyan.baidu.com/article/a681b0de36ad683b18434691.html 本经验向你展示如何在ubuntu14.04 环境下搭建apache2 + ...

  6. cell展开的几种方式

    一.插入新的cell 原理: (1)定义是否展开,和展开的cell的下标 @property (assign, nonatomic) BOOL isExpand; //是否展开 @property ( ...

  7. 【bzoj3671】[Noi2014]随机数生成器 贪心

    题目描述 输入 第1行包含5个整数,依次为 x_0,a,b,c,d ,描述小H采用的随机数生成算法所需的随机种子.第2行包含三个整数 N,M,Q ,表示小H希望生成一个1到 N×M 的排列来填入她 N ...

  8. spring工作机制及为什么要用?

    spring工作机制及为什么要用?1.spring mvc请所有的请求都提交给DispatcherServlet,它会委托应用系统的其他模块负责对请求进行真正的处理工作.2.DispatcherSer ...

  9. 常州模拟赛d2t2 小X的密室

    题目描述 密室中有 N 个房间,初始时,小 X 在 1 号房间,而出口在 N 号房间. 密室的每一个房间中可能有着一些钥匙和一些传送门,一个传送门会 单向地 创造一条从房间 X 到房间 Y 的通道.另 ...

  10. JSP表单提交中文乱码

    简要笔记:由于jsp默认表单提交编码方式是:ISO-8859-1,而我们需要的是utf-8或者是gbk码,故需要转化. 具体方法是:在表单处理文件中,将获取到的变量进行转换. String userN ...