python多线程实现抓取网页

Python实现抓取网页

以下的Python抓取网页的程序比較0基础。仅仅能抓取第一页的url所属的页面，仅仅要预定URL足够多。保证你抓取的网页是无限级别的哈，以下是代码：

##coding:utf-8

'''

	无限抓取网页

	@author wangbingyu

	@date 2014-06-26

'''

import sys,urllib,re,thread,time,threading

'''

创建下载线程类

'''

class download(threading.Thread):

	def __init__(self,url,threadName):

		threading.Thread.__init__(self,name=threadName)

		self.thread_stop = False

		self.url = url

	def run(self):

		while not self.thread_stop:

			self.list = self.getUrl(self.url)

			self.downloading(self.list)

	def stop(self):

		self.thread_stop = True

	def downloading(self,list):

		try:

			for i in range(len(list) - 1):

				urllib.urlretrieve(list[i],'E:\upload\download\%s.html' %  time.time())

		except Exception,ex:

			print Exception,'_upload:',ex

	def getUrl(self,url):

		result = []

		s = urllib.urlopen(url).read();

		ss = s.replace(' ','')

		urls=re.findall('<a.*?href=.*?

<\/a>',ss,re.I)

		for i in urls:

			tmp = i.split('"')

			try:

				if tmp[1]:

					if re.match(r'\http://.*',tmp[1]):

						result.append(tmp[1])

			except Exception,ex:

				print Exception,":getUrl",ex

		return result

if __name__ == '__main__':

	list = ['http://www.baidu.com','http://www.qq.com','http://www.taobao.com','http://www.sina.com.cn']

	for i in range(len(list)):

		#print list[i]

		download(list[i],'thread%s' % i).start()

	#list = ['http://www.baidu.com','http://www.sina.com.cn']

	#obj = download('http://www.baidu.com','threadName')

	#obj.start();

input()

python多线程实现抓取网页的更多相关文章

Python和Ruby抓取网页时的中文乱码问题(在Eclipse和Apatana Studio下均是这种解决方法
Python抓取中文网页乱码 :Eclipse+pydev2.2+python2.7 :Apatana Studio3+ pydev2.2+python2.7 run时设置 run--&g ...
python使用urllib2抓取网页
1.使用python的库urllib2,用到urlopen和Request方法. 2.方法urlopen原形 urllib2.urlopen(url[, data][, timeout]) 其中: u ...
怎么用Python写爬虫抓取网页数据
机器学习首先面临的一个问题就是准备数据,数据的来源大概有这么几种:公司积累数据,购买,交换,政府机构及企业公开的数据,通过爬虫从网上抓取.本篇介绍怎么写一个爬虫从网上抓取公开的数据. 很多语言都可以写 ...
Python -- 网络编程 -- 抓取网页图片 -- 豆瓣妹子
首先分析页面URL,形如http://dbmeizi.com/category/[1-14]?p=[0-476] 图片种类对应编号: 1:'性感', 2:'有沟', 3:'美腿', 4:'小露点', ...
Python -- 网络编程 -- 抓取网页图片 -- 图虫网
字符串(str)编码成字节码(bytes),字节码解码为字符串获取当前环境编码:sys.stdin.encoding url编码urllib.parse.quote() url解码urllib.pa ...
Python多线程爬虫爬取网页图片
临近期末考试,但是根本不想复习!啊啊啊啊啊啊啊!!!! 于是做了一个爬虫,网址为 https://yande.re,网页图片为动漫美图(图片带点颜色........宅男福利 github项目地址为:h ...
《与小卡特一起学Python》Code3 抓取网页中的某个数据
import urllib2 file = urllib2.urlopen('http://common.cnblogs.com/script/jquery.js') message = file.r ...
Python爬虫练习(多线程，进程，协程抓取网页)
详情点我跳转关注公众号"轻松学编程"了解更多. 一.多线程抓取网页流程:a.设置种子url b.获取区域列表 c.循环区域列表 d.创建线程获取页面数据 e.启动线程 impo ...
Python 抓取网页并提取信息(程序详解)
最近因项目需要用到python处理网页,因此学习相关知识.下面程序使用python抓取网页并提取信息,具体内容如下: #---------------------------------------- ...

随机推荐

（1）指针、引用、const限定符
自己看书时的一些理解,可能有错误的地方.随着指针的使用增多,会不断修改这篇文章的内容,过去错误的会用划线划去后保留. 1.对引用.指针.常量引用.指向常量的指针.常量指针的理解 //对引用.指针.常量 ...
Python之Pandas中Series、DataFrame实践
Python之Pandas中Series.DataFrame实践 1. pandas的数据结构Series 1.1 Series是一种类似于一维数组的对象,它由一组数据(各种NumPy数据类型)以及一 ...
Activity随笔
Activity的生命周期 1.正常情况下的生命周期 onCreate: Activity正在被创建,生命周期中的第一个方法,常在此方法中做一些初始化工作,比如调用setContentView方法, ...
UML实例教程解析UML建模分析与设计
UML统一建模语言在软件开发过程中非常实用,UMl建模的分析与设计你是否熟悉,这里就通过实例向大家介绍,希望通过本文的学习,你对UML建模的分析与设计方法有一定的了解. 本节向大家介绍一下图书管理系统 ...
OpenTSDB监控
OpenTSDB监控
Java变量及数据类型
变量及数据类型变量变量定义格式:数据类型变量名 = 初始化值; 基本数据类型整形数据 package com.ahabest.demo; //输出整形数据的最小值,默认值,最大值,二进制位数 ...
java jvm eclipse 性能调优
低配配置 -Dfile.encoding=UTF-8-Xms960m-Xmx960m-Xmn384m-Xverify:none-Xss256k-XX:MaxTenuringThreshold=2-XX ...
Linux---shell基本指令
1. 显示当前目录 pwd wangzhengchao@ubuntu:~$ cd /home/wangzhengchao/Desktop/ wangzhengchao@ubuntu:~/Desktop ...
剑指offer---正则表达式匹配
题目:正则表达式匹配要求:请实现一个函数用来匹配包括'.'和'*'的正则表达式.模式中的字符'.'表示任意一个字符,而'*'表示它前面的字符可以出现任意次(包含0次). 在本题中,匹配是指字符串的所 ...
Python介绍以及Python 优缺点
Python是先编译成字节码,然后在解释执行的一门语言,而不是单纯的解释型语言 Python应用场景: Web应用开发. 操作系统管理,服务器运维的自动化脚本, 网络爬虫科学计算桌面软件游戏服 ...

python多线程实现抓取网页

python多线程实现抓取网页的更多相关文章

随机推荐

热门专题