Python 保存爬行动物捕捉网页

选址的桌面壁纸网站汽车主题：

下面的两个print打开调试期间

#print tag

#print attrs

#!/usr/bin/env python

import re

import urllib2

import HTMLParser

base = "http://desk.zol.com.cn"

path = '/home/mk/cars/'

star = ''

def get_url(html):

	parser = parse(False)

	request = urllib2.Request(html)

	response = urllib2.urlopen(request)

	resp = response.read()

	parser.feed(resp)

def download(url):

	content = urllib2.urlopen(url).read()

	format = '[0-9]*\.jpg';

	res = re.search(format,url);

	print 'downloading:',res.group()

	filename = path+res.group()

	f = open(filename,'w+')

	f.write(content)

	f.close()

class parse(HTMLParser.HTMLParser):

	def __init__(self,Index):

		self.Index = Index;

		HTMLParser.HTMLParser.__init__(self)

	def handle_starttag(self,tag,attrs):

		#print tag

		#print attrs

		if(self.Index):

			if not cmp(tag,'a'):

				if(len(attrs) == 4):

					if(attrs[0] ==('class','pic')):

						#print tag

						#print attrs

						new = base+attrs[1][1]

						print 'found a link:',new

						global star

						star = new

						get_url(new)

		else:

			if not cmp(tag,'img'):

				if(attrs[0] == ('id','bigImg')):

					#print tag

					#print attrs

					Image_url = attrs[1][1]

					print 'found a picture:',Image_url

					download(Image_url)

			if not cmp(tag,'a'):

				if (len(attrs) == 4):

					if (attrs[1] == ('class','next')):

						#print tag

						#print attrs

						next = base + attrs[2][1]

						print 'found a link:',next

						if (star != next):

							get_url(next)

Index_url = 'http://desk.zol.com.cn/qiche/'

con = urllib2.urlopen(Index_url).read()

Parser_index = parse(True)

Parser_index.feed(con)

唯一的缺点是，在网站上漂亮的壁纸桌面壁纸。

。。

Python 保存爬行动物捕捉网页的更多相关文章

python通过代理刷网页点击量
python通过代理刷网页点击量更新异常处理情况 @time 2013-0803 更新循环里计数问题和随机等待时间问题 #!/usr/bin/python #-*- coding:utf-8 -*- ...
python笔记之提取网页中的超链接
python笔记之提取网页中的超链接对于提取网页中的超链接,先把网页内容读取出来,然后用beautifulsoup来解析是比较方便的.但是我发现一个问题,如果直接提取a标签的href,就会包含jav ...
python爬取某个网页的图片-如百度贴吧
python爬取某个网页的图片-如百度贴吧作者:vpoet mail:vpoet_sir@163.com 注:随意copy,不用告诉我 #coding:utf-8 import urllib imp ...
Python 保存数据的方法（4种方法）
Python 保存数据的方法: open函数保存使用with open()新建对象写入数据(这里使用的是爬取豆瓣读书中一本书的豆瓣短评作为例子) import requests from lxml ...
python 处理抓取网页乱码
python 处理抓取网页乱码问题一招鲜相信用python的人一定在抓取网页时,被编码问题弄晕过一阵前几天写了一个测试网页的小脚本,并查找是否包含指定的信息. 在html = urllib2. ...
Python 爬取单个网页所需要加载的地址和CSS、JS文件地址
Python 爬取单个网页所需要加载的URL地址和CSS.JS文件地址通过学习Python爬虫,知道根据正式表达式匹配查找到所需要的内容(标题.图片.文章等等).而我从测试的角度去使用Python爬 ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
python python 入门学习之网页数据爬虫cnbeta文章保存
需求驱动学习的动力. 因为我们单位上不了外网所以读新闻是那么的痛苦,试着自己抓取网页保存下来,然后离线阅读.今天抓取的是cnbeta科技新闻,抓取地址是http://m.cnbeta.com/wap/ ...
API例子：用Python驱动Firefox采集网页数据
1,引言本文讲解怎样用Python驱动Firefox浏览器写一个简易的网页数据采集器.开源Python即时网络爬虫项目将与Scrapy(基于twisted的异步网络框架)集成,所以本例将使用Scra ...

随机推荐

linux使用进阶（一）
本文依据<应该知道的Linux技巧>coolshell上的一篇文章提到的Linux技巧,结合自己掌握的情况进行扩展和总结得来.主要包含下面内容: 一.日常操作二.数据处理 ...
java socket 的参数选项解读(转)
java socket中有很多参数可以选择,这篇博客的目的是沉淀出这些参数的语义和用法,供自己以后查阅. 1.java socket参数选项总览在JDK1.6中有如下参数选项: 1 public f ...
xcode6 iOS sdk8.1隐藏系统状态栏
在代码项目(uzplayer)从iOS6升级到iOS8之后,头发如今视频播放器有.系统状态栏后面的背景: 这样就会导致有的时候按下Donebutton,或者拖滑块没有效果所以,我们须要想个办法.把这 ...
组件-------（一）redis系列--安装部署redis+实现redis分布式缓存 java+Spring+redis
目的:解决单机session不能共享问题,插入查询数据库时间效率问题,实现分布式缓存. 准备材料:Redis 下载链接 http://pan.baidu.com/s/1dEGTxvV 相关jar包如果 ...
hdu3485（递推）
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=3485 分析: a[i]表示长度为i,第i位为0的,符合情况的个数. b[i]表示长度为i,第i位为1的 ...
Java LinkedBlockingQueue和ArrayBlockingQueue分析
LinkedBlockingQueue是一个链表实现的堵塞队列,在链表一头增加元素,假设队列满.就会堵塞.还有一头取出元素.假设队列为空.就会堵塞. LinkedBlockingQueue内部使用Re ...
.Net 文本框实现内容提示(仿Google、Baidu)
原文:.Net 文本框实现内容提示(仿Google.Baidu) 1.Demo下载: 文本框实现内容提示(仿Google.Baidu).rar 2.创建数据库.表(我用的sqlserver2008数据 ...
基于.net开发chrome核心浏览器【四】
原文:基于.net开发chrome核心浏览器[四] 一: 上周去北京出差,给国家电网的项目做架构方案,每天都很晚睡,客户那边的副总也这样拼命工作. 累的不行了,直接导致第四篇文章没有按时发出来. 希望 ...
POJ 1515 Street Directions
题意: 一幅无向图将尽量多的无向边定向成有向边使得图强连通无向图保证是连通的且没有重边思路: 桥必须是双向的因此先求边双连通分量并将桥保存在ans中每一个双连通分量内的边一定都 ...
边坡优化主题5——bzoj 1096 [ZJOI2007]仓库建设解决问题的方法
[原标题] 1096: [ZJOI2007]仓库建设 Time Limit: 10 Sec Memory Limit: 162 MB Submit: 1998 Solved: 816 [id=10 ...

Python 保存爬行动物捕捉网页

Python 保存爬行动物捕捉网页的更多相关文章

随机推荐

热门专题