python 爬图 helloworld

最近发现吾志上用户的头像都很个性，另外，对于没有把日记设为私密的用户，最后一天的日记是公开的，谁都可以查看。

所以，如果每天把所有可查看的日记爬一遍，那么～～哈哈

以前对爬虫只是了解一点点，没有真的玩过。既然今晚兴致来了，那就随便学一下咯～

参考 http://blog.csdn.net/pleasecallmewhy/article/details/8925978

参考 http://cuiqingcai.com/1052.html

 #coding=utf-8

 import os

 import urllib

 import urllib2

 import re

 import cookielib

 def mkdir(path):

     # 去除左右两边的空格

     path = path.strip()

     # 去除尾部 \ 符号

     path = path.rstrip("\\")

     if not os.path.exists(path):

         os.makedirs(path)

     return path

 def save_file(path, file_name, data):

     if data == None:

         return

     mkdir(path)

     if (not path.endswith("/")):

         path = path + "/"

     f = open(path+file_name, "wb")

     f.write(data)

     f.flush()

     f.close()

 user_agent = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_4) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/41.0.2272.118 Safari/537.36'

 headers = {'User-Agent' : user_agent}

 values = {}

 data = urllib.urlencode(values)

 def getHtml(url):

     req = urllib2.Request(url, data, headers)

     page = urllib2.urlopen(req, timeout=10)

     html = page.read()

     page.close()

     #print html

     return html

 def get_file(url):

     try:

         opener = urllib2.build_opener()

         opener.addheaders = [('User-Agent', 'Mozilla/5.0')]

         urllib2.install_opener(opener)

         req = urllib2.Request(url)

         operate = opener.open(req)

         data = operate.read()

         operate.close()

         return data

     except BaseException, e:

         print e, 'fuck'

         return None

 def getImg(html):

     reg = r'src="(.+?\.jpg)" alt='

     imgre = re.compile(reg)

     imglist = re.findall(imgre, html)

     x = 0

     for imgurl in imglist:

         #urllib.urlretrieve(imgurl, '%s.jpg' % x)

         da = get_file(imgurl)

         save_file('.', '%s.jpg' % x, da)

         x += 1

     return x

 html = getHtml("https://wuzhi.me/last")

 print getImg(html)

十分简陋，哈哈～

python 爬图 helloworld的更多相关文章

python爬图
闲的无事,看着知乎里种种python优点,按捺不住,装起python3.4. 网上找了点爬行图片的代码,修改至兼容3.4,成功爬行指定url所有jpg图片,代码段如下: import os impor ...
python 爬图
利用bs库进行爬取,在下载html时,使用代理user_agent来下载,并且下载次数是2次,当第一次下载失败后,并且http状态码是500-600之间,然后会重新下载一次 soup = Beauti ...
Python多线程爬图&Scrapy框架爬图
一.背景对于日常Python爬虫由于效率问题,本次测试使用多线程和Scrapy框架来实现抓取斗图啦表情.由于IO操作不使用CPU,对于IO密集(磁盘IO/网络IO/人机交互IO)型适合用多线程,对于 ...
python爬取股票最新数据并用excel绘制树状图
大家好,最近大A的白马股们简直跌妈不认,作为重仓了抱团白马股基金的养鸡少年,每日那是一个以泪洗面啊. 不过从金融界最近一个交易日的大盘云图来看,其实很多中小股还是红色滴,绿的都是白马股们. 以下截图 ...
python学习之BeautifulSoup模块爬图
BeautifulSoup模块爬图学习HTML文本解析标签定位网上教程多是爬mzitu,此网站反爬限制多了.随意找了个网址,解析速度有些慢.脚本流程:首页获取总页数-->拼接每页URL--> ...
python爬取免费优质IP归属地查询接口
python爬取免费优质IP归属地查询接口具体不表,我今天要做的工作就是: 需要将数据库中大量ip查询出起归属地刚开始感觉好简单啊,毕竟只需要从百度找个免费接口然后来个python脚本跑一晚上就o ...
萌新学习Python爬取B站弹幕+R语言分词demo说明
代码地址如下:http://www.demodashi.com/demo/11578.html 一.写在前面之前在简书首页看到了Python爬虫的介绍,于是就想着爬取B站弹幕并绘制词云,因此有了这样 ...
用Python爬E站本
用Python爬E站本一.前言参考并改进自 OverJerry 大佬的教你怎么用Python爬取E站的本子_OverJerry. 本文为技术学习记录,不提供访问无存在网站的任何方法,也不包含不和 ...
Python爬取网页信息
Python爬取网页信息的步骤以爬取英文名字网站(https://nameberry.com/)中每个名字的评论内容,包括英文名,用户名,评论的时间和评论的内容为例. 1.确认网址在浏览器中输入初 ...

随机推荐

教你用PS修复老照片
原图素材虽然很旧,不过人物部分并没有怎么损坏,只是有一些色块和杂色.修复的工程相对来说也少很多.只需要给人物磨好皮,然后把暗调和高光部分调出来即可.原图一.打开原图素材,按Ctrl + J ...
记录下 UTF6 GBK 转换函数
int GBK2UTF8(char *szGbk,char *szUtf8,int Len) { // 先将多字节GBK(CP_ACP或ANSI)转换成宽字符UTF-16 // 得到转换后,所需要的内 ...
37 The Benefits of Cutting Salt 减少盐分摄取量的益处
The Benefits of Cutting Salt 减少盐分摄取量的益处 ①Just when you had figured out how to manage fat in your die ...
arduino 与 android 通过TCP进行字节收发
arduino #include <avr/wdt.h> #include <SoftwareSerial.h> #define FPIN 13 SoftwareSerial ...
public class 和class 的区别
Java在编写类的时候可以使用两种方式定义类: public class定义类: class定义类: 如果一个类声明的时候使用了public class进行了声明,则类名称必须与 ...
ＰＡＴ甲　1002. A+B for Polynomials (25) 2016-09-09 22:50 64人阅读评论(0) 收藏
1002. A+B for Polynomials (25) 时间限制 400 ms 内存限制 65536 kB 代码长度限制 16000 B 判题程序 Standard 作者 CHEN, Yue T ...
Postman - 測試 API 的好工具
POSTMAN in Google APP Store 因為工作的關係,常常寫一些 API 供 APP 使用.以前傻傻的,每次測試的時候都會自己刻一個 HTML 的表單,一個一個填入 input ,接 ...
[mysql] mysql如何实现更新一条记录中某个字段值的一部分呢？
场景:在平常我们使用word文档等等office办公软件时,我们常会使用搜索->替换的功能. mysql: 在mysql 中有时候,我们也需要这样子的实现: 实现 SQL 语句: update ...
inline函数的作用
(一)inline函数(摘自C++ Primer的第三版) 在函数声明或定义中函数返回类型前加上关键字inline即把min()指定为内联. inline int min(int first, int ...
Android-AndroidStudio莫名其妙的错误-finished with non-zero exit value 1
上一篇博客,Android-AndroidStudio莫名其妙的错误-finished with non-zero exit value 1,解决了由于 string.xml 字符导致的: 而这篇博客 ...

python 爬图 helloworld

python 爬图 helloworld的更多相关文章

随机推荐

热门专题