python爬煎蛋妹子图

 # python3

 # jiandan meizi tu

 import urllib

 import urllib.request as req

 import os

 import time

 import random

 def url_open(url):

     req1 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/4.0'})

     req2 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/4.1'})

     req3 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/4.5'})

     req4 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/5.1'})

     req_list = [req1, req2,req3, req4]

     response = urllib.request.urlopen(random.choice(req_list))

     html = response.read()

     # print ('url_open done!')

     return html

 def url_open2(url):

     req1 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/4.0'})

     req2 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/4.1'})

     req3 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/4.5'})

     req4 = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/5.1'})

     req_list = [req1, req2,req3, req4]

     ip_list = ['117.135.251.136:82']

     ip = random.choice(ip_list)

     print (ip)

     proxy = req.ProxyHandler({'http': ip})

     # auth = req.HTTPBasicAuthHandler()

     opener = req.build_opener(proxy, req.HTTPHandler)

     req.install_opener(opener)

     conn = req.urlopen(random.choice(req_list))

     return_str = conn.read()

     return return_str

 def get_current_page(url):

     html = url_open2(url).decode('utf-8')

     a = html.find('current-comment-page') + 23

     b = html.find(']',a)

     return html[a:b]

 def find_imgs(url):

     html = url_open2(url).decode('utf-8')

     img_addrs = []

     a = html.find('img src="http')

     while a != -1:

         b = html.find('.jpg',a, a+255)

         if b != -1:

             img_addrs.append(html[a+9:b+4])

         else:

             b = a + 13

         a = html.find('img src="http', b)

     return img_addrs

 def save_imgs(folder,img_addrs):

     for each in img_addrs:

         filename = each.split('/')[-1]

         with open(filename,'wb') as f:

             img = url_open2(each)

             f.write(img)

 def download_mm(folder = 'xx',pages = 300):

     # os.mkdir(folder)

     os.chdir(folder)

     url = 'http://jandan.net/ooxx/'

     current_page_num = int(get_current_page(url))

     for i in range(pages):

         print (time.strftime("%Y-%m-%d %H:%M:%S",time.localtime()),'current_page_num', current_page_num)

         if i%3 == 0:

             print (time.strftime("%Y-%m-%d %H:%M:%S",time.localtime()),"sleep 2 seconds...")

             time.sleep(2)

         current_page_num -= 1

         page_url = url + 'page-' + str(current_page_num) + '#comments'

         img_addrs = find_imgs(page_url)

         save_imgs(folder, img_addrs)

 if __name__ == '__main__':

     download_mm()

python爬煎蛋妹子图的更多相关文章

[Java]使用HttpClient实现一个简单爬虫，抓取煎蛋妹子图
第一篇文章,就从一个简单爬虫开始吧. 这只虫子的功能很简单,抓取到”煎蛋网xxoo”网页(http://jandan.net/ooxx/page-1537),解析出其中的妹子图,保存至本地. 先放结果 ...
手把手教你用Python爬虫煎蛋妹纸海量图片
我们的目标是用爬虫来干一件略污事情最近听说煎蛋上有好多可爱的妹子,而且爬虫从妹子图抓起练手最好,毕竟动力大嘛.而且现在网络上的妹子很黄很暴力,一下接受太多容易营养不量,但是本着有人身体就比较好的套路 ...
python爬煎蛋妹子图--20多行代码搞定煎蛋妹子图库
如果说一个人够无聊的话... 就会做一些十分美(wei)丽(suo)的事情啦哈哈哈... 好的,话不多说,进入正题. 正如标题所示,我们今天的目标很简单: 代码要少,妹子要好. 步骤如下: 1. 首先 ...
「玩转Python」突破封锁继续爬取百万妹子图
前言从零学 Python 案例,自从提交第一个妹子图版本引来了不少小伙伴的兴趣.最近,很多小伙伴发来私信说,妹子图不能爬了!? 趁着周末试了一把,果然爬不动了,爬下来的都是些 0kb 的假图片,然后 ...
[Python爬虫]煎蛋网OOXX妹子图爬虫（1）——解密图片地址
之前在鱼C论坛的时候,看到很多人都在用Python写爬虫爬煎蛋网的妹子图,当时我也写过,爬了很多的妹子图片.后来煎蛋网把妹子图的网页改进了,对图片的地址进行了加密,所以论坛里面的人经常有人问怎么请求的 ...
py3+urllib+bs4+反爬，20+行代码教你爬取豆瓣妹子图
0.准备所用到的模块: urllib.request,获取源码 beautifulsoup4(bs4),网页抓取数据安装bs4,python3 -m pip install beautiful ...
python爬虫之一---------豆瓣妹子图
#-*- coding:utf-8 -*- __author__ = "carry" import urllib import urllib2 from bs4 import Be ...
python 爬虫煎蛋网
import urllib.request import os from urllib import error import re import base64 def url_open(url): ...
python 爬取图片
使用python的requests库爬取网页时,获取文本一般使用text方法,如果要获取图片并保存要用content 举个栗子,爬煎蛋网的图: #!/usr/bin/env python #-*- c ...

随机推荐

bootstrap-fileinput 图片上传
bootstrap-fileinput 源文件在网上下载 CSS: <link href="../../static/Bootstrap/css/plugins/bootstrap- ...
Android Jni变量对照表
字符 Java类型 C类型 V void void Z jboolean boolean I jint in ...
NSArray的排序
1.自定义方法排序: NSArray *array = [NSArray arrayWithObjects:", nil]; NSArray *array2 = [array sortedA ...
GCC编译默认的头文件搜索路径
对于c语言来说: gcc -xc -E -v - 截图: 对于c++来说: gcc -xc++ -E -v - 截图: gcc的arg和opt解释: 后面一干啥作用暂时不知道
linux中的文件类型
1.使用ls -l命令可以查看文件的类型和权限 [tansheng@localhost etc]$ ls -l ----------. root root 10月 : gshadow -------- ...
20145129 《Java程序设计》第4周学习总结
20145129 <Java程序设计>第4周学习总结教材学习内容总结继承与多肽继承共同行为继承是避免多个类间重复定义共同行为.(将相同的代码提升为父类) 关键字extends:表示 ...
Notes of the scrum meeting（12.7）
meeting time:18:30~19:10p.m.,December 7th,2013 meeting place:3号公寓一层 attendees: 顾育豪 ...
nodejs笔记三--url处理、Query String；
URL--该模块包含用以 URL 解析的实用函数. 使用 require('url') 来调用该模块. 一.parse函数的基础用法 parse函数的作用是解析url,返回一个json格式的数组,请看 ...
【Unique Binary Search Trees II】cpp
题目: Given n, generate all structurally unique BST's (binary search trees) that store values 1...n. F ...
throttle/debounce: 为你的cpu减减压(前端性能优化)
何为throttle, 何为debounce? 谷歌翻译给出的意思:throttle 掐死??? debounce 去抖好吧,按理解我们习惯翻译成 ——节流. 那么在什么场景下需要用到? 场景一 ...

python爬煎蛋妹子图

python爬煎蛋妹子图的更多相关文章

随机推荐

热门专题