python 斗图图片爬虫

捣鼓了三小时，有一些小Bug，望大佬指导

废话不说，直接上代码：

#!/usr/bin/python3

# -*- coding:UTF-8 -*-

import os,re,requests

from urllib import request,parse

class Doutu_api(object):

    def __init__(self):

        self.api_html = r'http://www.doutula.com/search?keyword=%s'

        self.headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 '

                                      '(KHTML, like Gecko) Chrome/66.0.3359.181 Safari/537.36'}

        self.path = os.path.dirname(os.path.realpath(__file__))+'\\temp'

    def make_path(self,path=''):#返回假为已创建，否则创建新文件夹

        self.path = self.path+'\\'+path

        if os.path.exists(self.path):  # 判断文件夹是否存在

            return False

        else:

            os.mkdir(self.path)  # 创建文件夹

            return True

    def get_img_html(self,html):

        self.make_path(path=html)

        html = self.api_html%parse.quote(html)

        pattern = re.compile(u'<a.*?class="col-xs-6 col-md-2".*?href="(.*?)".*?style="padding:5px;">.*?</a>',re.S)

        pattern_img = re.compile(u'<td>.*?<img.*?src="(.*?)".*?alt="(.*?)".*?onerror=".*?">.*?</td>',re.S)

        try:

            req = request.Request(html, headers=self.headers)

            imgs = request.urlopen(req)

            imgs = imgs.read().decode('utf-8')

            imgs = re.findall(pattern, imgs)

            for img in imgs:

                req = request.Request(img, headers=self.headers)

                imgurl = request.urlopen(req).read().decode('utf-8')

                imgurl =re.findall(pattern_img, imgurl)

                with open(self.path+'\\{}.png'.format(imgurl[0][1].replace('/','-')), 'wb') as file:

                    response = requests.get(imgurl[0][0]).content  # 下载图片

                    file.write(response)  # 读取图片

            print('已完成下载,图片地址:',self.path)

        except Exception as e:

            print(e)

        return None

doutu = Doutu_api()

doutu.get_img_html(input('斗图内容关键字：'))

测试成功

python 斗图图片爬虫的更多相关文章

py3+requests+urllib+bs4+threading，爬取斗图图片
实现原理及思路请参考我的另外几篇爬虫实践博客 py3+urllib+bs4+反爬,20+行代码教你爬取豆瓣妹子图:http://www.cnblogs.com/UncleYong/p/6892688. ...
python+tkinter+动画图片+爬虫（查询天气）的GUI图形界面设计
1.完整代码: import time import urllib.request #发送网络请求,获取数据 import gzip #压缩和解压缩模块 import json #解析获得的数据 fr ...
【Python】：简单爬虫作业
使用Python编写的图片爬虫作业: #coding=utf-8 import urllib import re def getPage(url): #urllib.urlopen(url[, dat ...
python多线程爬虫+批量下载斗图啦图片项目（关注、持续更新）
python多线程爬虫项目() 爬取目标:斗图啦(起始url:http://www.doutula.com/photo/list/?page=1) 爬取内容:斗图啦全网图片使用工具:requests ...
python爬虫我是斗图之王
python爬虫我是斗图之王本文会以斗图啦网站为例,爬取所有表情包. 阅读之前需要对线程池.连接池.正则表达式稍作了解. 分析网站页面url分析打开斗图啦网站,简单翻阅之后发现最新表情每页包含的 ...
Python爬虫入门教程 13-100 斗图啦表情包多线程爬取
斗图啦表情包多线程爬取-写在前面今天在CSDN博客,发现好多人写爬虫都在爬取一个叫做斗图啦的网站,里面很多表情包,然后瞅了瞅,各种实现方式都有,今天我给你实现一个多线程版本的.关键技术点 aioht ...
【Python爬虫实战】图片爬虫-淘宝图片爬虫--千图网图片爬虫
所谓图片爬虫,就是从互联网中自动把对方服务器上的图片爬下来的爬虫程序.有些图片是直接在html文件里面,有些是隐藏在JS文件中,在html文件中只需要我们分析源码就能得到如果是隐藏在JS文件中,那么就 ...
python 爬虫系列09-异步斗图来一波
斗图斗图,妈妈再也不怕我都不赢了 import requests from lxml import etree from urllib import request import os import ...
python多线程爬取斗图啦数据
python多线程爬取斗图啦网的表情数据使用到的技术点 requests请求库 re 正则表达式 pyquery解析库,python实现的jquery threading 线程 queue 队列 ' ...

随机推荐

js里的数组push用法及append（）
result.result[0].name var arr = new Array();$.each(result.result, function(i, item) { arr ...
全栈工程师，也叫全端工程师，英文FullStackdevelopver。是指掌握多种技能，并能利用多种技能独立完成产品的人。
全栈工程师的发展在系统全面的大公司,全栈工程师并没有一个稳定的发展职位.我无比赞同知乎那个帖子里面这样的一句话: 一个真正的全栈工程师,目标只有一个:创业. 听起来有些悲凉,但事实就是如此.任何一个 ...
SpringMVC 返回实体对象时屏蔽某些属性
SpringMVC 可以直接已JSON的结果返回实体对象,可是返回时是所有属性与属性值都会一并返回, 怎样才能屏蔽某些属性?方法很简单,只要在实体对象类中要屏蔽的属性值上加 @JsonIgnore 注 ...
hibernate课程初探单表映射2-3 session简介
hibernate流程: 1 配置对象Configurateion 读取 hibernate.cfg.xml 2 会话工厂SessionFactory 读取 user.hbm.xml(创建销毁相当耗费 ...
vue-cli建立的项目如何在手机端运行以及如何用charles来抓包
刚开始自己在config文件夹下的index.js中的dev下的host写成的是localhost,但是发现自己不能在手机端访问,并且也不可以在charles进行抓包处理,后来把localhost改成 ...
<Android 基础（一）> Service
介绍 Service(服务)是一个没有用户界面的在后台运行执行耗时操作的应用组件.其他应用组件能够启动Service,并且当用户切换到另外的应用场景,Service将持续在后台运行.另外,一个组件能够 ...
GBase数据库存储过程——批量删除多个数据表的数据
偶尔需要清空一下数据库,重装成本太高. --清空历史存储过程 DROP Procedure `dap_model`.`delete_datas` ; --创建存储过程 DELIMITER // CRE ...
绿卡基础知识：I-129
绿卡基础知识:I-129 标签: 绿卡基础知识 I-129 表格本不该你来填的.那是你老板的 business.在美国工作,除非是公民或有绿卡,都需要移民局的批准.如果你没有 EAD,I-129 就是 ...
windows mysql忘记密码解决方案
因为mysql很久之前装的,今天突然想用的时候发现密码不记得,怎一个尴尬了得,所以没办法,只能修改一个新的密码. 在此过程中遇到了几个问题 1.没法进入数据库: 2.修 ...
LeetCode Merge Sorted Array 合并已排序的数组
void merge(int A[], int m, int B[], int n) { int *a=A,*b=B; ,j=; ||m==){ //针对特殊情况,比如A或B中无元素的情况 & ...

python 斗图图片爬虫

python 斗图图片爬虫的更多相关文章

随机推荐

热门专题