Python 爬虫七夕福利

祝大家七夕愉快

妹子图

 import requests

 from lxml import etree

 import os

 def headers(refere):#图片的下载可能和头部的referer有关,所以将referer设为变换值,以躲避反扒

     headers = {

         'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.106 Safari/537.36',

         'Refere': '{}'.format(refere)}

     return headers

 def Tuji(pag):#找图集

     fullurl = 'http://www.mzitu.com/page/{}/'.format(pag)

     shouye_html_text = requests.get(fullurl).text

     shouye_ele = etree.HTML(shouye_html_text)

     tj_list = shouye_ele.xpath('//*[@id="pins"]/li/a/@href')#找每页的图集url

     Tuji_url_list = []

     for tj_url in tj_list:

         Tuji_url_list.append(tj_url)

     return Tuji_url_list

 def gettuji_info(tj_url_list):#图集的url列表 收集图集的相关信息

     for tj_url_1 in tj_url_list: #tj_url_1 --- > http://www.mzitu.com/146823

         tj_html_text = requests.get(tj_url_1, headers=headers(tj_url_1)).text

         tj_ele = etree.HTML(tj_html_text)

         img_title = tj_ele.xpath('//h2[@class="main-title"]/text()')[0]  # 图集名称

         max_pag_list = int(tj_ele.xpath('/html/body/div[2]/div[1]/div[4]/a[5]/span/text()')[0])  # 找最大页数

         if os.path.exists(img_title):

             pass

         else:

             os.mkdir(img_title)

         for i in range(1, int(max_pag_list + 1)):

             tj_url_2 = tj_url_1 + '/'+str(i)  #tj_url_2 ---> http://www.mzitu.com/146823 + pag

             tj_html = requests.get(tj_url_2, headers=headers(tj_url_1))

             tj_html_text = tj_html.text

             tj_ele = etree.HTML(tj_html_text)

             img_url = tj_ele.xpath('//div[@class="main-image"]/p/a/img/@src')[0] # 从不同的tj_url_2中找图片的url

             print('正在下载'+img_title+'第'+str(i)+'张')

             with open(img_title+'/'+str(i)+'.jpg', "wb+") as jpg:

                 jpg.write(requests.get(img_url, headers=headers(tj_url_2)).content)

             jpg.close()

 if __name__ == '__main__':

     pags = int(input('你想搞几页的嘿嘿?'))

     for pag in range(1,pags+1):

         gettuji_info(Tuji(pag))

Python 爬虫七夕福利的更多相关文章

Python爬虫初学（二）—— 爬百度贴吧
Python爬虫初学(二)-- 爬百度贴吧昨天初步接触了爬虫,实现了爬取网络段子并逐条阅读等功能,详见Python爬虫初学(一). 今天准备对百度贴吧下手了,嘿嘿.依然是跟着这个博客学习的,这次仿照 ...
Python 爬虫入门(二)——爬取妹子图
Python 爬虫入门听说你写代码没动力?本文就给你动力,爬取妹子图.如果这也没动力那就没救了. GitHub 地址: https://github.com/injetlee/Python/blob ...
专业的“python爬虫工程师”需要学习哪些知识？
学到哪种程度暂且把目标定位初级爬虫工程师,简单列一下吧: (必要部分) 熟悉多线程编程.网络编程.HTTP协议相关开发过完整爬虫项目(最好有全站爬虫经验,这个下面会说到) 反爬相关,cookie. ...
Python爬虫实战四之抓取淘宝MM照片
原文:Python爬虫实战四之抓取淘宝MM照片其实还有好多,大家可以看 Python爬虫学习系列教程福利啊福利,本次为大家带来的项目是抓取淘宝MM照片并保存起来,大家有没有很激动呢? 本篇目标 1. ...
Python 爬虫入门之爬取妹子图
Python 爬虫入门之爬取妹子图来源:李英杰链接: https://segmentfault.com/a/1190000015798452 听说你写代码没动力?本文就给你动力,爬取妹子图.如果 ...
Python爬虫个人记录（三）爬取妹子图
这此教程可能会比较简洁,具体细节可参考我的第一篇教程: Python爬虫个人记录(一)豆瓣250 Python爬虫个人记录(二)fishc爬虫一.目的分析获取煎蛋妹子图并下载 http://jan ...
孤荷凌寒自学python第六十七天初步了解Python爬虫初识requests模块
孤荷凌寒自学python第六十七天初步了解Python爬虫初识requests模块 (完整学习过程屏幕记录视频地址在文末) 从今天起开始正式学习Python的爬虫. 今天已经初步了解了两个主要的模块: ...
(转)python爬虫----（scrapy框架提高（1），自定义Request爬取）
摘要之前一直使用默认的parse入口,以及SgmlLinkExtractor自动抓取url.但是一般使用的时候都是需要自己写具体的url抓取函数的. python 爬虫 scrapy scrapy提 ...
Python爬虫+颜值打分，5000+图片找到你的Mrs. Right
一见钟情钟的不是情,是脸日久生情生的不是脸,是情项目简介本项目利用Python爬虫和百度人脸识别API,针对简书交友专栏,爬取用户照片(侵删),并进行打分. 本项目包括以下内容: 图片爬 ...

随机推荐

动态给table添加动态航
<html> <head> <title>usually function</title> <meta http-equiv="Cont ...
SAP成都研究院2018年总共87篇技术文章合集
2018年很快就要结束了.Jerry在2017年年底准备开始写这个公众号时,给自己定的目标是:2018年至少保证每周发布一篇高质量的文章.如今2018年就快过去了,高质量与否需要大家来反馈,至少从量上 ...
20140316 曼联VS利物浦，罗杰斯的小九九，当4312对上4231
一.预测的阵式!? 赛前看fourfourtwo,Whoscored的首发预测,楼主立刻意淫了阵式图,并且大言不惭在微博贴了当晚的热战区域(上图的左侧),并疑惑着,格伦·囧森打左后卫,那这……显然是逼 ...
六种排序算法的JavaScript实现以及总结
最近几天在系统的复习排序算法,之前都没有系统性的学习过,也没有留下过什么笔记,所以很快就忘了,这次好好地学习一下. 首先说明为了减少限制,以下代码通通运行于Node V8引擎而非浏览器,源码在我的Gi ...
python 时间和时间戳的转化
时间戳与时间之间的转换,需要一个中间过程,即将先将时间或时间戳先转为时间元组! 1.时间转时间戳: import datetime, time s = datetime.datetime(2016,6 ...
牛客网多校训练第三场 C - Shuffle Cards（Splay / rope）
链接: https://www.nowcoder.com/acm/contest/141/C 题意: 给出一个n个元素的序列(1,2,...,n)和m个操作(1≤n,m≤1e5),每个操作给出两个数p ...
UVa 12186 - Another Crisis（树形DP）
链接: https://uva.onlinejudge.org/index.php?option=com_onlinejudge&Itemid=8&page=show_problem& ...
protobuf编码
proto2 Protocol Buffers 是一种轻便高效的结构化数据存储格式,可以用于结构化数据序列化,适合做数据存储或 RPC 数据交换格式.可用于通讯协议.数据存储等领域的语言无关.平台无 ...
c#返回值的理解
我感觉没什么用...就是在别的地方用的时候可以直接以Add(a,b)这样的方式赋值就行,不用再用c这个中间变量去接收了,希望有一天有大佬能给我讲讲设置返回值有什么好处
由.def文件生成lib文件[转]
最近在学习curl库时,碰到一个问题,从官网上下载了一个lib版的,却发现只有.dll,没有lib文件,感觉很奇怪,google了之后才知道,原来库作者的用意是让用户自己生成lib文件,下载到的lib ...

Python 爬虫 七夕福利

Python 爬虫 七夕福利的更多相关文章

随机推荐

热门专题

Python 爬虫七夕福利

Python 爬虫七夕福利的更多相关文章