python 爬取妹子图

作为一个python还没入门的小白，搞懂这段代码实在是很不容易，还要去学html的知识（#黑脸）

因此我加上了注释，比较好读懂点

#coding=utf-8

import time

import requests

from bs4 import BeautifulSoup

import os

import sys

if(os.name == 'nt'):

        print(u'你正在使用win平台')

else:

        print(u'你正在使用linux平台')

header = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

#http请求头

all_url = 'http://www.mzitu.com'

start_html = requests.get(all_url,headers = header)

#保存地址

path = 'D:/mzitu/'

#找寻最大页数

soup = BeautifulSoup(start_html.text,"html.parser")    #定义为beautifulsoup类parser

page = soup.find_all('a',class_='page-numbers') #page为一个列表，找到标签为a的，属性class为‘page-numbers'的标签

max_page = page[-2].text #观察最大页数在-2处，用.text取文本信息

same_url = 'http://www.mzitu.com/page/'

for n in range(1,int(max_page)+1):

    ul = same_url+str(n)

    start_html = requests.get(ul, headers=header)

    soup = BeautifulSoup(start_html.text,"html.parser")#标签的寻找find是一对一对的然后用text取其中内容

    all_a = soup.find('div',class_='postlist').find_all('a',target='_blank')#在find  div的大类下找到所有标签a且a标签中target为blank的标签(因为有多个a类标签，需要把没用的排除掉)

    for a in all_a:    #all_a一共找到两个部分，第一个部分是空的，第二部分才能提取得到title

        title = a.text #提取文本内容就是在<>尖括号以外的信息

        if(title != ''):

            print("准备扒取："+title)

            #win不能创建带？的目录  如果目录中含有?将其替换为''

            if(os.path.exists(path+title.strip().replace('?',''))):#如果目录存在(exist)返回1，flag = 1

                flag=1

            else:

                os.makedirs(path+title.strip().replace('?',''))

                flag=0

            os.chdir(path + title.strip().replace('?',''))#改变当前工作目录到指定路径

            href = a['href']#图片地址

            html = requests.get(href,headers = header)

            mess = BeautifulSoup(html.text,"html.parser")

            pic_max = mess.find_all('span')

            pic_max = pic_max[10].text #最大页数

            if(flag == 1 and len(os.listdir(path+title.strip().replace('?',''))) >= int(pic_max)):

                print('已经保存完毕，跳过')

                continue

            for num in range(1,int(pic_max)+1):

                time.sleep(1)#抓慢一点，上次爬的太快ip被封了

                pic = href+'/'+str(num)#图片所在页的地址

                html = requests.get(pic,headers = header)

                mess = BeautifulSoup(html.text,"html.parser")

                pic_url = mess.find('img',alt = title)#找到标签为img

                html = requests.get(pic_url['src'],headers = header)#这里找到的才是真正图片的地址

                file_name = pic_url['src'].split(r'/')[-1]#文件名为地址分割后的最后一个字符串

                f = open(file_name,'wb')

                f.write(html.content)#content是类函数，在这里就是地址html所表示的图片

                f.close()

            print('完成')

    print('第',n,'页完成')

python 爬取妹子图的更多相关文章

Python 爬虫入门(二)——爬取妹子图
Python 爬虫入门听说你写代码没动力?本文就给你动力,爬取妹子图.如果这也没动力那就没救了. GitHub 地址: https://github.com/injetlee/Python/blob ...
Python 爬虫入门之爬取妹子图
Python 爬虫入门之爬取妹子图来源:李英杰链接: https://segmentfault.com/a/1190000015798452 听说你写代码没动力?本文就给你动力,爬取妹子图.如果 ...
小白学 Python 爬虫（16）：urllib 实战之爬取妹子图
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
scrapy 也能爬取妹子图？
目录前言 Media Pipeline 启用Media Pipeline 使用 ImgPipeline 抓取妹子图瞎比比前言我们在抓取数据的过程中,除了要抓取文本数据之外,当然也会有抓取图片的需 ...
使用request+Beautiful爬取妹子图
一.request安装 pip install requests request使用示例 import requests response = requests.get('https://www.mz ...
requests+正则表达式爬取妹子图
做了一个爬取妹子图某张索引页面的爬虫,主要用request和正则表达式. 感谢崔庆才大神的爬虫教学视频和 gitbook: B站:https://www.bilibili.com/video/a ...
爬取妹子图(requests + BeautifulSoup)
刚刚入门爬虫,今天先对于单个图集进行爬取,过几天再进行翻页爬取. 使用requests库和BeautifulSoup库目标网站:妹子图今天是对于单个图集的爬取,就选择一个进行爬取,我选择的链接为: ...
利用 PhpQuery 随机爬取妹子图
前言运行下面的代码会随机得到妹子图的一张图片,代码中的phpQuery可以在这里下载:phpQuery-0.9.5.386.zip <?php require 'phpQuery.php'; ...
Python爬虫个人记录（三）爬取妹子图
这此教程可能会比较简洁,具体细节可参考我的第一篇教程: Python爬虫个人记录(一)豆瓣250 Python爬虫个人记录(二)fishc爬虫一.目的分析获取煎蛋妹子图并下载 http://jan ...

随机推荐

由于防火墙限制无法访问linux服务器上的tomcat应用
使用的是CentOS6.4系统. 问题重现: tomcat服务是启动的, 但无法访问服务器上的tomcat应用页面. 解决办法: 在防火墙配置中设置端口: 命令: # cd /etc/sysconfi ...
Python入门之面向对象编程(二)python类的详解
本文通过创建几个类来覆盖python中类的基础知识,主要有如下几个类 Animal :各种属性.方法以及属性的修改 Dog :将方法转化为属性并操作的方法 Cat :私人属性讲解,方法的继承与覆盖 T ...
更换 nodejs npm 镜像为淘宝镜像
淘宝npm镜像官方介绍文档:https://npm.taobao.org/ ,使用命令在这个官方文档里查询. 安装工具cnpm: $ npm install -g cnpm --registry=ht ...
20145321《网络对抗》Exp2 后门原理与实践
实验内容 (1)使用netcat获取主机操作Shell,cron启动 (2)使用socat获取主机操作Shell, 任务计划启动 (3)使用MSF meterpreter生成可执行文件,利用ncat或 ...
JQuery插件模板
(function($){ $.fn.插件名 = function(settings){ var defaultSettings = { } /* 合并默认参数和用户自定义参数 */settings ...
[BZOJ5139][Usaco2017 Dec]Greedy Gift Takers 权值线段树
Description Farmer John's nemesis, Farmer Nhoj, has NN cows (1≤N≤10^5), conveniently numbered 1…N. T ...
mybatis的注解开发之三种动态sql
脚本sql XML配置方式的动态SQL我就不讲了,有兴趣可以自己了解,下面是用<script>的方式把它照搬过来,用注解来实现.适用于xml配置转换到注解配置 @Select(" ...
Hadoop Hive概念学习系列之hive里的分区（九）
为了对表进行合理的管理以及提高查询效率,Hive可以将表组织成“分区”. 分区是表的部分列的集合,可以为频繁使用的数据建立分区,这样查找分区中的数据时就不需要扫描全表,这对于提高查找效率很有帮助. 分 ...
hdu 1014 Uniform Generator 数论
摘取于http://blog.csdn.net/kenden23/article/details/37519883: 找到规律之后本题就是水题了,不过找规律也不太容易的,证明这个规律成立更加不容易. ...
适用于目前环境的bug记录
问测试,bugtracker.JIRA,你们用起来啊? 难道bugtracker/JIRA只有测试用吗? 截屏忽略,只有测试人员自己提bug,开发不管不顾,解决了也不关闭bug,bug提得太多,还嫌测 ...

python 爬取妹子图

python 爬取妹子图的更多相关文章

随机推荐

热门专题