python3爬取全站美眉图片

爬取网站：https://www.169tp.com/xingganmeinv

该网站美眉图片有数百页，每页24张，共上万张图片,全部爬取下来

 import urllib.request

 import re

 import os

 from bs4 import BeautifulSoup

 page_flag = 0

 base_url = "https://www.169tp.com/xingganmeinv/"

 first_url ="https://www.169tp.com/xingganmeinv/list_1_1.html"

 Imgnums = 0

 def get_html(url):

     response = urllib.request.urlopen(url)

     html = response.read().decode('gb18030')

     return html

 def get_Imgurl_list(html):

     img_urllist = re.findall('src=["\']{1}(.+?\.jpg)["\']{1}', html)

     return img_urllist

 def Download(img_urllist,page_flag,final_path,Imgnums):

     num = 1

     for imgurl in img_urllist:

         imgname = "{}{}{}{}.jpg".format(final_path,page_flag,'_',num)

         urllib.request.urlretrieve(imgurl,imgname)

         print("已经爬取图片名:",imgname)

         Imgnums += 1

         num += 1

 def makedir(path):

     path = path.strip()

     isExists = os.path.exists(path)

     if not isExists:

         print("创建了路径为 ",path," 的文件夹")

         os.makedirs(path)

         return True

     else:

         print("路径为 ",path," 的文件夹已经存在")

         return False

 filepath = input("请输入保持图片的文件夹路径:")

 print(filepath)

 name = input("请输入保存图片的文件夹名:")

 print(name)

 finalpath = filepath + name

 makedir(finalpath)

 finalpath += '\\'

 print(f"图片保存路径: {finalpath}")

 Download(get_Imgurl_list(first_url),page_flag,finalpath,Imgnums)

 mysoup = BeautifulSoup(get_html(first_url),'html.parser')

 next_page = mysoup.find('div',attrs = {'class':'page'}).find('li',text = '下一页').find('a')

 while next_page:

     new_url = base_url + next_page['href']

     page_flag += 1

     Download(get_Imgurl_list(get_html(new_url)),page_flag,finalpath,Imgnums)

     mysoup = BeautifulSoup(get_html(new_url),'html.parser')

     next_page = mysoup.find('div',attrs = {'class':'page'}).find('li',text = '下一页').find('a')

 print(f"下载完成,共下载了 {Imgnums} 张图片!")

运行截图:

图片名命名规则:存储路径+页码+下划线+图片号+.jpg

图片文件夹截图:

python3爬取全站美眉图片的更多相关文章

Python爬取全站妹子图片，差点硬盘走火了！
在这严寒的冬日,为了点燃我们的热情,今天小编可是给大家带来了偷偷收藏了很久的好东西.大家要注意点哈,我第一次使用的时候,大意导致差点坏了大事哈! 1.所需库安装 2.网站分析首先打开妹子图的官网(m ...
Python3爬取美女妹子图片转载
# -*- coding: utf-8 -*- """ Created on Sun Dec 30 15:38:25 2018 @author: 球球 "&qu ...
python3爬取动态网站图片
思路: 1.图片放在<image>XXX</image>标签中 2.利用fiddler抓包获取存放图片信息的js文件url 3.利用requests库获取html内容,然后获取 ...
python3爬取1024图片
这两年python特别火,火到博客园现在也是隔三差五的出现一些python的文章.各种开源软件.各种爬虫算法纷纷开路,作为互联网行业的IT狗自然看的我也是心痒痒,于是趁着这个雾霾横行的周末瞅了两眼,作 ...
python3爬取女神图片，破解盗链问题
title: python3爬取女神图片,破解盗链问题 date: 2018-04-22 08:26:00 tags: [python3,美女,图片抓取,爬虫, 盗链] comments: true ...
如何用python爬虫从爬取一章小说到爬取全站小说
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. PS:如有需要Python学习资料的小伙伴可以加点击下方链接自行获取http ...
python 爬虫入门----案例爬取上海租房图片
前言对于一个net开发这爬虫真真的以前没有写过.这段时间学习python爬虫,今天周末无聊写了一段代码爬取上海租房图片,其实很简短就是利用爬虫的第三方库Requests与BeautifulSoup. ...
Python3 爬取微信好友基本信息，并进行数据清洗
Python3 爬取微信好友基本信息,并进行数据清洗 1,登录获取好友基础信息: 好友的获取方法为get_friends,将会返回完整的好友列表. 其中每个好友为一个字典列表的第一项为本人的账号信息 ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...

随机推荐

gulpfile配置
/** * 只包含合并压缩混淆,监听服务 */// 引入gulp模块var gulp = require('gulp'); // 引入其他模块var less = require('gulp-less ...
Mavn 使用介绍
1 Maven介绍 1.1 项目开发中遇到的问题 1.都是同样的代码,为什么在我的机器上可以编译执行,而在他的机器上就不行? 2.为什么在我的机器上可以正常打包,而配置管理员却打不出来? 3.项目 ...
Java 监听器，国际化
1. 监听器 1.1 概述监听器: 主要是用来监听特定对象的创建或销毁.属性的变化的! 是一个实现特定接口的普通java类! 对象: 自己创建自己用 (不用监听) 别人创建自己用 (需要监听) Se ...
servlet中cookie和session操作
1.1 软件中的会话一次会话: 打开浏览器 -> 访问一些服务器内容 -> 关闭浏览器登录场景: 打开浏览器 -> 浏览到登陆页面 -> 输入用户名和密码 -> 访问 ...
sql-syscolumns,INFORMATION_SCHEMA.columns,sysobjects
//计算表tb_Blog的字段个数 select count(*) from syscolumns where id=object_id('tb_Blog') 获取指定表的所有字段和字段类型 SELE ...
Bootstrap + AngularJS+ Ashx + SQL Server/MySQL
去年年底12月,为适应移动端浏览需求,花了1个月时间学习Bootstrap,并将公司ASP网站重构成ASP.NET. 当时采取的网站架构: Bootstrap + jQuery + Ashx + SQ ...
SpringBoot中Mybaties PageHelper插件使用
首先引入pom.xml文件配置  <dependency> <groupId>org.mybatis.spring.boot&l ...
Thinkphp中在本地测试很好，在服务器上出错，有可能是因为debug缓存的问题
define('APP_DEBUG',false); 这个设置从true改为false后,一定要清空缓存,否则会出错.
加密算法IV的作用
使用随机数产生的初始化向量才能达到语义安全(散列函数与消息验证码也有相同要求),并让攻击者难以对同一把密钥的密文进行破解初始化向量的值依密码算法而不同.最基本的要求是“唯一性”,也就是说同一把密钥不 ...
oracle 插入大于4000字符的 clob代码
OracleConnection connection = new OracleConnection(conn); OracleCommand command = new OracleCommand( ...

python3爬取全站美眉图片

python3爬取全站美眉图片的更多相关文章

随机推荐

热门专题