python实战项目 — 爬取校花网图片

重点：

1. 指定路径创建文件夹，判断是否存在

2. 保存图片文件

# 获得校花网的地址，图片的链接

import re

import requests

import time

import os

start = time.time()

num = 0                        # 为了记录爬的照片的次数

# 设置路径

path = 'D:\校花网'

# 判断目录下的文件夹是否已经创建，如果不存在

if not os.path.exists(path):

    # 则创建路径文件夹

    os.makedirs(path)

    print("完成创建文件夹！")

else:

    # 如果存在，则不需要创建

    pass

    print('路径已经存在，不需要创建！')

for url_name in range(5):

    response = requests.get(f'http://www.xiaohuar.com/list-1-{url_name}.html')

    # data就是我们要的校花F12里的东西啦，并用字符串格式保存

    data = response.text

    print("正在解析处理第{}页 ".format(url_name))

    # print(data)

    # 其中(.*?)表示我们所要获得的内容

    one_list = re.findall('" src="(.*?)" /></a>', data)

    # type str 这是为了让pycharm 更快的知道V是字符串格式方便导入内置方法

    for v in range(len(one_list)):

        # 这是为了让其中有些保护的图片变成正确的超链接格式

        if one_list[v].startswith('/d'):

            one_list[v] = f'http://www.xiaohuar.com/{one_list[v]}'

    for x in one_list:

        # 为了自动生成文件名,由于 one_list 网址有"/" 分割，最后的数据太长，所以名字也很长

        # x 是链接 随机一条如： http://www.xiaohuar.com//d/file/20190818/a73a16dfeaf75bd16d2e355642e1e16e.jpg

        name = x.split('/')[-1]

        # 再次分析链接，获得图片的信息

        dd = requests.get(x)

        # 图片信息装换成机械语言

        d_data = dd.content

        with open(f'D:\校花网\{name}','wb') as fw:

            fw.write(d_data)

            # 强行把缓冲区中的内容放到磁盘中

            fw.flush()

            num += 1

            print(f'已经爬取{num}张')

        # 防止段时间请求过多

        time.sleep(1)

print("全部完成，耗时%d s"%(start - time.time()))

python实战项目 — 爬取校花网图片的更多相关文章

Go语言实战-爬取校花网图片
一.目标网站分析爬取校花网http://www.xiaohuar.com/大学校花所有图片. 经过分析,所有图片分为四个页面,http://www.xiaohuar.com/list-1-0.htm ...
Scrapy爬虫框架之爬取校花网图片
Scrapy Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 其可以应用在数据挖掘,信息处理或存储历史数据等一系列的程序中.其最初是为了页面抓取 (更确切来说, 网络抓取 )所设 ...
python实战项目 — 爬取妹子图网，保存图片到本地
重点: 1. 用def函数 2. 使用 os.path.dirname("路径保存") , 实现每组图片保存在独立的文件夹中方法1: import requests from l ...
python实战项目 — 爬取中国票房网年度电影信息并保存在csv
import pandas as pd import requests from bs4 import BeautifulSoup import time def spider(url, header ...
python爬虫基础应用----爬取校花网视频
一.爬虫简单介绍爬虫是什么? 爬虫是首先使用模拟浏览器访问网站获取数据,然后通过解析过滤获得有价值的信息,最后保存到到自己库中的程序. 爬虫程序包括哪些模块? python中的爬虫程序主要包括,re ...
scrapy爬取校花网男神图片保存到本地
爬虫四部曲,本人按自己的步骤来写,可能有很多漏洞,望各位大神指点指点 1.创建项目 scrapy startproject xiaohuawang scrapy.cfg: 项目的配置文件xiaohua ...
第六篇 - bs4爬取校花网
环境:python3 pycharm 模块:requests bs4 urlretrieve os time 第一步:获取网页源代码 import requests from bs4 imp ...
Python-爬取校花网视频(单线程和多线程版本)
一.参考文章 python爬虫爬取校花网视频,单线程爬取爬虫----爬取校花网视频,包含多线程版本上述两篇文章都是对校花网视频的爬取,由于时间相隔很久了,校花网上的一些视频已经不存在了,因此上述文 ...
Java基础-爬虫实战之爬去校花网网站内容
Java基础-爬虫实战之爬去校花网网站内容作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 爬虫这个实现点我压根就没有把它当做重点,也没打算做网络爬虫工程师,说起爬虫我更喜欢用Pyt ...

随机推荐

微软安全技术Shim
Shim是微软系统中一个小型函数库,用于透明地拦截API调用,修改传递的参数.自身处理操作.或把操作重定向到其他地方.Shim主要用于解决遗留应用程序在新版Windows系统上的兼容性问题,但Shim ...
[RN] React Native 幻灯片效果 Banner
[RN] React Native 幻灯片效果 Banner 1.定义Banner import React, {Component} from 'react'; import {Image, Scr ...
洛谷P1265 公路修建题解
题目描述某国有n个城市,它们互相之间没有公路相通,因此交通十分不便.为解决这一“行路难”的问题,政府决定修建公路.修建公路的任务由各城市共同完成. 修建工程分若干轮完成.在每一轮中,每个城市选择一个 ...
洛谷 P2136 拉近距离题解
P2136 拉近距离题目背景我是源点,你是终点.我们之间有负权环. --小明题目描述在小明和小红的生活中,有N个关键的节点.有M个事件,记为一个三元组(Si,Ti,Wi),表示从节点Si有一个 ...
web安全总结
一.XSS 首先说下最常见的 XSS 漏洞,XSS (Cross Site Script),跨站脚本攻击,因为缩写和 CSS (Cascading Style Sheets) 重叠,所以只能叫 XSS ...
【04NOIP普及组】火星人（信息学奥赛一本通 1929）（洛谷 1088）
[题目描述] 人类终于登上了火星的土地并且见到了神秘的火星人.人类和火星人都无法理解对方的语言,但是我们的科学家发明了一种用数字交流的方法.这种交流方法是这样的,首先,火星人把一个非常大的数字告诉人类 ...
Dubbo+zookeeper实现单表的增删改查
1.数据库准备建表语句 CREATE TABLE `tb_brand` ( `id` ) NOT NULL AUTO_INCREMENT, `name` ) DEFAULT NULL COMMENT ...
【Excel】多条件查找
例如下图:要求在单元格从C10中根据分类与名称找出相应的数量 1.VLOOKUP函数(数组公式) {=VLOOKUP(A10&B10,IF({1,0},A2:A6&B2:B6,C2:C ...
windows开机自动执行bat脚本
一.以windows下备份sql数据库为例,开机自动执行.bat脚本 1.新建dump.bat文件,文件中的代码如下: set YYYYmmdd=%date:~0,4%%date:~5,2%%date ...
python2.7报错Non-ASCII character '\xe5' in file的解决方法
在文件首行加#coding=utf-8,一定要在最顶行添加

python实战项目 — 爬取 校花网图片

python实战项目 — 爬取 校花网图片的更多相关文章

随机推荐

热门专题

python实战项目 — 爬取校花网图片

python实战项目 — 爬取校花网图片的更多相关文章