python3爬取动态网站图片

思路：

1、图片放在<image>XXX</image>标签中

2、利用fiddler抓包获取存放图片信息的js文件url

3、利用requests库获取html内容，然后获取其中图片id

4、利用fiddler抓取下载图片地址，结合图片id来下载图片（大文件）

# -*- coding:UTF-8 -*-

import requests, json, time

from contextlib import closing

class get_photos(object):

    def __init__(self):

        self.photos_id = []

        self.download_server = 'https://unsplash.com/photos/xxx/download?force=trues'#下载图片地址，通过fiddler抓包获取

        self.target = 'https://unsplash.com/napi/photos?page=1&per_page=24'#存有图片信息的js文件地址

        self.headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.142 Safari/537.36'}

    """

    函数说明:获取图片ID

    """

    def get_ids(self):

        req = requests.get(url=self.target, headers=self.headers, verify=False)

        html = json.loads(req.text)

        print(type(html), len(html))

        for i in range(len(html)):

            self.photos_id.append(html[i]['id'])#将列表html中获取id放到列表photos_id中

        print(self.photos_id)

        time.sleep(1)

    """

    函数说明:图片下载

    """

    def download(self, photo_id, filename):

        self.headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.142 Safari/537.36'}

        self.target = self.download_server.replace('xxx', photo_id)#将xxx换成图片id

        #closing可以将任意对象转成上下文对象

        with closing(requests.get(url=self.target, stream=True, verify = False, headers = self.headers)) as r:

            with open('%d.jpg' % filename, 'ab+') as f:

                #下载大文件，r.iter_content表示获取响应原始内容

                for chunk in r.iter_content(chunk_size = 1024):#边下载边存硬盘，chunk_size表示以1024比例存数据

                    if chunk:

                        f.write(chunk)

                        f.flush()#强行把缓冲区中的内容放到磁盘中

if __name__ == '__main__':

    gp = get_photos()#类实例化

    print('获取图片连接中:')

    gp.get_ids()#获取图片id

    print('图片下载中:')

    for i in range(len(gp.photos_id)):

        print('正在下载第%d张图片' % (i+1))

        gp.download(gp.photos_id[i], (i+1))

python3爬取动态网站图片的更多相关文章

python3 urllib爬取wallhalla网站图片
点我去我的github上看源码简单使用静态方法爬取https://wallhalla.com/网站的图片参考: https://blog.csdn.net/cquptcmj/article/det ...
Java爬虫实践--爬取CSDN网站图片为例
实现的效果,自动在工程下创建Pictures文件夹,根据网站URL爬取图片,层层获取.在Pictures下以网站的层级URL命名文件夹,用来装该层URL下的图片.同时将文件名,路径,URL插入数据库, ...
python3爬取全站美眉图片
爬取网站:https://www.169tp.com/xingganmeinv 该网站美眉图片有数百页,每页24张,共上万张图片,全部爬取下来 import urllib.request import ...
【每周小项目】使用 puppeteer 插件爬取动态网站
目录 0. 前言问题解决 1. 下载与引包 2. 使用步骤 3. 爬过的几个坑 page.evaluate 的传参问题元素操作问题 0. 前言这两天对爬虫开始感兴趣,最开始是源于天涯的一个房价 ...
Python3爬取美女妹子图片转载
# -*- coding: utf-8 -*- """ Created on Sun Dec 30 15:38:25 2018 @author: 球球 "&qu ...
使用nodejs+http(s)+events+cheerio+iconv-lite爬取2717网站图片数据到本地文件夹
源代码如下: //(node:9240) Warning: Setting the NODE_TLS_REJECT_UNAUTHORIZED environment variable to '0' ...
实战爬取某网站图片-Python
直接上代码 1 #!/usr/bin/python 2 # -*- coding: UTF-8 -*- 3 from bs4 import BeautifulSoup 4 import request ...
Scrapy 爬取某网站图片
1. 创建一个 Scrapy 项目,在命令行或者 Pycharm 的 Terminal 中输入: scrapy startproject imagepix 自动生成了下列文件: 2. 在 imagep ...
python爬虫-基础入门-爬取整个网站《3》
python爬虫-基础入门-爬取整个网站<3> 描述: 前两章粗略的讲述了python2.python3爬取整个网站,这章节简单的记录一下python2.python3的区别 python ...

随机推荐

HDU 6191 Query on A Tree ( 2017广西邀请赛 && 可持久化Trie )
题目链接题意 : 给你一棵树.树上的每个点都有点权.之后有若干次问询.每次问询给出一个节点编号以及一个整数 X .问你以给出节点为根的子树中哪个节点和 X 异或最大.输出这个值分析 : 看到这种树 ...
51nod 1120 机器人走方格V3
1120 机器人走方格 V3 基准时间限制:1 秒空间限制:131072 KB 分值: 80 难度:5级算法题收藏关注 N * N的方格,从左上到右下画一条线.一个机器人从左上走到右下,只 ...
Make文件（一）
基本规则: 目标:依赖 (tab)规则目标:需要生成的目标文件依赖:生成该目标所需的一些文件规则:由依赖文件生成目标文件的手段 tab:每条规则前必须以tab开头,使用空格不行. 例如: /** ...
Unity3D_(游戏)贪吃蛇
Unity制作贪吃蛇小游戏玩家通过“WASD”控制小蛇上下左右移动,蛇头撞倒食物,则食物被吃掉,蛇身体长一节,接着又出现食物,等待蛇来吃,如果蛇在移动中撞到墙或身体交叉蛇头撞倒自己身体游戏结束可通 ...
C++入门经典-例5.5-空类型指针的使用
1:代码如下: // 5.5.cpp : 定义控制台应用程序的入口点. // #include "stdafx.h" #include <iostream> using ...
C++入门经典-例3.7-用条件运算符判断数的奇偶性
1:条件运算符是一个三目运算符,能像判断语句一样完成判断.例如: max=(iA>iB) ? iA:iB; 意思是先判断iA是否大于iB,如果是,则max取iA的值,如果不是则取iB的值. 如果 ...
WebSocket 结合 Nginx 实现域名及 WSS 协议访问-Nginx配置
特别提示:本人博客部分有参考网络其他博客,但均是本人亲手编写过并验证通过.如发现博客有错误,请及时提出以免误导其他人,谢谢!欢迎转载,但记得标明文章出处:http://www.cnblogs.com/ ...
python第一个程序：计算体脂率
主要是为了提醒自己要——保重 height = input('请输入身高(m):') weight = input('请输入体重(KG):') age = input('请输入年龄:') sex = ...
Docker非常详细的讲解
CSDN大牛写的,推荐 http://blog.csdn.net/tangtong1/article/details/53556129 阿里云docker镜像地址: https://dev.aliyu ...
浏览器端-W3School-HTML：HTML DOM Anchor 对象
ylbtech-浏览器端-W3School-HTML:HTML DOM Anchor 对象 1.返回顶部 1. HTML DOM Anchor 对象 Anchor 对象 Anchor 对象表示 HTM ...

python3爬取动态网站图片

python3爬取动态网站图片的更多相关文章

随机推荐

热门专题