Python 爬取陈都灵百度图片

标签（空格分隔）：随笔

今天意外发现了自己以前写的一篇爬虫脚本，爬取的是我的女神陈都灵，尝试运行了一下发现居然还能用。故把脚本贴出来分享一下。

import requests

import os

import json

#import random

#firsturl='https://image.baidu.com/search/acjson?'

#header={'User-Agent':'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

def get_chenduling(le):

    header = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

    url = 'https://image.baidu.com/search/acjson?'

    data={'tn':'resultjson_com',

    'ipn':'rj',

    'ct':'201326592',

    'is':'',

    'fp':'result',

    'queryWord':'陈都灵',

    'cl':'2',

    'lm':'-1',

    'ie':'utf-8',

    'oe':'utf-8',

    'adpicid':'',

    'st':'',

    'z':'',

    'ic':'',

    'word':'陈都灵',

    's':'',

    'se':'',

    'tab':'',

    'width':'',

    'height':'',

    'face':'',

    'istype':'',

    'qc':'',

    'nc':'',

    'fr':'',

    'cg':'star',

    'pn':'30',

    'rn':'30',

    'gsm':le,

    }

    response=requests.get(url,params=data,headers=header)

    #print(response.text[:3000])

    chen=json.loads(response.text)

   #

    if chen and 'data' in chen:

        for item in chen.get('data'):

            newurl=item.get('middleURL')

            #print(newurl)

            if newurl:

                dd=savechen(newurl,header)

                resave(newurl,dd)

    nextle=chen.get('gsm')

    #print(nextle)

    get_chenduling(nextle)

def savechen(item,header):

    try:

        dudu=requests.get(item,headers=header)

        dudu.raise_for_status()

        #fpath='{0}.{1}.{2}'.format('d:\chenduling\\',item.split('.')[-2],'jpg')

        return dudu.content

    except:

        print('有毛病。。。。')

def resave(item,html):

    fpath = '{0}.{1}'.format('d:\chenduling', item.split(',')[-1])

    if not os.path.exists(fpath):

        with open (fpath,'wb') as ff:

            print('downloading.....{0}'.format(item))

            ff.write(html)

def main():

    le='le'

    #firsturl = 'https://image.baidu.com/search/acjson?'

    #header = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

    get_chenduling(le)

if __name__ =='__main__':

    main()

运行了一下，一点问题都没有，图片都存放到D盘了，拓展到其他图片估计也没问题，至于le这个参数干嘛的，我也记不清了。隐约记得有一个请求头部包含一串数字，但是这串数字并没有卵用。

Python 爬取陈都灵百度图片的更多相关文章

python爬取某个网页的图片-如百度贴吧
python爬取某个网页的图片-如百度贴吧作者:vpoet mail:vpoet_sir@163.com 注:随意copy,不用告诉我 #coding:utf-8 import urllib imp ...
python爬取某个网站的图片并保存到本地
python爬取某个网站的图片并保存到本地 #coding:utf- import urllib import re import sys reload(sys) sys.setdefaultenco ...
Python爬取 | 唯美女生图片
这里只是代码展示,且复制后不能直接运行,需要配置一些设置才行,具体请查看下方链接介绍: Python爬取 | 唯美女生图片 from selenium import webdriver from fa ...
【Python网络爬虫四】通过关键字爬取多张百度图片的图片
最近看了女神的新剧<逃避虽然可耻但有用>,同样男主也是一名程序员,所以很有共鸣被大只萝莉萌的一脸一脸的,我们来爬一爬女神的皂片. 百度搜索结果:新恒结衣本文主要分为4个部分: 1.下载 ...
python爬取网页文本、图片
从网页爬取文本信息: eg:从http://computer.swu.edu.cn/s/computer/kxyj2xsky/中爬取讲座信息(讲座时间和讲座名称) 注:如果要爬取的内容是多页的话,网址 ...
python: 爬取[博海拾贝]图片脚本
练手代码,聊作备忘: # encoding: utf-8 # from __future__ import unicode_literals import urllib import urllib2 ...
python 爬取全量百度POI
在网上找了很多关于爬取百度POI的文章,但是对“全量”的做法并没有得到最终的解决方案,自己写了一个,但还是不能实现全量POI抓取,能够达到至少50%的信息抓取.注意:这里所指“全量”是能够达到100% ...
Python爬取mn52网站美女图片以及图片防盗链的解决方法
防盗链原理 http标准协议中有专门的字段记录referer 一来可以追溯上一个入站地址是什么二来对于资源文件,可以跟踪到包含显示他的网页地址是什么因此所有防盗链方法都是基于这个Referer字段 ...
python爬取并批量下载图片
import requests from lxml import etree url='http://desk.zol.com.cn/meinv/' add1='.html' urls=[] i = ...

随机推荐

S1_搭建分布式OpenStack集群_09 cinder 控制节点配置
一.创建数据库创建数据库以及用户:# mysql -uroot -p12345678MariaDB [(none)]> CREATE DATABASE cinder;MariaDB [(none ...
art-template模板引擎高级使用
一.结合express的基本使用 // npm下载express/art-template/express-art-tempalte,并且加载 var express=require('express ...
第03组 Alpha冲刺（1/4）
队名:不等式方程组组长博客作业博客团队项目进度组员一:张逸杰(组长) 过去两天完成的任务: 文字/口头描述: 制定了初步的项目计划,并开始学习一些推荐.搜索类算法 GitHub签入纪录: 暂无 ...
mysql 获取星期几，dayofweek()函数
mysql> ; +------------------------+ | dayofweek(curdate())- | +------------------------+ | | +--- ...
卷积神经网络CNN学习笔记
CNN的基本结构包括两层: 特征提取层:每个神经元的输入与前一层的局部接受域相连,并提取该局部的特征.一旦该局部特征被提取后,它与其它特征间的位置关系也随之确定下来: 特征映射层:网络的每个计算层由多 ...
vue data不可以使用箭头函数的问题解析
这篇文章主要介绍了vue data不可以使用箭头函数问题,本文通过源码解析给大家介绍的非常详细,具有一定的参考借鉴价值,需要的朋友可以参考下首先需要明确,a() {}和 b: () => {} ...
springMvc 入门二
目的:请求参数接受,输出,常见的注解(在上一篇入门1基础上) 1:请求参数的绑定 1.1绑定的机制表单中请求参数都是基于key=value的. SpringMVC绑定请求参数的过程是通过把表单提交请 ...
刷题记录：[网鼎杯]Fakebook
目录刷题记录:[网鼎杯]Fakebook 一.涉及知识点 1.敏感文件泄露 2.sql注入二.解题方法刷题记录:[网鼎杯]Fakebook 题目复现链接:https://buuoj.cn/cha ...
【软工实践】Beta冲刺（4/5）
链接部分队名:女生都队组长博客: 博客链接作业博客:博客链接小组内容恩泽(组长) 过去两天完成了哪些任务描述新增数据分析展示等功能API 服务器后端部署,API接口的beta版实现展示 ...
patch的用法【转】
什么是patch patch即补丁之意,记录文件中的不同,能够与文件进行整合,从而改变文件中的内容如何制作patch 在Linux系统中提供了diff程序,可以使用diff程序,比较文件之间的不同从 ...

Python 爬取陈都灵百度图片

Python 爬取陈都灵百度图片

Python 爬取陈都灵百度图片的更多相关文章

随机推荐

热门专题