分析ajax请求格式，模拟发送http请求，从而获取网页代码，进而分析取出需要的数据和图片。这里分析ajax请求，获取cosplay美女图片。

登陆今日头条，点击搜索，输入cosplay

下面查看浏览器F12，点击XHR，这里能截取ajax请求，由于已经请求过该页面，所以点击F5，刷新，如下图

下面我们点击name下的链接，查看headers看到请求信息

可以看到请求的url为
https://www.toutiao.com/search_content/?offset=0&format=json&keyword=cosplay&autoload=true&count=20&cur_tab=1&from=search_tab&pd=synthesis
offset为0，表示当前页面的偏移量，我试着向下滑动页面，name下加载出很多连接，offset每次递增20，keyword为cosplay，是我们搜索的关键词，count表示图集的数量，其他的都不变。
所以我们可以构造一个http请求，包含上面的格式。接下来看看preview的内容

data就是页面加载出来的图片文章列表
点击其中一个data，查看

可以看得出图片列表和large图片相差的就是list和large的区别，如
“http://p1-tt.bytecdn.cn/list/97e000601ee89d997af"为缩略图
“http://p1-tt.bytecdn.cn/large/97e000601ee89d997af"为大图
所以只需将list替换为larg即可。之后发送http请求，获取对应的图片即可。下面为完整代码

import requests

import re

import time

from pyquery import PyQuery as pq

from urllib.parse import urlencode

import os

USER_AGENT = 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.221 Safari/537.36 SE 2.X MetaSr 1.0'

COOKIES = r'UM_distinctid=167005cc741184-02d14e2fd49b05-10724c6f-1fa400-167005cc74263a; uuid="w:5a4841d5dda248c389f83e5b9c57608a"; sso_uid_tt=45b83f6c549dabd4248c611aa98222d3; toutiao_sso_user=4853db5c812f7bcb367cdcbef0967d06; sso_login_status=1; login_flag=54c7da4daac99058f7b6e4b8975cca01; sessionid=5e86f286970804ed8fd11abf0bf328e4; uid_tt=dd5e177a1cbf9746eb634307d64afd22; sid_tt=5e86f286970804ed8fd11abf0bf328e4; sid_guard="5e86f286970804ed8fd11abf0bf328e4|1541899310|15552000|Fri\054 10-May-2019 01:21:50 GMT"; tt_webid=6622406673465067021; WEATHER_CITY=%E5%8C%97%E4%BA%AC; cp=5BE7386A29798E1; tt_webid=75478811657; __tasessionId=qwly22e8r1541906736076; CNZZDATA1259612802=1520919144-1541896080-https%253A%252F%252Fwww.baidu.com%252F%7C1541901480; csrftoken=b970f054ea259eb162e572217e6756ca'

REFER = 'https://www.toutiao.com/search/?keyword=cosplay'

class AjaxScrapy(object):

    def __init__(self,pages=1):

        try:

            self.m_session = requests.Session()

            self.m_headers = {'User-Agent':USER_AGENT,

                        'referer':REFER,

                        }

            self.m_cookiejar = requests.cookies.RequestsCookieJar()

            self.dirpath = os.path.split(os.path.abspath(__file__))[0]

            for cookie in COOKIES.split(';'):

                key,value = cookie.split('=',1)

                self.m_cookiejar.set(key,value)

        except:

            print('init error!!!')

    def getOffset(self,index=0):

        try:

            params = {

                'offset':str(20*index),

                'format':'json',

                'keyword':'cosplay',

                'autoload':'true',

                'count':'',

                'cur_tab':'',

                'from':'gallery',

            }

            httpaddr = 'https://www.toutiao.com/search_content/?'+urlencode(params)

            req = self.m_session.get(httpaddr,headers=self.m_headers, cookies=self.m_cookiejar, timeout=5)

            if req.status_code != 200:

                return None

            res = req.json()

            if('data' not in res.keys()):

                return None

            for item in res.get('data'):

                if('title' not in item.keys()):

                    continue

                if('image_list' not in item.keys()):

                    continue

                titlenamelist=item['title'].split('/')

                titlename = titlenamelist[-1]

                savedir=os.path.join(self.dirpath,titlename)

                print('正在抓取'+titlename+'.........')

                if(os.path.exists(savedir) == False):

                    os.makedirs(savedir)

                imagelist = item.get('image_list')

                for imag in imagelist:

                    if 'url' not in imag.keys():

                        continue

                    #print(imag['url'])

                    image1,image2=imag['url'].split('list')

                    image3=imag['url'].split('/')[-1]

                    imagepath=os.path.join(savedir,image3+'.jpg')

                    if(os.path.exists(imagepath)):

                        continue

                    imageaddr = 'http:'+image1+'large'+image2

                    imagedata=self.m_session.get(imageaddr,timeout=5)

                    with open (imagepath,'wb')as f:

                        f.write(imagedata.content)

                print('抓取'+titlename+'成功!!!.........')

                time.sleep(1)

            return req.json()

        except:

            print('get over view error')

            return None

if __name__ == "__main__":

    try:

        asscrapy = AjaxScrapy()

        for i in range(0,5):

            res = asscrapy.getOffset(i)

            if(res == None):

                continue

            #print(type(res))

    except:

        print('scrapy exception!')

        pass

更多源码下载
https://github.com/secondtonone1/python-/tree/master/pythoncookie
个人博客
https://www.limerence2017.com
谢谢关注我的公总号:

python学习(26)分析ajax请求抓取今日头条cosplay小姐姐图片的更多相关文章

分析ajax请求抓取今日头条关键字美图
# 目标:抓取今日头条关键字美图 # 思路: # 一.分析目标站点 # 二.构造ajax请求,用requests请求到索引页的内容,正则+BeautifulSoup得到索引url # 三.对索引url ...
爬虫（八）：分析Ajax请求抓取今日头条街拍美图
(1):分析网页分析ajax的请求网址,和需要的参数.通过不断向下拉动滚动条,发现请求的参数中offset一直在变化,所以每次请求通过offset来控制新的ajax请求. (2)上代码 a.通过aj ...
Python爬虫学习==>第十一章：分析Ajax请求-抓取今日头条信息
学习目的: 解决AJAX请求的爬虫,网页解析库的学习,MongoDB的简单应用正式步骤 Step1:流程分析抓取单页内容:利用requests请求目标站点,得到单个页面的html代码,返回结果: ...
通过分析Ajax请求抓取今日头条街拍图集
代码: import os import re import json import time from hashlib import md5 from multiprocessing import ...
python爬虫之分析Ajax请求抓取抓取今日头条街拍美图（七）
python爬虫之分析Ajax请求抓取抓取今日头条街拍美图一.分析网站 1.进入浏览器,搜索今日头条,在搜索栏搜索街拍,然后选择图集这一栏. 2.按F12打开开发者工具,刷新网页,这时网页回弹到综合 ...
python3爬虫-分析Ajax，抓取今日头条街拍美图
# coding=utf-8 from urllib.parse import urlencode import requests from requests.exceptions import Re ...
python爬虫---实现项目(二) 分析Ajax请求抓取数据
这次我们来继续深入爬虫数据,有些网页通过请求的html代码不能直接拿到数据,我们所需的数据是通过ajax渲染到页面上去的,这次我们来看看如何分析ajax 我们这次所使用的网络库还是上一节的Reques ...
分析Ajax来爬取今日头条街拍美图并保存到MongDB
前提:.需要安装MongDB 注:因今日投票网页发生变更,如下代码不保证能正常使用 #!/usr/bin/env python #-*- coding: utf-8 -*- import json i ...
15-分析Ajax请求并抓取今日头条街拍美图
流程框架: 抓取索引页内容:利用requests请求目标站点,得到索引网页HTML代码,返回结果. 抓取详情页内容:解析返回结果,得到详情页的链接,并进一步抓取详情页的信息. 下载图片与保存数据库:将 ...

随机推荐

5、JVM的监控与分析工具
一.JPS(虚拟机进程监控工具) 二.jstat:虚拟机统计信息监视工具例子:jstat -gcutil 16478 s0:区域占比2.33%: s1占比0.00%: E:伊甸园区 : O:老年区: ...
[清华集训2015 Day2]矩阵变换-[稳定婚姻模型]
Description 给出一个N行M列的矩阵,保证满足以下性质: M>N. 矩阵中每个数都是 [0,N]中的自然数. 每行中, [1,N]中每个自然数刚好出现一次,其余的都是0. 每列中,[1 ...
一段程序的分析——C++析构器，何时析构
最近在看小甲鱼的视频,有段程序是这么写的: #include <iostream> #include <string> class Pet { public: Pet(std: ...
EJB开发第一期---EJB开发配置
一.EJB 3.0简介 1.1 什么是EJB Enterprise JavaBeans是一个用于分布式业务应用的标准服务端组件模型.采用Enterprise JavaBeans架构编写的应用是可伸缩的 ...
记一次 java 连接 linux ssh服务权限验证失败的原因和解决过程
下面的问题我是通过之前的ssh测试类找出原因的,因为我的测试类跑通了,但是程序跑不通,看了一下源码发现还有一处没有进行解密,所以才会权限验证失败. // 出现权限验证失败的原因就在这里,因为老板要求对 ...
用C语言操作MySQL数据库，进行连接、插入、修改、删除等操作
C/C++ code ? 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 3 ...
使用C#创建WCF服务控制台应用程序
本文属于原创,转载请注明出处,谢谢! 一.开发环境操作系统:Windows 10 开发环境:VS2015 编程语言:C# IIS版本:10.0.0.0 二.添加WCF服务.Internet Info ...
effective c++ 笔记 (35-40)
//---------------------------15/04/24---------------------------- //#35 考虑virtual函数以外的其他选择 { /* 1: ...
Js_封装JQ库为插件
//在jQuery匿名函数中,采用jQuery.extend();方法创建jQuery插件 //在jQuery匿名函数中, 采用对象.属性 = 函数的方式创建jQuery插件 (function ($ ...
利用Python实现App自动签到领取积分
要自动签到,最简单的是打开页面分析请求,然后我们用脚本实现请求的自动化.但是发现食行没有页面,只有 APP,这不是一个好消息,这意味着需要抓包处理了. 有需要Python学习资料的小伙伴吗?小编整理[ ...

python学习(26)分析ajax请求抓取今日头条cosplay小姐姐图片

登陆今日头条，点击搜索，输入cosplay

python学习(26)分析ajax请求抓取今日头条cosplay小姐姐图片的更多相关文章

随机推荐

热门专题