App的数据如何用python抓取

前言

文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。

App中的数据可以用网络爬虫抓取么

答案是完全肯定的：凡是可以看到的APP数据都可以抓取。

下面我就介绍下自己的学习经验和一些方法吧本篇适合有过web爬虫基础的程序猿看

没有的的话学的可能会吃力一些

App接口爬取数据过程

使用抓包工具
手机使用代理，app所有请求通过抓包工具
获得接口，分析接口
反编译apk获取key
突破反爬限制

需要的工具：

夜神模拟器
Fiddler
Pycharm

实现过程

首先下载夜神模拟器模拟手机也可以用真机，然后下载Fiddler抓取手机APP数据包，分析接口完成以后使用Python实现爬虫程序

Fiddler安装配置过程

第一步：下载神器Fiddler

Fiddler下载完成之后，傻瓜式的安装一下！

第二步：设置Fiddler

打开Fiddler, Tools-> Fiddler Options (配置完后记得要重启Fiddler)

选中"Decrpt HTTPS traffic", Fiddler就可以截获HTTPS请求

选中"Allow remote computers to connect". 是允许别的机器把HTTP/HTTPS请求发送到Fiddler上来

记住这个端口号是:8888

夜神模拟器安装配置过程

第一步:下载安装

夜神模拟器下载完成之后，傻瓜式的安装一下！

第二步:配置桥接实现互通

首先将当前手机网络桥接到本电脑网络实现互通

安装完成桥接驱动后配置IP地址，要配成和本机互通的网段，配置完成后打开主机cmd终端ping通ok

第三步:配置代理

打开主机cmd

2、输入ipconfig查看本机IP

3、配置代理

进入夜神模拟器–打开设置–打开WLAN

点击修改网络–配置代理如下图：

配置完后保存

到这里我们就设置好所有的值，下面就来测试一下，打开手机的超级课程表APP

4、在夜神模拟器上下载你想爬取得App使用Fiddler抓包分析api后使用python进行爬取就可以了

爬取充电网APP实例

爬取部分内容截图：

部分python代码分享：

import requests

import city

import json

import jsonpath

import re

city_list = city.jsons

tags_list = city.Tag

def city_func(city_id):

    try:

        city = jsonpath.jsonpath(city_list, '$..sub[?(@.code=={})]'.format(int(city_id)))[0]["name"]

    except:

        city = jsonpath.jsonpath(city_list, '$[?(@.code=={})]'.format(int(city_id)))[0]["name"]

    return city

def tags_func(tags_id):

    tags_join = []

    if tags_id:

        for tags in tags_id:

            t = jsonpath.jsonpath(tags_list,'$..spotFilterTags[?(@.id=={})]'.format(int(tags)))

            tags_join.append(t[0]["title"])

    return ('-'.join(tags_join))

def split_n(ags):

    return re.sub('\n','  ',ags)

def request(page):

    print('开始下载第%d页'%page)

    url = 'https://app-api.chargerlink.com/spot/searchSpot'

    two_url = "https://app-api.chargerlink.com/spot/getSpotDetail?spotId={d}"

    head = {

        "device": "client=android&cityName=%E5%8C%97%E4%BA%AC%E5%B8%82&cityCode=110106&lng=116.32154281224254&device_id=8A261C9D60ACEBDED7CD3706C92DD68E&ver=3.7.7&lat=39.895024107858724&network=WIFI&os_version=19",

        "appId": "20171010",

        "timestamp": "1532342711477",

        "signature": "36daaa33e7b0d5d29ac9c64a2ce6c4cf",

        "forcecheck": "1",

        "Content-Type": "application/x-www-form-urlencoded",

        "Content-Length": "68",

        "Host": "app-api.chargerlink.com",

        "Connection": "Keep-Alive",

        "User-Agent": "okhttp/3.2.0"

    }

    data = {

        "userFilter[operateType]": 2,

        "cityCode": 110000,

        "sort": 1,

        "page": page,

        "limit": 10,

    }

    response = requests.post(url,data=data,headers=head)

    #获取数据

    data = response.json()

    for i in data['data']:

        c = []

        id = i['id']

        name = i["name"] #充电桩名

        phone = i["phone"] #手机号

        num = i['quantity'] #有几个充电桩

        city = city_func(i["provinceCode"]) #城市

        tags =tags_func(i["tags"].split(','))#标签

        message = c + [id,name,phone,num,city,tags]

        parse_info(two_url.format(d=id),message)

def parse_info(url,message):

    #打开文件

    with open('car.csv','a',encoding='utf-8')as c:

        head = {

            "device": "client=android&cityName=&cityCode=&lng=116.32154281224254&device_id=8A261C9D60ACEBDED7CD3706C92DD68E&ver=3.7.7&lat=39.895024107858724&network=WIFI&os_version=19",

            "TOKEN": "036c8e24266c9089db50899287a99e65dc3bf95f",

            "appId": "20171010",

            "timestamp": "1532357165598",

            "signature": "734ecec249f86193d6e54449ec5e8ff6",

            "forcecheck": "1",

            "Host": "app-api.chargerlink.com",

            "Connection": "Keep-Alive",

            "User-Agent": "okhttp/3.2.0",

        }

        #发起详情请求

        res = requests.get(url,headers=head)

        price = split_n(jsonpath.jsonpath(json.loads(res.text),'$..chargingFeeDesc')[0]) #价钱

        payType = jsonpath.jsonpath(json.loads(res.text),'$..payTypeDesc')[0] #支付方式

        businessTime =split_n(jsonpath.jsonpath(json.loads(res.text),'$..businessTime')[0]) #营业时间

        result = (message + [price,payType,businessTime])

        r = ','.join([str(i) for i in result])+',\n'

        c.write(r)

def get_page():

    url = 'https://app-api.chargerlink.com/spot/searchSpot'

    head = {

        "device": "client=android&cityName=%E5%8C%97%E4%BA%AC%E5%B8%82&cityCode=110106&lng=116.32154281224254&device_id=8A261C9D60ACEBDED7CD3706C92DD68E&ver=3.7.7&lat=39.895024107858724&network=WIFI&os_version=19",

        "appId": "20171010",

        "timestamp": "1532342711477",

        "signature": "36daaa33e7b0d5d29ac9c64a2ce6c4cf",

        "forcecheck": "1",

        "Content-Type": "application/x-www-form-urlencoded",

        "Content-Length": "68",

        "Host": "app-api.chargerlink.com",

        "Connection": "Keep-Alive",

        "User-Agent": "okhttp/3.2.0"

    }

    data = {

        "userFilter[operateType]": 2,

        "cityCode": 110000,

        "sort": 1,

        "page": 1,

        "limit": 10,

    }

    response = requests.post(url, data=data, headers=head)

    # 获取数据

    data = response.json()

    total = (data["pager"]["total"])

    page_Size = (data["pager"]["pageSize"])

    totalPage = (data['pager']["totalPage"])

    print('当前共有{total}个充电桩，每页展示{page_Size}个，共{totalPage}页'.format(total=total,page_Size=page_Size,totalPage=totalPage))

if __name__ == '__main__':

    get_page()

    start = int(input("亲,请输入您要获取的开始页:"))

    end = int(input("亲,请输入您要获取的结束页:"))

    for  i in range(start,end+1):

        request(i)

作者：NicePython

PS：如有需要Python学习资料的小伙伴可以加点击下方链接自行获取http://t.cn/A6Zvjdun

2020年最新Python教程：

如果你处于想学Python或者正在学习Python，Python的教程不少了吧，但是是最新的吗？

说不定你学了可能是两年前人家就学过的内容，在这小编分享一波2020最新的Python教程。

以上这些教程小编已经为大家打包准备好了，希望对正在学习的你有所帮助！

App的数据如何用python抓取的更多相关文章

如何用python抓取js生成的数据 - SegmentFault
如何用python抓取js生成的数据 - SegmentFault 如何用python抓取js生成的数据 1赞踩收藏想写一个爬虫,但是需要抓去的的数据是js生成的,在源代码里看不到,要怎么才能抓 ...
（转）如何用python抓取网页并提取数据
最近一直在学这部分,今日发现一篇好文,虽然不详细,但是轮廓是出来了: 来自crifan:http://www.crifan.com/crawl_website_html_and_extract_inf ...
使用 Python 抓取欧洲足球联赛数据
Web Scraping在大数据时代,一切都要用数据来说话,大数据处理的过程一般需要经过以下的几个步骤数据的采集和获取数据的清洗,抽取,变形和装载数据的分析,探索和预测 ...
关于python抓取google搜索结果的若干问题
关于python抓取google搜索结果的若干问题前一段时间一直在研究如何用python抓取搜索引擎结果,在实现的过程中遇到了很多的问题,我把我遇到的问题都记录下来,希望以后遇到同样问题的童 ...
Python抓取百度百科数据
前言本文整理自慕课网<Python开发简单爬虫>,将会记录爬取百度百科"python"词条相关页面的整个过程. 抓取策略确定目标:确定抓取哪个网站的哪些页面的哪部分 ...
使用python抓取并分析数据—链家网(requests+BeautifulSoup)（转）
本篇文章是使用python抓取数据的第一篇,使用requests+BeautifulSoup的方法对页面进行抓取和数据提取.通过使用requests库对链家网二手房列表页进行抓取,通过Beautifu ...
使用Python抓取猫眼近10万条评论并分析
<一出好戏>讲述人性,使用Python抓取猫眼近10万条评论并分析,一起揭秘“这出好戏”到底如何? 黄渤首次导演的电影<一出好戏>自8月10日在全国上映,至今已有10天,其主演 ...
python抓取网页例子
python抓取网页例子最近在学习python,刚刚完成了一个网页抓取的例子,通过python抓取全世界所有的学校以及学院的数据,并存为xml文件.数据源是人人网. 因为刚学习python,写的代码 ...
Python抓取页面中超链接(URL)的三中方法比较(HTMLParser、pyquery、正则表达式) <转>
Python抓取页面中超链接(URL)的3中方法比较(HTMLParser.pyquery.正则表达式) HTMLParser版: #!/usr/bin/python # -*- coding: UT ...

随机推荐

Python异常处理，将异常写入到一个文件
'''定义一个函数func(urllist) urllist:为URL的列表,例如:['http://xx.com','http://www.xx.com','http://www.xxx.com'. ...
10行Python代码计算汽车数量
当你还是个孩子坐车旅行的时候,你玩过数经过的汽车的数目的游戏吗? 在这篇文章中,我将教你如何使用10行Python代码构建自己的汽车计数程序. 以下是环境及相应的版本库: Python版本 3.6.9 ...
十个python图像处理工具
介绍如今的世界存在了大量的数据,图像数据是重要的组成部分.如果要利用这些图片,需要对图像进行处理,提高图片质量或提取图片内容信息. 图像处理的常见操作包括图像显示,基本操作如裁剪,翻转,旋转等,图像 ...
spring-cloud-gateway静态路由
为什么引入 API 网关使用 API 网关后的优点如下: 易于监控.可以在网关收集监控数据并将其推送到外部系统进行分析. 易于认证.可以在网关上进行认证,然后再将请求转发到后端的微服务,而无须在每个 ...
Springcloud 整合Hystrix 断路器，支持Feign客户端调用
1,在这篇博文中,已经大致说过了Springcloud服务保护框架 Hystrix在服务隔离,服务降级,以及服务熔断中的使用 https://www.cnblogs.com/pickKnow/p/11 ...
Innodb的三大关健特性
今天看<MySql技术内幕InnoDB存储引擎>一书,学习了Mysql的三大关健特性,并记录如下: 插入缓冲双写(double write) 自适应Hash索引在记录这些特性之前,先对 ...
记一次JAVA进程导致Kubernetes节点CPU飙高的排查与解决
一.发现问题在一次系统上线后,我们发现某几个节点在长时间运行后会出现CPU持续飙升的问题,导致的结果就是Kubernetes集群的这个节点会把所在的Pod进行驱逐(调度):如果调度到同样问题的节点上 ...
《快速认识 Three.js 》
此文仅作备份之用,为了更好的阅读体验,建议访问原文链接:<Three.js - 走进3D的奇妙世界.> ,感谢原作者的好文.
Pyhton基本图形绘制
目前学习Python中,记录一些内容~ 以下为部分练习内容 1.Python蟒蛇绘制 1 #PythonDraw.py 2 import turtle as t #t作为turtle的别名:另一种方法 ...
感动，我终于学会了Java对数组求和
前言看到题目是不是有点疑问:你确定你没搞错?!数组求和???遍历一遍累加起来不就可以了吗??? 是的,你说的都对,都听你的,但是我说的就是数组求和,并且我也确实是刚刚学会.╮(╯▽╰)╭ 继续看下去 ...

App的数据如何用python抓取

App的数据如何用python抓取的更多相关文章

随机推荐

热门专题