前言

喜马拉雅是专业的音频分享平台，汇集了有声小说,有声读物,有声书,FM电台,儿童睡前故事,相声小品,鬼故事等数亿条音频，我最喜欢听民间故事和德云社相声集，你呢？

今天带大家爬取喜马拉雅音频数据，一起期待吧！！

这个案例的视频地址在这里

https://v.douyu.com/show/a2JEMJj3e3mMNxml

项目目标

爬取喜马拉雅音频数据

受害者地址

https://www.ximalaya.com/

本文知识点：

1、系统分析网页性质
2、多层数据解析
3、海量音频数据保存

环境：

python 3.6
pycharm
requests
parsel

思路：(爬虫案例)

1.确定数据所在的链接地址(url)
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)

案例思路：

1. 在静态数据中获取音频的id值
2. 发送指定id值json数据请求(src)
3. 从json数据中解析音频所对应的URL地址

开始写代码

先导入所需的模块

import requests

import parsel  # 数据解析模块

import re

1.确定数据所在的链接地址(url) 逆向分析网页性质(静态网页/动态网页)

打开开发者工具，播放一个音频，在Madie里面可以找到一个数据包

复制URL，搜索

找到ID值

继续搜索，找到请求头参数

url = 'https://www.ximalaya.com/youshengshu/4256765/p{}/'.format(page)

headers = {

    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'}

2.通过代码发送url地址的请求

response = requests.get(url=url, headers=headers)

html_data = response.text

3.解析数据(要的, 筛选不要的) 解析音频的 id值

selector = parsel.Selector(html_data)

lis = selector.xpath('//div[@class="sound-list _is"]/ul/li')

for li in lis:

    try:

        title = li.xpath('.//a/@title').get() + '.m4a'

        href = li.xpath('.//a/@href').get()

        # print(title, href)

        m4a_id = href.split('/')[-1]

        # print(href, m4a_id)

        # 发送指定id值json数据请求(src)

        json_url = 'https://www.ximalaya.com/revision/play/v1/audio?id={}&ptype=1'.format(m4a_id)

        json_data = requests.get(url=json_url, headers=headers).json()

        # print(json_data)

        # 提取音频地址

        m4a_url = json_data['data']['src']

        # print(m4a_url)

        # 请求音频数据

        m4a_data = requests.get(url=m4a_url, headers=headers).content

        new_title = change_title(title)

4.数据持久化(保存)

with open('video\\' + new_title, mode='wb') as f:

    f.write(m4a_data)

    print('保存完成:', title)

最后还要处理文件名非法字符

def change_title(title):

    pattern = re.compile(r"[\/\\\:\*\?\"\<\>\|]")  # '/ \ : * ? " < > |'

    new_title = re.sub(pattern, "_", title)  # 替换为下划线

    return new_title

完整代码

import re

import requests

import parsel  # 数据解析模块

def change_title(title):

    """处理文件名非法字符的方法"""

    pattern = re.compile(r"[\/\\\:\*\?\"\<\>\|]")  # '/ \ : * ? " < > |'

    new_title = re.sub(pattern, "_", title)  # 替换为下划线

    return new_title

for page in range(13, 33):

    print('---------------正在爬取第{}页的数据----------------'.format(page))

    # 1.确定数据所在的链接地址(url)  逆向分析  网页性质(静态网页/动态网页)

    url = 'https://www.ximalaya.com/youshengshu/4256765/p{}/'.format(page)

    headers = {

        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'}

    # 2.通过代码发送url地址的请求

    response = requests.get(url=url, headers=headers)

    html_data = response.text

    # print(html_data)

    # 3.解析数据(要的, 筛选不要的)  解析音频的  id值

    selector = parsel.Selector(html_data)

    lis = selector.xpath('//div[@class="sound-list _is"]/ul/li')

    for li in lis:

        try:

            title = li.xpath('.//a/@title').get() + '.m4a'

            href = li.xpath('.//a/@href').get()

            # print(title, href)

            m4a_id = href.split('/')[-1]

            # print(href, m4a_id)

            # 发送指定id值json数据请求(src)

            json_url = 'https://www.ximalaya.com/revision/play/v1/audio?id={}&ptype=1'.format(m4a_id)

            json_data = requests.get(url=json_url, headers=headers).json()

            # print(json_data)

            # 提取音频地址

            m4a_url = json_data['data']['src']

            # print(m4a_url)

            # 请求音频数据

            m4a_data = requests.get(url=m4a_url, headers=headers).content

            new_title = change_title(title)

            # print(new_title)

            # 4.数据持久化(保存)

            with open('video\\' + new_title, mode='wb') as f:

                f.write(m4a_data)

                print('保存完成:', title)

        except:

            pass

运行代码，效果如下图

Python爬虫实战案例：取喜马拉雅音频数据详解的更多相关文章

Python爬虫：爬取喜马拉雅音频数据详解
前言喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,FM电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢? 今天带大家爬取喜马拉雅音频数据,一 ...
Python爬虫之爬取淘女郎照片示例详解
这篇文章主要介绍了Python爬虫之爬取淘女郎照片示例详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧本篇目标抓取淘宝MM ...
python爬虫实战---爬取大众点评评论
python爬虫实战—爬取大众点评评论(加密字体) 1.首先打开一个店铺找到评论很多人学习python,不知道从何学起.很多人学习python,掌握了基本语法过后,不知道在哪里寻找案例上手.很多已经 ...
Python爬虫实战---抓取图书馆借阅信息
Python爬虫实战---抓取图书馆借阅信息原创作品,引用请表明出处:Python爬虫实战---抓取图书馆借阅信息前段时间在图书馆借了很多书,借得多了就容易忘记每本书的应还日期,老是担心自己会违约 ...
python爬虫25 | 爬取下来的数据怎么保存？ CSV 了解一下
大家好我是小帅b 是一个练习时长两年半的练习生喜欢唱! 跳! rap! 篮球! 敲代码! 装逼! 不好意思我又走错片场了接下来的几篇文章小帅b将告诉你如何将你爬取到的数据保存下来有文本 ...
Python爬虫之抓取豆瓣影评数据
脚本功能: 1.访问豆瓣最受欢迎影评页面(http://movie.douban.com/review/best/?start=0),抓取所有影评数据中的标题.作者.影片以及影评信息 2.将抓取的信息 ...
Python爬虫实战案例：爬取爱奇艺VIP视频
一.实战背景爱奇艺的VIP视频只有会员能看,普通用户只能看前6分钟.比如加勒比海盗5的URL:http://www.iqiyi.com/v_19rr7qhfg0.html#vfrm=19-9-0-1 ...
Python爬虫学习==>第八章：Requests库详解
学习目的: request库比urllib库使用更加简洁,且更方便. 正式步骤 Step1:什么是requests requests是用Python语言编写,基于urllib,采用Apache2 Li ...
Python爬虫入门：Urllib parse库使用详解(二)
文字转载:https://www.jianshu.com/p/e4a9e64082ef,转载内容仅供学习如有侵权,请联系删除获取url参数 urlparse 和 parse_qs ParseRes ...

随机推荐

NOIP 2013 P1967 货车运输
倍增求LCA+最大生成树题目给出的是一张图,在图上有很多算法无法实现,所以要将其转化为树题中可以发现货车的最后的载重量是由权值最小的一条边决定的,所以我们求最大生成树求完最大生成树后我们得到一个 ...
为研发同学定制的MySQL面试指南 - “能谈谈基数统计吗？”
** 目录推荐阅读原文链接一.基数是啥? 二.InnoDB更新基数的时机? 三.基数是估算出来四.持久化基数四.如何主动更新基数? 欢迎关注 Hi,大家好!我是白日梦. 今天我要跟你分享的话题 ...
Thinkphp3.2 cms之权限管理
五.权限管理 <?php namespace Admin\Controller; use Think\Controller; class CommonController extends Con ...
[C#.NET 拾遗补漏]12：死锁和活锁的发生及避免
多线程编程时,如果涉及同时读写共享数据,就要格外小心.如果共享数据是独占资源,则要对共享数据的读写进行排它访问,最简单的方式就是加锁.锁也不能随便用,否则可能会造成死锁和活锁.本文将通过示例详细讲解死 ...
Spring Security验证，提示正确的信息
关于Spring Security的使用,之前也整理过一些笔记,但是在提示信息的时候,总感觉还缺点什么?不管是不是前后端分离,我们都希望在登录验证出现错误的时候,能够提示友好的中文信息. 在前后端不分 ...
MySQL全面瓦解10：分组查询和聚合函数
概述相信我们经常会遇到这样的场景:想要了解双十一天猫购买化妆品的人员中平均消费额度是多少(这可能有利于对商品价格区间的定位):或者不同年龄段的化妆品消费占比是多少(这可能有助于对商品备货量的预估). ...
intelx86为何从0xFFFF0处执行
第一条指令的地址在用户按下计算机电源开关之后,CPU会自动的将其CS寄存器设定为0xFFFF,将其IP寄存器设定为0x0000.由于CS:IP指出了下一条指令的地址[1],因此CPU会跳到0xFFF ...
如何实现Http请求报头的自动转发[应用篇]
如今的应用部署逐渐向微服务化发展,导致一个完整的事务往往会跨越很多的应用或服务,出于分布式链路跟踪的需要,我们往往将从上游服务获得的跟踪请求报头无脑地向下游服务进行转发.本文介绍的这个名为Header ...
sklearn.neighbors.NNeighborsClassifier 详细说明
平时会用到sklearn.neighbors.NNeighborsClassifier函数来构建K最邻近分类器,所以这里对NNeighborsClassifier中的参数进行说明,文中参考的是scik ...
MFC常用函数
1.MFC的常用函数(只是找了些经常使用的,这里没有的可以CSDN查找,不需要都记住,经常使用自动就会记得) 1)GetDlgItemText(ID ,str)作用: 对话框中获取文本第一个参数为要获 ...

Python爬虫实战案例：取喜马拉雅音频数据详解