前言

喜马拉雅是专业的音频分享平台，汇集了有声小说,有声读物,有声书,FM电台,儿童睡前故事,相声小品,鬼故事等数亿条音频，我最喜欢听民间故事和德云社相声集，你呢？

今天带大家爬取喜马拉雅音频数据，一起期待吧！！

这个案例的视频地址在这里

https://v.douyu.com/show/a2JEMJj3e3mMNxml

项目目标

爬取喜马拉雅音频数据

受害者地址

https://www.ximalaya.com/

本文知识点：

1、系统分析网页性质
2、多层数据解析
3、海量音频数据保存

环境：

python 3.6
pycharm
requests
parsel

思路：(爬虫案例)

1.确定数据所在的链接地址(url)
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)

案例思路：

1. 在静态数据中获取音频的id值
2. 发送指定id值json数据请求(src)
3. 从json数据中解析音频所对应的URL地址

开始写代码

先导入所需的模块

import requests

import parsel  # 数据解析模块

import re

1.确定数据所在的链接地址(url) 逆向分析网页性质(静态网页/动态网页)

打开开发者工具，播放一个音频，在Madie里面可以找到一个数据包

复制URL，搜索

找到ID值

继续搜索，找到请求头参数

url = 'https://www.ximalaya.com/youshengshu/4256765/p{}/'.format(page)

headers = {

    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'}

2.通过代码发送url地址的请求

response = requests.get(url=url, headers=headers)

html_data = response.text

3.解析数据(要的, 筛选不要的) 解析音频的 id值

selector = parsel.Selector(html_data)

lis = selector.xpath('//div[@class="sound-list _is"]/ul/li')

for li in lis:

    try:

        title = li.xpath('.//a/@title').get() + '.m4a'

        href = li.xpath('.//a/@href').get()

        # print(title, href)

        m4a_id = href.split('/')[-1]

        # print(href, m4a_id)

        # 发送指定id值json数据请求(src)

        json_url = 'https://www.ximalaya.com/revision/play/v1/audio?id={}&ptype=1'.format(m4a_id)

        json_data = requests.get(url=json_url, headers=headers).json()

        # print(json_data)

        # 提取音频地址

        m4a_url = json_data['data']['src']

        # print(m4a_url)

        # 请求音频数据

        m4a_data = requests.get(url=m4a_url, headers=headers).content

        new_title = change_title(title)

4.数据持久化(保存)

with open('video\\' + new_title, mode='wb') as f:

    f.write(m4a_data)

    print('保存完成:', title)

最后还要处理文件名非法字符

def change_title(title):

    pattern = re.compile(r"[\/\\\:\*\?\"\<\>\|]")  # '/ \ : * ? " < > |'

    new_title = re.sub(pattern, "_", title)  # 替换为下划线

    return new_title

完整代码

import re

import requests

import parsel  # 数据解析模块

def change_title(title):

    """处理文件名非法字符的方法"""

    pattern = re.compile(r"[\/\\\:\*\?\"\<\>\|]")  # '/ \ : * ? " < > |'

    new_title = re.sub(pattern, "_", title)  # 替换为下划线

    return new_title

for page in range(13, 33):

    print('---------------正在爬取第{}页的数据----------------'.format(page))

    # 1.确定数据所在的链接地址(url)  逆向分析  网页性质(静态网页/动态网页)

    url = 'https://www.ximalaya.com/youshengshu/4256765/p{}/'.format(page)

    headers = {

        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36'}

    # 2.通过代码发送url地址的请求

    response = requests.get(url=url, headers=headers)

    html_data = response.text

    # print(html_data)

    # 3.解析数据(要的, 筛选不要的)  解析音频的  id值

    selector = parsel.Selector(html_data)

    lis = selector.xpath('//div[@class="sound-list _is"]/ul/li')

    for li in lis:

        try:

            title = li.xpath('.//a/@title').get() + '.m4a'

            href = li.xpath('.//a/@href').get()

            # print(title, href)

            m4a_id = href.split('/')[-1]

            # print(href, m4a_id)

            # 发送指定id值json数据请求(src)

            json_url = 'https://www.ximalaya.com/revision/play/v1/audio?id={}&ptype=1'.format(m4a_id)

            json_data = requests.get(url=json_url, headers=headers).json()

            # print(json_data)

            # 提取音频地址

            m4a_url = json_data['data']['src']

            # print(m4a_url)

            # 请求音频数据

            m4a_data = requests.get(url=m4a_url, headers=headers).content

            new_title = change_title(title)

            # print(new_title)

            # 4.数据持久化(保存)

            with open('video\\' + new_title, mode='wb') as f:

                f.write(m4a_data)

                print('保存完成:', title)

        except:

            pass

运行代码，效果如下图

Python爬虫实战案例：取喜马拉雅音频数据详解的更多相关文章

Python爬虫：爬取喜马拉雅音频数据详解
前言喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,FM电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢? 今天带大家爬取喜马拉雅音频数据,一 ...
Python爬虫之爬取淘女郎照片示例详解
这篇文章主要介绍了Python爬虫之爬取淘女郎照片示例详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧本篇目标抓取淘宝MM ...
python爬虫实战---爬取大众点评评论
python爬虫实战—爬取大众点评评论(加密字体) 1.首先打开一个店铺找到评论很多人学习python,不知道从何学起.很多人学习python,掌握了基本语法过后,不知道在哪里寻找案例上手.很多已经 ...
Python爬虫实战---抓取图书馆借阅信息
Python爬虫实战---抓取图书馆借阅信息原创作品,引用请表明出处:Python爬虫实战---抓取图书馆借阅信息前段时间在图书馆借了很多书,借得多了就容易忘记每本书的应还日期,老是担心自己会违约 ...
python爬虫25 | 爬取下来的数据怎么保存？ CSV 了解一下
大家好我是小帅b 是一个练习时长两年半的练习生喜欢唱! 跳! rap! 篮球! 敲代码! 装逼! 不好意思我又走错片场了接下来的几篇文章小帅b将告诉你如何将你爬取到的数据保存下来有文本 ...
Python爬虫之抓取豆瓣影评数据
脚本功能: 1.访问豆瓣最受欢迎影评页面(http://movie.douban.com/review/best/?start=0),抓取所有影评数据中的标题.作者.影片以及影评信息 2.将抓取的信息 ...
Python爬虫实战案例：爬取爱奇艺VIP视频
一.实战背景爱奇艺的VIP视频只有会员能看,普通用户只能看前6分钟.比如加勒比海盗5的URL:http://www.iqiyi.com/v_19rr7qhfg0.html#vfrm=19-9-0-1 ...
Python爬虫学习==>第八章：Requests库详解
学习目的: request库比urllib库使用更加简洁,且更方便. 正式步骤 Step1:什么是requests requests是用Python语言编写,基于urllib,采用Apache2 Li ...
Python爬虫入门：Urllib parse库使用详解(二)
文字转载:https://www.jianshu.com/p/e4a9e64082ef,转载内容仅供学习如有侵权,请联系删除获取url参数 urlparse 和 parse_qs ParseRes ...

随机推荐

1、Web应用
一 Web应用的组成接下来我们学习的目的是为了开发一个Web应用程序,而Web应用程序是基于B/S架构的,其中B指的是浏览器,负责向S端发送请求信息,而S端会根据接收到的请求信息返回相应的数据给浏览 ...
两个SQL查询，横向合并为一个查询结果
第一条sql: select unit,count(*)as number from archives_management group by unit 第二条sql: select fine_uni ...
浮动布局问题多，还是用inline-block吧
说说知识陈旧的问题. 目前我的前端开发知识积累最大的问题就是版本问题,也许我已经经历了很多,尝试了很多, 但是有些知识的版本已经过时了,而我还没有来得及更新它们.更悲剧的可能是有些部分我还没有意识到. ...
在Linux下安装C++的OpenCV 3
最近在看<学习OpenCV3>这本书,所以记录下我在ubuntu16.4下搭建C++版本OpenCV 3.4.5的过程.首先请确保cuda,gcc, g++都安装好了,我这里是cuda 1 ...
广度优先遍历&深度优先遍历
一.广度优先算法BFS(Breadth First Search) 基本实现思想 (1)顶点v入队列. (2)当队列非空时则继续执行,否则算法结束. (3)出队列取得队头顶点v: (4)查找顶点v的所 ...
论文学习笔记 - 高光谱和 LiDAR 融合分类合集
A³CLNN: Spatial, Spectral and Multiscale Attention ConvLSTM Neural Network for Multisource Remote Se ...
微服务下的持续集成-Jenkins自动化部署GitHub项目
@ 目录一.前言二.DevOps概念三.为什么要做持续集成四.常见云服务五.手动部署Jenkins 5.1 准备工作 5.2 下载 5.3 启动 5.4 配置 5.5 Jenkins 首页 ...
Python_列表相减（判断长度后长的减短的）
#定义一个方法,可进行列表相减 class V(object): def __init__(self,*value): self.value=value def __sub__(self,other) ...
入坑 docsify，一款神奇的文档生成利器！
layout: postcategory: javatitle: 入坑 docsify,一款神奇的文档生成利器!tagline: by 沉默王二tags: - java Guide 哥是我认识的一个非 ...
BRT快速公交系统的可视化实践
前言随着城市进程的加快,中国城市机动车的数量飞速增长,造成城市交通拥堵问题越来越严重,城市居民对于改善出行条件的需求尤其是公共交通的便捷性问题也越来越迫切.而BRT(快速公交系统)作为一种新型的客运 ...

Python爬虫实战案例：取喜马拉雅音频数据详解