爬取豆瓣音乐TOP250的数据

参考网址：https://music.douban.com/top250

因为详细页的信息更丰富，本次爬虫在详细页中进行，因此先爬取进入详细页的网址链接，进而爬取数据。

需要爬取的信息有：歌曲名、表演者、流派、发行时间、出版者和评分等。

将数据分别使用TXT、JSON、CSV存储。

import re

import csv

import time

import json

import requests

from bs4 import BeautifulSoup

from requests import RequestException

def get_one_page(url):

    try:

        headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36'

                   + '(KHTML, like Gecko) Chrome/73.0.3683.103 Safari/537.36'}

        response = requests.get(url, headers=headers)

        #response.encoding = response.apparent_encoding

        if response.status_code == 200:

            return response.text

        return None

    except RequestException:

        return None

def get_detailurl(text):

    detailurl = []

    soup = BeautifulSoup(text, 'lxml')

    nbg = soup.find_all(name='a', class_='nbg')

    for i in nbg:

        detailurl.append(i['href'])

    return detailurl

def parse_one_page(text):

    soup = BeautifulSoup(text, 'lxml') #使用lxml XML 解析库

    performer = soup.select('#info > span > span > a')

    #有标签没有属性的情况下用select, 否则用find_all

    song = soup.select('#wrapper > h1 > span')

    style = re.findall('流派:</span> (.*?)<br', text, re.S) #.*?非贪婪匹配

    #re.S使.匹配包括换行在内的所有字符

    if len(style) == 0: #有的页面没有流派,用NULL填充

        style.append('NULL')

    publisher = re.findall('出版者:</span> (.*?)?<br', text, re.S)

    if len(publisher) == 0: #有的页面没有出版者,用NULL填充

        publisher.append('NULL')

    pattern = re.compile('发行时间:</span> (.*?)?<br', re.S)

    #compile()将正则字符串编译成正则对象，方便之后复用

    time = re.findall(pattern, text)

    score = soup.find_all(name='strong', class_="ll rating_num")

    #有标签有属性的情况下用find_all

    yield {

        'performer': performer[0].string,

        'song': song[0].string,

        'style': style[0].strip(),

        'time': time[0].strip(),

        'publisher': publisher[0].strip(),

        'score': score[0].string,

    }

def write_to_file(content):

    with open('doubanMusicTop250.txt', 'a', encoding='utf-8') as f:

        f.write(json.dumps(content, ensure_ascii=False)+'\n')

        #dumps将json对象转化为字符串

def write_to_json(content):

    with open('doubanMusicTop250.json', 'a', encoding='utf-8') as f:

        f.write(json.dumps(content, ensure_ascii=False)+'\n')

def write_to_csv(content):

    with open('doubanMusicTop250.csv', 'a', encoding='utf-8') as f:

        fieldnames = ['publisher', 'style', 'song', 'score', 'performer', 'time']

        writer = csv.DictWriter(f, fieldnames=fieldnames)

        writer.writeheader()

        writer.writerows(content)

if __name__ == '__main__':

    url = 'https://music.douban.com/top250?start={}'

    urls = [url.format(page) for page in range(0,256,25)]

    content = []

    for url in urls:

        text1 = get_one_page(url)

        detailurl = get_detailurl(text1)

        for i in detailurl:

            text2 = get_one_page(i)

            for item in parse_one_page(text2):

                print(item)

                write_to_file(item)

                content.append(item)

        time.sleep(1)

    write_to_csv(content)

    write_to_json(content)

爬取豆瓣音乐TOP250的数据的更多相关文章

Python爬虫小白入门（七）爬取豆瓣音乐top250
抓取目标: 豆瓣音乐top250的歌名.作者(专辑).评分和歌曲链接使用工具: requests + lxml + xpath. 我认为这种工具组合是最适合初学者的,requests比pytho ...
实例学习——爬取豆瓣音乐TOP250数据
开发环境:(Windows)eclipse+pydev+MongoDB 豆瓣TOP网址:传送门一.连接数据库打开MongoDBx下载路径,新建名为data的文件夹,在此新建名为db的文件夹,d ...
一起学爬虫——通过爬取豆瓣电影top250学习requests库的使用
学习一门技术最快的方式是做项目,在做项目的过程中对相关的技术查漏补缺. 本文通过爬取豆瓣top250电影学习python requests的使用. 1.准备工作在pycharm中安装request库 ...
Python爬虫：现学现用xpath爬取豆瓣音乐
爬虫的抓取方式有好几种,正则表达式,Lxml(xpath)与BeautifulSoup,我在网上查了一下资料,了解到三者之间的使用难度与性能三种爬虫方式的对比. 这样一比较我我选择了Lxml(xpa ...
python2.7爬取豆瓣电影top250并写入到TXT，Excel，MySQL数据库
python2.7爬取豆瓣电影top250并分别写入到TXT,Excel,MySQL数据库 1.任务爬取豆瓣电影top250 以txt文件保存以Excel文档保存将数据录入数据库 2.分析电影 ...
scrapy爬虫框架教程（二）-- 爬取豆瓣电影TOP250
scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250 前言经过上一篇教程我们已经大致了解了Scrapy的基本情况,并写了一个简单的小demo.这次我会以爬取豆瓣电影TOP250为例进一步为大 ...
python 爬虫&爬取豆瓣电影top250
爬取豆瓣电影top250from urllib.request import * #导入所有的request,urllib相当于一个文件夹,用到它里面的方法requestfrom lxml impor ...
【转】爬取豆瓣电影top250提取电影分类进行数据分析
一.爬取网页,获取需要内容我们今天要爬取的是豆瓣电影top250页面如下所示: 我们需要的是里面的电影分类,通过查看源代码观察可以分析出我们需要的东西.直接进入主题吧! 知道我们需要的内容在哪里了, ...
Scrapy中用xpath/css爬取豆瓣电影Top250：解决403HTTP status code is not handled or not allowed
好吧,我又开始折腾豆瓣电影top250了,只是想试试各种方法,看看哪一种的方法效率是最好的,一直进行到这一步才知道 scrapy的强大,尤其是和selector结合之后,速度飞起.... 下面我就采用 ...

随机推荐

chrome报错：您目前无法访问因为此网站使用了 HSTS
chrome报错:您目前无法访问因为此网站使用了 HSTS 其然: 现象 :访问github仓库报错'您目前无法访问XXXX 因为此网站使用了 HSTS' 解决方法:清理HSTS的设定,重新获取.c ...
C primer plus 6 编程练习答案
环境:vs2017 /**编程练习2**/ */ #include<stdio.h> int main(void) { printf("张三\n"); printf(& ...
matlab---设置背景颜色为白色
(1)每次设置figure('color','w');或者figure('color',[1 1 1])或者set(gcf,'color','w'); (2)一次性:在命令行内输入 set(0,'de ...
iOS 中事件的响应链和传递链
iOS事件链有两条:事件的响应链:Hit-Testing事件的传递链响应链:由离用户最近的view向系统传递.initial view –> super view –> ….. –> ...
Android开发之adt bundle安装
这个学期开了一门手机游戏开发的课,所以就接触到了adt bundle,Android开发环境有三种方式,分别是JDK+SDK+Eclipse+ADT.JDK+adt-bundle与JDK+Androi ...
Vue整合d3.v5.js制作--柱状图(rect)
先上效果图: 图中柱状图变成纯蓝色是鼠标滑动过的颜色(颜色可改,本人配色能力十分的强,建议直接用默认设置即可 ( ᖛ ̫ ᖛ )ʃ)) 1.环境说明 Vue版本:"vue": &q ...
P1196 [NOI2002]银河英雄传说【带权并查集】
思路用sum记录每个舰队的战舰数量, tohead 记录当前舰离舰首的距离,那么求任意两舰之间有多少舰显然就是 abs( tohead[i] - tohead[j] ) - 1: CODE #inc ...
JavaSE学习笔记（13）---线程池、Lambda表达式
JavaSE学习笔记(13)---线程池.Lambda表达式 1.等待唤醒机制线程间通信概念:多个线程在处理同一个资源,但是处理的动作(线程的任务)却不相同. 比如:线程A用来生成包子的,线程B用 ...
CSS3结构类选择器补充
:empty 没有子元素(包括文本节点)的元素 :not 否定选择器 <!DOCTYPE html> <html lang="en" manifest=&quo ...
mysql 连接查询转换group_concat, find_in_set
1.a表 2.b表 3.连接(a_u_id 对应b表的b_id) select a.a_id,a.a_u_id,group_concat(b.b_name) from a_tb a left join ...

爬取豆瓣音乐TOP250的数据

爬取豆瓣音乐TOP250的数据的更多相关文章

随机推荐

热门专题