Python爬取17吉他网吉他谱

最近学习吉他，一张一张保存吉他谱太麻烦，写个小程序下载吉他谱。

安装 BeautifulSoup，BeautifulSoup是一个解析HTML的库。
pip install BeautifulSoup4

在这个程序中 BeautifulSoup 使用 html5lib 所以还要安装 html5lib
pip install html5lib

代码如下：

# -*- coding: utf-8 -*-

#coding=UTF8

import os

import sys

import logging

import urllib

import urllib2

import chardet

import re

import cookielib

import urlparse

from bs4 import BeautifulSoup

sysEncoding = sys.getfilesystemencoding()

cookieJar = cookielib.CookieJar()

def get(url):

    req = urllib2.Request(url)

    opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookieJar))

    response = opener.open(req)

    return response.read()

def download_guitar_image(url, target):

    print 'start download guitar image ...'

    req = urllib2.Request(url)

    req.add_header('Accept','image/webp,image/*,*/*;q=0.8')

    opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookieJar))

    response = opener.open(req)

    content = response.read()    

    with open(target, 'wb') as code:

        code.write(content)

#解析吉他谱图片页面链接地址

def parse_guitar_img_link():

    page_list = []

    url_base = 'http://www.17jita.com/'

    page = 1

    while True:

        url = url_base + 'tab/img/index.php?page=' + str(page)

        print url

        html = get(url)

        soup = BeautifulSoup(html, "html5lib")

        list = soup.select('#ct dl > dt > a')

        if not list:

            break

        for item in list:

            page_list.append({ 'title' : item.text, 'link' : url_base + item['href'] })

        page += 1

    return page_list    

def download_guitar_image_link_list(url):

    image_link_list = []

    page = 1

    while True:

        page_url = url

        if page > 1:

            page_url = url.replace('.html', '' + str(page) + '.html')

        try:

            html = get(page_url)

            soup = BeautifulSoup(html, 'html5lib')

            img_list = soup.select('#article_contents a > img')

            for img in img_list:

                image_link_list.append(img['src'])

        except urllib2.URLError, e:

            msg = u'下载 ' + page_url + u' 出错, 原因: ' + e.reason

            print msg

            logging.error(msg)

            break

        page += 1

    return image_link_list

if __name__ == '__main__':

    logging.basicConfig(

        level=logging.DEBUG,

        format='%(asctime)s %(filename)s[line:%(lineno)d] %(levelname)s %(message)s',

        datefmt='%Y-%m-%d %H:%M:%S',

        filename='guitar.log',

        filemode='a')

    path = 'guitar'

    if not os.path.exists(path):

        os.mkdir(path)

    page_list = parse_guitar_img_link()

    for page in page_list:

        print page['link'] + '(' + page['title'] + ')'

        guitar_path = path + '/' + (page['title']).encode('GBK')

        if not os.path.exists(guitar_path):

            os.mkdir(guitar_path)

        image_link_list = download_guitar_image_link_list(page['link'])

        for image_link in image_link_list:

            print '\t' + image_link

            filename = image_link[image_link.rindex('/'):]

            filepath = guitar_path + filename.encode('GBK')

            download_guitar_image(image_link, filepath)

程序中还存在一些问题尚优化，比如下载中断，不能下载剩下的吉他谱。

Python爬取17吉他网吉他谱的更多相关文章

Python爬取中国天气网
Python爬取中国天气网基于requests库制作的爬虫. 使用方法:打开终端输入 “python3 weather.py 北京(或你所在的城市)" 程序正常运行需要在同文件夹下加入一个 ...
（python爬取小故事网并写入mysql）
前言: 这是一篇来自整理EVERNOTE的笔记所产生的小博客,实现功能主要为用广度优先算法爬取小故事网,爬满100个链接并写入mysql,虽然CS作为双学位已经修习了三年多了,但不仅理论知识一般,动手 ...
python爬取天气后报网
前言大二下学期的大数据技术导论课上由于需要获取数据进行分析,我决定学习python爬虫来获取数据.由于对于数据需求量相对较大,我最终选择爬取天气后报网,该网站可以查询到全国各地多年的数据,而且相对 ...
Python 爬取煎蛋网妹子图片
#!/usr/bin/env python # -*- coding: utf-8 -*- # @Date : 2017-08-24 10:17:28 # @Author : EnderZhou (z ...
Python爬取中国票房网所有电影片名和演员名字，爬取齐鲁网大陆所有电视剧名称
爬取CBO中国票房网所有电影片名和演员名字 # -*- coding: utf-8 -*- # 爬取CBO中国票房网所有电影片名 import json import requests import ...
python爬取斗图网中的 “最新套图”和“最新表情”
1.分析斗图网斗图网地址:http://www.doutula.com 网站的顶部有这两个部分: 先分析“最新套图” 发现地址栏变成了这个链接,我们在点击第二页可见,每一页的地址栏只有后面的pag ...
适合初学者的Python爬取链家网教程
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: TinaLY PS:如有需要Python学习资料的小伙伴可以加点击下 ...
python爬取中国知网部分论文信息
爬取指定主题的论文,并以相关度排序. #!/usr/bin/python3 # -*- coding: utf-8 -*- import requests import linecache impor ...
python爬取千库网
url:https://i588ku.com/beijing/0-0-default-0-8-0-0-0-0-1/ 有水印但是点进去就没了这里先来测试是否有反爬虫 import requests ...

随机推荐

iOS之Git的使用
1.登录Git账号,创建一个新的仓库
iOS之文本属性Attributes的使用
1.NSKernAttributeName: @10 调整字句 kerning 字句调整 2.NSFontAttributeName : [UIFont systemFontOfSize:_fontS ...
例3-13设置ROI
写在前面,写的时候总有种给别人写的感觉,然后就写得很冗长,也没有办法很好的表达自己的想法,总觉得写得越多越好,实则不然,要最言简意赅,还能表达意思. 嗯! 只写自己不明白的地方,如果恰巧有人也看了我的 ...
深入理解计算机系统第二版习题解答CSAPP 2.16
填写下表,说明不同移位运算对单字节数的影响. x x<<3 x>>2(逻辑) x>>2(算术) 十六进制二进制二进制十六进制二进制十六进制二进制十六进 ...
[置顶] operator overloading(操作符重载，运算符重载)运算符重载,浅拷贝(logical copy) ,vs, 深拷贝(physical copy)
operator overloading(操作符重载,运算符重载) 所谓重载就是重新赋予新的意义,之前我们已经学过函数重载,函数重载的要求是函数名相同,函数的参数列表不同(个数或者参数类型).操作符重 ...
canvas实现“探照灯”共能
简单的样式: body{ margin: 0; padding: 0;}#canvas{ display: block; position: relative; margin: auto;} 创建绘图 ...
C#实现快速排序法
现在有数组{ 3, 6, 2, 1, 9, 5, 4, 7 }; 然后用快速排序法把他们排序 1.首先 ,取出3作为比较数据 2.从最右边往左边比较找到第一个比3小的数据,把3在数组中的位置赋值为那个 ...
JS 乱记
JS 中不存在块级作用域,也就是说在全局作用域下 if ,for 语句中用 var 声明的变量是全局变量. JS 中浮点数运算的值为近似值,比如:0.1 + 0.2 不等于 0.3 ,所以避免使用浮点 ...
c# 远程监控（2）摄像头调研及模拟
经过N多调研,最终选择了OpenCV(Emgu CV) ** 至于DirectShow, OpenCV等等其他大家可以百度,在这里我就不再赘述环境:vs2010 vs2012 vs2013均可 Op ...
Centos7最小化安装后(minimal)安装图形界面
centos7下载地址:http://mirrors.cqu.edu.cn/CentOS/7/isos/x86_64/CentOS-7-x86_64-Minimal-1511.iso 下载后用vmwa ...

Python爬取17吉他网吉他谱

Python爬取17吉他网吉他谱的更多相关文章

随机推荐

热门专题