python爬虫1——获取网站源代码(豆瓣图书top250信息)

# -*- coding: utf-8 -*-

import requests

import re

import sys

reload(sys)

sys.setdefaultencoding('utf-8')

class Spider(object):

    def __init__(self):

        print('开始爬取豆瓣图书top250的内容。。。。。。')

    # 传入url，返回网页源代码

    def getSourceCode(self, url):

        html = requests.get(url)

        return html.text

    # 从源代码中提取出我们需要的内容块：{书名、作者出版社等、评分、评价人数}。

    def getEveryBookContent(self, sourceCode):

        everyBookContent = re.findall('<table width="100%">(.*?)</table>', sourceCode, re.S)

        # everyBookContent = re.findall('<div class="pl2">(.*?)</div>(.*?)<p class="pl">(.*?)</p>', sourceCode, re.S)

        return everyBookContent

    # 从内容块中提取出数据

    def getBookInfo(self, eachBookContent):

        bookInfo = {}

        # bookInfo['title'] = re.subn('( |\n|<br/>|</?span.*?>)', "", re.search('<a href=.*?>(.*?)</a>', eachBookContent, re.S).group(1))[0]

        bookInfo['title'] = re.sub('( |\n|<br/>|</?span.*?>)', "", re.search('<a href=.*?>(.*?)</a>', eachBookContent, re.S).group(1))

        bookInfo['author'] = re.search('<p class="pl">(.*?)</p>', eachBookContent, re.S).group(1)

        bookInfo['discussNum'] = re.sub('( |\n|<br/>)', "", re.search('<span class="pl">\((.*?)\)</span>', eachBookContent, re.S).group(1))

        bookInfo['score'] = re.search('<span class="rating_nums">(.*?)</span>', eachBookContent, re.S).group(1)

        return bookInfo

    # 将结果保存到文件

    def saveBookInfo(self, bookList):

        f = open("bookList.txt", "a")

        for each in bookList:

            f.writelines('书  名:\t {}\n'.format(each['title']))

            f.writelines('作  者:\t {}\n'.format(each['author']))

            f.writelines('评论数:\t {}\n'.format(each['discussNum']))

            f.writelines('评  分:\t {}\n\n'.format(each['score']))

        f.close()

    def start(self, url):

        sourceCode = self.getSourceCode(url)

        everyBookContent = self.getEveryBookContent(sourceCode)

        bookList = []

        for each in everyBookContent:

            bookList.append(self.getBookInfo(each))

        self.saveBookInfo(bookList)

if __name__ == '__main__':

    douban = Spider()

    url = 'http://book.douban.com/top250?start=0'

    i = 0

    while i <= 225:

        url = 'http://book.douban.com/top250?start={}'.format(i)

        douban.start(url)

        i += 25

python爬虫1——获取网站源代码(豆瓣图书top250信息)的更多相关文章

【Python数据分析】Python3操作Excel-以豆瓣图书Top250为例
本文利用Python3爬虫抓取豆瓣图书Top250,并利用xlwt模块将其存储至excel文件,图片下载到相应目录.旨在进行更多的爬虫实践练习以及模块学习. 工具 1.Python 3.5 2.Bea ...
Python 2.7_利用xpath语法爬取豆瓣图书top250信息_20170129
大年初二,忙完家里一些事,顺带有人交流爬取豆瓣图书top250 1.构造urls列表 urls=['https://book.douban.com/top250?start={}'.format(st ...
Python爬虫入门：爬取豆瓣电影TOP250
一个很简单的爬虫. 从这里学习的,解释的挺好的:https://xlzd.me/2015/12/16/python-crawler-03 分享写这个代码用到了的学习的链接: BeautifulSoup ...
Python 2.7获取网站源代码的几种方式_20160924
#coding:utf-8 import urllib2,cookielib if __name__ == '__main__': root_url='https://www.baidu.com/' ...
【Python数据分析】Python3多线程并发网络爬虫-以豆瓣图书Top250为例
基于上两篇文章的工作 [Python数据分析]Python3操作Excel-以豆瓣图书Top250为例 [Python数据分析]Python3操作Excel(二) 一些问题的解决与优化已经正确地实现 ...
Python爬虫-爬取豆瓣图书Top250
豆瓣网站很人性化,对于新手爬虫比较友好,没有如果调低爬取频率,不用担心会被封 IP.但也不要太频繁爬取. 涉及知识点:requests.html.xpath.csv 一.准备工作需要安装reques ...
python爬虫之小说网站--下载小说(正则表达式)
python爬虫之小说网站--下载小说(正则表达式) 思路: 1.找到要下载的小说首页,打开网页源代码进行分析(例:https://www.kanunu8.com/files/old/2011/244 ...
python爬虫之天气预报网站--查看最近(15天)的天气信息(正则表达式)
python爬虫之天气预报网站--查看最近(15天)的天气信息(正则表达式) 思路: 1.首先找到一个自己想要查看天气预报的网站,选择自己想查看的地方,查看天气(例:http://www.tianqi ...
python爬虫之12306网站--火车票信息查询
python爬虫之12306网站--火车票信息查询思路: 1.火车票信息查询是基于车站信息查询,先完成车站信息查询,然后根据车站信息查询生成的url地址去查询当前已知出发站和目的站的所有车次车票信息 ...

随机推荐

[BAT]win7下用批处理脚本自动删除7天以前创建的文件
set JmeterPath=D:\apache-jmeter-2.7 forfiles /p %JmeterPath%\extras /m *.html -d -7 /c "cmd /c ...
Netty 零拷贝（三）Netty 对零拷贝的改进
Netty 零拷贝(三)Netty 对零拷贝的改进 Netty 系列目录 (https://www.cnblogs.com/binarylei/p/10117436.html) Netty 的&quo ...
2018.09.28 牛客网contest/197/A因子（唯一分解定理）
传送门比赛的时候由于变量名打错了调了很久啊. 这道题显然是唯一分解定理的应用. 我们令P=a1p1∗a2p2∗...∗akpkP=a_1^{p_1}*a_2^{p_2}*...*a_k^{p_k}P ...
2018.06.30 BZOJ 2342: [Shoi2011]双倍回文（manacher）
2342: [Shoi2011]双倍回文 Time Limit: 10 Sec Memory Limit: 128 MB Description Input 输入分为两行,第一行为一个整数,表示字符串 ...
2018.09.01 独立集（树形dp）
描述给定一颗树(边权为1),选取一个节点子集,使得该集合中任意两个节点之间的距离都大于K.求这个集合节点最多是多少输入第一行是两个整数N,K 接下来是N-1行,每行2个整数x,y,表示x与y有一 ...
2018.08.19 NOIP模拟 number（类数位dp）
Number 题目背景 SOURCE:NOIP2015-SHY-10 题目描述如果一个数能够表示成两两不同的 3 的幂次的和,就说这个数是好的. 比如 13 是好的,因为 13 = 9 + 3 + ...
继承方法-->call继承
function Person(name,age,sex){ this.name = name; this.age = age; this.sex = sex; }function P1(name,a ...
python nan 变成0
在使用numpy数组的过程中时常会出现nan或者inf的元素,可能会造成数值计算时的一些错误.这里提供一个numpy库函数的用法,使nan和inf能够最简单地转换成相应的数值. numpy.nan_t ...
python cov()
在PCA中涉及到了方差var和协方差cov,下面详细了解这两个函数的用法.numpy中var和cov函数求法和MATLAB中var和cov函数求法类似. 首先均值,样本方差,样本协方差公式分别为其中 ...
hbase使用MapReduce操作2（微博表实现）
package com.yjsj.weibo; import java.io.IOException; import java.util.ArrayList; import java.util.Ite ...

python爬虫1——获取网站源代码(豆瓣图书top250信息)

python爬虫1——获取网站源代码(豆瓣图书top250信息)的更多相关文章

随机推荐

热门专题