爬虫之爬取豆瓣图书名字及ID

from urllib import request

from bs4 import BeautifulSoup as bs

#爬取豆瓣最受关注图书榜

resp = request.urlopen('https://book.douban.com/chart?subcat=I')

html_data = resp.read().decode('utf-8')

#转化为BeautifulSoup对象

soup = bs(html_data,'html.parser')

#搜索最受关注的图书列表

topchart_book =soup.find_all('ul',class_='chart-dashed-list')

#搜索列表中所有图书

topchart_book_list = topchart_book[0].find_all('li',class_='media clearfix')

#新建数组用于存放后续的数据

topchart_list = []

#遍历图书馆列表，从中过滤出我们所需的信息

for item in topchart_book_list:

    #新建字典用于存放我们的图书信息，之后可用class来存储

    topchart_dict = {}

    #搜索到具体信息的位置

    book_item = item.find('a',class_='fleft')

    book_items = item.find('span',class_='font-small color-red fleft')

    #得到图书ID

    topchart_dict['id'] = book_item['href'].split('/')[4]   

    #得到图书名称

    topchart_dict['name'] = book_item.getText().replace('\t','').replace('\n','').replace(' ','')  #图书名字

    #得到图书评分

    topchart_dict['grade'] = book_items.getText()

    #将图书信息加入到数组中

    topchart_list.append(topchart_dict)

print(topchart_list)

爬虫之爬取豆瓣图书名字及ID的更多相关文章

requests+正则爬取豆瓣图书
#requests+正则爬取豆瓣图书 import requests import re def get_html(url): headers = {'User-Agent':'Mozilla/5.0 ...
Python 2.7_利用xpath语法爬取豆瓣图书top250信息_20170129
大年初二,忙完家里一些事,顺带有人交流爬取豆瓣图书top250 1.构造urls列表 urls=['https://book.douban.com/top250?start={}'.format(st ...
第一个nodejs爬虫：爬取豆瓣电影图片
第一个nodejs爬虫:爬取豆瓣电影图片存入本地: 首先在命令行下 npm install request cheerio express -save; 代码: var http = require( ...
python系列之（3）爬取豆瓣图书数据
上次介绍了beautifulsoup的使用,那就来进行运用下吧.本篇将主要介绍通过爬取豆瓣图书的信息,存储到sqlite数据库进行分析. 1.sqlite SQLite是一个进程内的库,实现了自给自足 ...
python网络爬虫之四简单爬取豆瓣图书项目
一.爬虫项目一: 豆瓣图书网站图书的爬取: import requests import re content = requests.get("https://book.douban.com ...
爬虫实战_爬取豆瓣图书利用csv库存储
读取csv文件通过csv.reader()和DictReader()两个函数 reader()函数返回一个迭代器会包含表头通过next函数可以跳过,但是它只能通过下标访问数据: DictRead ...
一起学爬虫——通过爬取豆瓣电影top250学习requests库的使用
学习一门技术最快的方式是做项目,在做项目的过程中对相关的技术查漏补缺. 本文通过爬取豆瓣top250电影学习python requests的使用. 1.准备工作在pycharm中安装request库 ...
零基础爬虫----python爬取豆瓣电影top250的信息（转）
今天利用xpath写了一个小爬虫,比较适合一些爬虫新手来学习.话不多说,开始今天的正题,我会利用一个案例来介绍下xpath如何对网页进行解析的,以及如何对信息进行提取的. python环境:pytho ...
go爬虫之爬取豆瓣电影
go爬取豆瓣电影好久没使用go语言做个项目了,上午闲来无事花了点时间使用golang来爬取豆瓣top电影,这里我没有用colly框架而是自己设计简单流程.mark一下思路定义两个channel, ...

随机推荐

ramdisk配置、解压、创建rootfs、启动简单分析
关键词:ramdisk.rdint..init.ramfs.__initramfs_start.__initramfs_size.rootfs.ramfs.populate_rootfs().gzip ...
xpath：
from selenium import webdriverb = webdriver.Firefox()#路径读取方式一:# b.get(r"C:\我的代码\selenium自动化测试\t ...
mysql索引类型：FULLTEXT、NORMAL、SPATIAL、UNIQUE的详细介绍(转)
Normal 普通索引表示普通索引,大多数情况下都可以使用 Unique 唯一索引表示唯一的,不允许重复的索引,如果该字段信息保证不会重复例如身份证号用作索引时,可设置为unique 约束唯一标识 ...
NOIP 2016 组合数问题
洛谷 P2822 组合数问题洛谷传送门 JDOJ 3139: [NOIP2016]组合数问题 D2 T1 JDOJ传送门 Description 组合数Cnm表示的是从n个物品中选出m个物品的方案数 ...
efk
准备三台虚拟机都安装 zookeeper kafka kafka01 192.168.202.131 +elasticsearch + kibana kafka02 192.168.2 ...
CF1254D Tree Queries（树链剖分）
出题人的做法是 $O(n\sqrt{n\log n})$,结果这场结束后就被狂喷,一群人给出了 $O(n\sqrt{n})$ 做法,甚至 $O(n\log n)$ 都出来了-- 首先发现, ...
vue中\$refs、\$emit、$on的使用场景
1.$emit的使用场景子组件调用父组件的方法并传递数据注意:子组件标签中的时间也不区分大小写要用“-”隔开子组件: <template> <button @click=&quo ...
php 获取代码执行的时间
$start_time = microtime(true); // ... 执行代码 ...$end_time = microtime(true);echo '共'.round($start_time ...
《细说PHP》第四版样章第18章数据库抽象层PDO 9
18.7 PDO的事务处理事务是确保数据库一致的机制,是一个或一系列的查询,作为一个单元的一组有序的数据库操作.如果组中的所有SQL语句都操作成功,则认为事务成功,那么事务被提交,其修改将作用于所 ...
WebSocket数据加密——AES与RSA混合加密
前言之前在写“一套简单的web即时通讯”,写到第三版的时候没什么思路,正好微信公众号看到一篇讲API交互加密,于是就自己搞了一套AES与RSA混合加密,无意中产生应用在WebSocket想法,好在思 ...

爬虫之爬取豆瓣图书名字及ID

爬虫之爬取豆瓣图书名字及ID的更多相关文章

随机推荐

热门专题