爬虫之Beautifulsoup的基本实用

基本方法如下:

# soup.a 只能找到第一个符合要求的标签

# soup.a.attrs 获取a所有的属性和属性值

# soup.a.attrs['href'] 获取href属性

# soup.a.string 获取a标签中存储的文本内容(直系)

# soup.a.text # 非直系 该标签下所有的文本内容

# soup.a.get_text() # 非直系 该标签下所有的文本内容

# soup.find('a') 找到第一个符合要求的标签

# soup.find('a', id='xxx') id为xxx的的a标签(返回一个)

# soup.findall('a') # 找到所有a标签

# soup.findall(['a', 'b']) # 找到所有a标签和b标签

# soup.select() # 根据选择器选择定位到标签

简单案例: 下载诗词名句网的三国演义文章

import requests

from bs4 import BeautifulSoup

url = 'http://www.shicimingju.com/book/sanguoyanyi.html'

fileTxt = requests.get(url).text

soup = BeautifulSoup(fileTxt, 'lxml')

a_list = soup.select('.book-mulu > ul > li > a')

f = open('sanguo.txt', 'w', encoding='utf8')

for a in a_list:

    title = a.string

    detail_url = 'http://www.shicimingju.com' + a['href']

    text = requests.get(detail_url).text

    detail_soup = BeautifulSoup(text, 'lxml')

    content = detail_soup.find('div', class_='chapter_content').text

    f.write(title+'\n'+content)

    print(f'{title} 下载完毕')

print('over')

f.close()

爬虫之Beautifulsoup的基本实用的更多相关文章

爬虫模块BeautifulSoup
中文文档:https://www.crummy.com/software/BeautifulSoup/bs4/doc/index.zh.html# 1.1 安装BeautifulSoup模块 ...
使用Python爬虫库BeautifulSoup遍历文档树并对标签进行操作详解（新手必学）
为大家介绍下Python爬虫库BeautifulSoup遍历文档树并对标签进行操作的详细方法与函数下面就是使用Python爬虫库BeautifulSoup对文档树进行遍历并对标签进行操作的实例,都是最 ...
Python开发爬虫之BeautifulSoup解析网页篇：爬取安居客网站上北京二手房数据
目标:爬取安居客网站上前10页北京二手房的数据,包括二手房源的名称.价格.几室几厅.大小.建造年份.联系人.地址.标签等. 网址为:https://beijing.anjuke.com/sale/ B ...
Python 爬虫—— requests BeautifulSoup
本文记录下用来爬虫主要使用的两个库.第一个是requests,用这个库能很方便的下载网页,不用标准库里面各种urllib:第二个BeautifulSoup用来解析网页,不然自己用正则的话很烦. req ...
python爬虫之BeautifulSoup
爬虫有时候写正则表达式会有假死现象就是正则表达式一直在进行死循环查找例如:https://social.msdn.microsoft.com/forums/azure/en-us/3f4390ac ...
web爬虫，BeautifulSoup
BeautifulSoup 该模块用于接收一个HTML或XML字符串,然后将其进行格式化,之后遍可以使用他提供的方法进行快速查找指定元素,从而使得在HTML或XML中查找指定元素变得简单. 1 2 3 ...
python 爬虫 requests+BeautifulSoup 爬取巨潮资讯公司概况代码实例
第一次写一个算是比较完整的爬虫,自我感觉极差啊,代码low,效率差,也没有保存到本地文件或者数据库,强行使用了一波多线程导致数据顺序发生了变化... 贴在这里,引以为戒吧. # -*- coding: ...
Python爬虫——用BeautifulSoup、python-docx爬取廖雪峰大大的教程为word文档
版权声明:本文为博主原创文章,欢迎转载,并请注明出处.联系方式:460356155@qq.com 廖雪峰大大贡献的教程写的不错,写了个爬虫把教程保存为word文件,供大家方便下载学习:http://p ...
python3: 爬虫---- urllib, beautifulsoup
最近晚上学习爬虫,首先从基本的开始: python3 将urllib,urllib2集成到urllib中了, urllib可以对指定的网页进行请求下载, beautifulsoup 可以从杂乱的ht ...

随机推荐

【UVA10816】Travel in Desert （最小瓶颈路+最短路）
UVA10816 Travel in Desert 题目大意沙漠中有一些道路,每个道路有一个温度和距离,要求s,t两点间的一条路径,满足温度最大值最小,并且长度最短输入格式输入包含多组数据. 每 ...
git 克隆提交本地修改到远程方法
最近一个项目,提交总报错按照下面的流程就ok了 $ git clone $ git init $ cd shop $ git branch -al //查看所有分支 $ git pull origi ...
LOJ6500. 「雅礼集训 2018 Day2」操作（哈希＋差分）
题目链接 https://loj.ac/problem/6500 题解区间取反 $01$ 串的经典套路是差分.我们令 $b_i = a_i\ {\rm xor}\ a_{i - 1}$(\( ...
Bowen
Advertise Window大小注册表键值位于:regedit->HKEY_LOCAL_MACHINE\SYSTEM\CurrentControlSet\Services\Tcpip\Pa ...
Hystrix - 踩坑回忆
1.Unable to connect to Command Metric Stream 异常 Finchley版本使用Hystrix存在此问题.网上常规解决思路: @Bean public Serv ...
centos 7 设置开机启动服务
2018-12-25 Centos7下添加开机自启动脚本和服务的方法以docker 服务为例 1.centos7自带命令设置 systemctl enable docker.service 2.设置 ...
I2C裸机驱动程序设计
① I2C(Inter-Integrated Circuit)总线是由飞利浦公司开发的两线式串行总线,用于连接微控制器及其外围设备 ② I2C总线有两根双向信号线 (1)SDA:Serial Data ...
PIE SDK矢量点生成等值线、面
1.算法功能简介等值线图能直观地展示数据的变化趋势,是众多领域展示成果的重要图建之一,被广泛应用于石油勘探.矿物开采.气象预报等众多领域.等值线的绘制是指从大量采样数据中提取出具有相同值的点的信息, ...
Postman学习（压力测试）
Postman下载安装后下面是在网上随便抓了一个请求地址来做演示,把请求地址填入地址栏,此请求为GET请求.点击Send发送请求,请求结果将会在下方显示出来.每次的请求历史数据,会被记录下来,但是经 ...
MongoDB wiredTiger存储引擎下的存储方式LSM和B-Tree比较
前段时间做拦截件监控的时候把拦截件生命期存入mongodb,因生命期有各种变化,因此对此表的更新写操作非常多,老大给我看了一篇文章,才知道mongodb已经支持lsm存储方式了. 原文如连接:http ...

爬虫之Beautifulsoup的基本实用

爬虫之Beautifulsoup的基本实用的更多相关文章

随机推荐

热门专题