爬虫 ---- BeautifulSoup的基础使用

#BeautifulSoup的基础使用
from bs4 import BeautifulSoup    #导入bs4库

html = "<p class='stylecss'><!--index page--></p><div id='divid'><ul id='ulid'><li>Menu Title</li><li>Body Content</li></ul></div><p>Ending</p>"

soup = BeautifulSoup(html ,"lxml")    #创建对象

soup.p['class'] = 'newcss'  #修改p标签的class

#获取p标签的class

print(soup.p.attrs)

print(soup.p.get('class'))

print(soup.p['class'])

r = soup.find_all('p')  #soup.find('p')显示第一个p标签及内容, .find_all显示所有的p标签及内容

r = soup.p   # 同上一行find相同

r = soup.find(class_='stylecss')  #获取class为stylecss的标签及内容

r = soup.find(attrs = {'class':'stylecss'})

# 获取标签的内容文本

r = soup.p.string

# cdata = CData(r)

# print(cdata)

r = soup.div.ul.li.string

# if type(soup.p.string)==Comment:

#       r = soup.p.string

#       print(r)

r = soup.ul.contents[1]  # .contents[1]获取ul列表的第二个标签及内容

# .descendants循环获取当前页面的所有标签和标签内的内容

for child in soup.descendants:

    print(child)

# .strings循环获取页面中显示的所有文本内容，不包括注释内容

for string in soup.strings:

    print(string)

p = soup.li.parent.name  # .parent获取页面中li的父级标签名

# .parents递归得到当前元素的所有父级标签节点名

li = soup.li.string

for parent in li.parents:

    print(parent.name)

r = soup.ul.find_parent()  #获取当前节点标签的父节点及内容

r = soup.li.find_parents()  #获取当前节点标签的所有父节点及内容

r = soup.ul.find_all_previous()

r = soup.select('p')  #获取所有的p标签及内容

r = soup.select('p')[1]  #获取页面中的第二个p标签及内容

r = soup.select('#divid')

r = soup.select('.stylecss')

r = soup.select('div > ul')

r = soup.select('ul > li')[1].get_text()

print(r)

Python解析器  

1、Python标准库 ，使用方法：BeautifulSoup(markup, “html.parser”) ，优势：Python的内置标准库、执行速度适中、文档容错能力强

2、lxml HTML 解析器 ，使用方法：BeautifulSoup(markup, “lxml”)     ，优势：速度快、文档容错能力强，但需要安装C语言库。

3、lxml XML 解析器 ，使用方法：BeautifulSoup(markup, [“lxml”, “xml”]) 或 BeautifulSoup(markup, “xml”) ，优势：速度快、唯一支持XML的解析器，也需要安装C语言库。

4、html5lib ，使用方法：BeautifulSoup(markup, “html5lib”) ，优势：最好的容错性、以浏览器的方式解析文档、生成HTML5格式的文档，但其速度慢，不依赖外部扩展。

爬虫 ---- BeautifulSoup的基础使用的更多相关文章

python爬虫（5）——BeautifulSoup & docker基础
BeautifulSoup基础实战安装:pip install beautifulsoup4 常用指令: from bs4 import BeautifulSoup as bs import url ...
python爬虫实战：基础爬虫(使用BeautifulSoup4等)
以前学习写爬虫程序时候,我没有系统地学习爬虫最基本的模块框架,只是实现自己的目标而写出来的,最近学习基础的爬虫,但含有完整的结构,大型爬虫含有的基础模块,此项目也有,“麻雀虽小,五脏俱全”,只是没有考 ...
爬虫beautifulsoup实践
爬虫beautifulsoup实践: 目的:在https://unsplash.com/上爬取图片并保存到本地文件夹里. 一.观察response.首先,在Chrome浏览器里观察一下该网页的re ...
利用简易爬虫完成一道基础CTF题
利用简易爬虫完成一道基础CTF题声明:本文主要写给新手,侧重于表现使用爬虫爬取页面并提交数据的大致过程,所以没有对一些东西解释的很详细,比如表单,post,get方法,感兴趣的可以私信或评论给我.如 ...
爬虫入门一基础知识以及request
title: 爬虫入门一基础知识以及request date: 2020-03-05 14:43:00 categories: python tags: crawler 爬虫整体概述,基础知识. ...
python爬虫学习(一)：BeautifulSoup库基础及一般元素提取方法
最近在看爬虫相关的东西,一方面是兴趣,另一方面也是借学习爬虫练习python的使用,推荐一个很好的入门教程:中国大学MOOC的<python网络爬虫与信息提取>,是由北京理工的副教授嵩天老 ...
PYTHON 爬虫笔记五:BeautifulSoup库基础用法
知识点一:BeautifulSoup库详解及其基本使用方法什么是BeautifulSoup 灵活又方便的网页解析库,处理高效,支持多种解析器.利用它不用编写正则表达式即可方便实现网页信息的提取库. ...
Python爬虫 | Beautifulsoup解析html页面
引入大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而不是整个页面的数据.因此,在聚焦爬虫中使用数据解析.所以,我们的数据爬取的流程为: 指定url 基于reque ...
Python爬虫----Beautiful Soup4 基础
1. Beautiful Soup简介简单来说,Beautiful Soup是python的一个库,最主要的功能是从网页抓取数据.官方解释如下: Beautiful Soup提供一些简单的.pyth ...

随机推荐

Redis主从架构核心原理
Redis-Cluster工作原理: redis集群内置了16384个哈希槽,当需要在 Redis 集群中放置一个 key-value 时,redis 先对 key 使用 crc16 算法算出一个结果 ...
HTTPS和HTTP的区别，http协议的特征
http协议传输的数据都是没有经过加密的,也就是明文,所以http用于传输数据并不安全.而https是是使用了ssl(secure socket layer)协议+http协议构成的可加密传输,身份认 ...
Vue-Quill-Editor 富文本编辑器
通俗来说:富文本,就是比较丰富的文本编辑器.普通的框只能输入文字,而富文本还能给文字加颜色样式等. 富文本编辑器有很多,例如:KindEditor.Ueditor.但并不原生支持vue 但是我们今天要 ...
Screen.MousePointer 属性 (访问)
可以使用鼠标指针以及屏幕对象属性可以指定或确定当前显示的鼠标指针的类型.读取/写入的整数. 语法表达式.MousePointer 表达式一个代表 Screen 对象的变量. 注解 ...
VB学习一
一.基础函数 CStr() 函数转化表达式为一个字符串 Trim() 移除字符串两侧的空白字符串或者其他预定义字符成功:返回删除后的字符串失败:返回空字符串 VBA.Mid(string,star ...
linux c++下遍历文件
https://blog.csdn.net/u013617144/article/details/44807333
qt console 控制台程序与win console控制台程序是不同的
#include <QtCore/QCoreApplication> int main(int argc, char *argv[]){ QCoreApplication a(argc, ...
64bit机器编译32bit汇编
sudo apt-get install gcc-multilib sudo apt-get install g++-multilib gcc -m32 -S a.c -o a.s gcc -m64 ...
shell字符串拼接
name="Shell" url="http://c.biancheng.net/shell/" str1=$name$url #中间不能有空格 str2=&q ...
VMware虚拟机磁盘文件vmdk单文件转多文件相互转换
设置环境变量 set PATH=%PATH%;D:\Program Files (x86)\VMware\VMware Workstation echo %PATH% C:\Users\Admi ...

爬虫 ---- BeautifulSoup的基础使用

爬虫 ---- BeautifulSoup的基础使用的更多相关文章

随机推荐

热门专题