PYTHON网络爬虫与信息提取[BeautifulSoup](单元四)
1 简介
from bs4 import BeautifulSoup
soup=BeautifulSoup(<p>data</p>,'html.parser')
2 基本元素
解析,遍历,维护,标签树的库
<p class="title"> ...</p> tag对
名称 (属性 attributes)
beautifulsoup 或bs4
from bs4 import BeautifulSoup
import bs4
beautifulSoup 雷
html--------标签树(字符串)转换为beautifulsoup类
from bs4 import BeautifulSoup
soup=
注:解析器(4种)
html.parser 安装bs4库
lxml pip install lxml
xml 同上
html5lib pipinstall html5lib
beautiful 类的基本元素
Tag 标签 尖括号开头结尾
Name 格式:<tag>.name <p>的名字是 ''p''
Attributes 标签的属性,字典形式组织 <tag>.attrs
NavigableString 标签内非属性字符串 表示尖括号之间的内容
soup.a.string 就可以了
Comment 标签内字符串的注释部分
用string 也可以得出这个类型
3 标签树的遍历
.contents 获得子节点的列表
.children 获得子节点的迭代形式
.descendants 获得子孙的迭代形式
儿子节点不管包括标签 还包括\n
soup.body.contents
.parent 节点的父亲标签
.parnets 节点的先辈形式迭代版的
平行遍历(返回按照html文本顺序的节点标签)
平行遍历时实在同一个父标签下的遍历
.next_sibling
.previous_sibling
.next_siblings 迭代版
.next_previous_siblings 迭代版
4 基于bs4显示html的内容
from bs4 import BeautifulSoup
soup=BeautifulSoup(demo,"html.parser") //加载解析器的语句
soup.prettify() //soup 是 BeautifulSoup类型 用以解析html 或者遍历html
"prettify()方法非常好用"
#增加换行符
print(soup.prettify())
PYTHON网络爬虫与信息提取[BeautifulSoup](单元四)的更多相关文章
- Python网络爬虫与信息提取
1.Requests库入门 Requests安装 用管理员身份打开命令提示符: pip install requests 测试:打开IDLE: >>> import requests ...
- 第三次作业-MOOC学习笔记:Python网络爬虫与信息提取
1.注册中国大学MOOC 2.选择北京理工大学嵩天老师的<Python网络爬虫与信息提取>MOOC课程 3.学习完成第0周至第4周的课程内容,并完成各周作业 第一周 Requests库的爬 ...
- 第3次作业-MOOC学习笔记:Python网络爬虫与信息提取
1.注册中国大学MOOC 2.选择北京理工大学嵩天老师的<Python网络爬虫与信息提取>MOOC课程 3.学习完成第0周至第4周的课程内容,并完成各周作业 4.提供图片或网站显示的学习进 ...
- 第三次作业-Python网络爬虫与信息提取
1.注册中国大学MOOC 2.选择北京理工大学嵩天老师的<Python网络爬虫与信息提取>MOOC课程 3.学习完成第0周至第4周的课程内容,并完成各周作业 过程. 5.写一篇不少于100 ...
- Python网络爬虫与信息提取笔记
直接复制粘贴笔记发现有问题 文档下载地址//download.csdn.net/download/hide_on_rush/12266493 掌握定向网络数据爬取和网页解析的基本能力常用的 Pytho ...
- 【学习笔记】PYTHON网络爬虫与信息提取(北理工 嵩天)
学习目的:掌握定向网络数据爬取和网页解析的基本能力the Website is the API- 1 python ide 文本ide:IDLE,Sublime Text集成ide:Pychar ...
- Python网络爬虫与信息提取(一)
学习 北京理工大学 嵩天 课程笔记 课程体系结构: 1.Requests框架:自动爬取HTML页面与自动网络请求提交 2.robots.txt:网络爬虫排除标准 3.BeautifulSoup框架:解 ...
- Python网络爬虫与信息提取(二)—— BeautifulSoup
BeautifulSoup官方介绍: Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式. 官方 ...
- PYTHON网络爬虫与信息提取[信息的组织与提取](单元五)
1 三种信息类型的简介 xml : extensible markup language 与html非常相似 现有html后有xml xml是html发展来的 扩展 通用 json 类型 javas ...
随机推荐
- 可持久化线段树(主席树)——静态区间第k大
主席树基本操作:静态区间第k大 #include<bits/stdc++.h> using namespace std; typedef long long LL; ,MAXN=2e5+, ...
- vue2 + koa2全栈部署
1.首先打包前端上传 修改config下的index.js 代理地址为服务器IP index: path.resolve(__dirname, '../dist/index.html'), asset ...
- JDK源码阅读--Hashtable
public class Hashtable<K,V> extends Dictionary<K,V> implements Map<K,V>, Cloneable ...
- tty who 命令
#tty : 查看当前终端对应的终端的设备文件 #who : 查看当前系统登录的所有用户及其信息
- Win7下SQLServer访问虚拟机上的MySQL
一.确保Win7能telnet通MySQL端口,防火墙设置可参考http://www.cnblogs.com/ShanFish/p/6519950.html二.配置系统DSN1.在Win7上安装MyS ...
- 使用HTTP代理
HTTP代理服务器可以比作客户端与Web服务器网站之间的一个信息中转站,客户端发送的HTTP请求和Web服务器返回的HTTP响应通过代理服务器转发给对方, 爬虫程序在爬取某些网站的时候也需要使用代理, ...
- js 实现横向滚动轮播并中间暂停下
效果: html: <!DOCTYPE html> <html> <head> <meta charset="UTF-8"> < ...
- springboot新增jsp的支持
一.添加依赖 <!-- 添加对jsp的支持 --> <!-- web 依赖 --> <dependency> <groupId>org.springfr ...
- C++ 赋值函数为什么返回reference to *this?
赋值操作为什么要返回 reference to *this? 要弄清这个问题之前,先了解函数的返回值类型:返回值类型,返回引用类型 返回值类型:返回的是一个对象的副本. test operator= ...
- WPF 导出Excel 导出图片
/// <summary> /// 导出Excel /// </summary> private void ExportExcel(DataTable ExcelDt) { / ...