数据解析模块BeautifulSoup简单使用

一、准备环境：

1、准备测试页面test.html

<html>

<head>

    <title>

        The Dormouse's story

    </title>

</head>

<body>

<p class="title">

    <b>

        The Dormouse's story

    </b>

</p>

<p class="story">

    Once upon a time there were three little sisters; and their names were

    <a class="sister" href="http://example.com/elsie" id="link1">

        Elsie

    </a>

    ,

    <a class="sister" href="http://example.com/lacie" id="link2">

        Lacie

    </a>

    and

    <a class="sister" href="http://example.com/tillie" id="link2">

        Tillie

    </a>

    ; and they lived at the bottom of a well.

</p>

<p class="story">

    ...

</p>

</body>

</html>

test.html

2、安装相关模块

pip install bs4

pip install requests

二、beautifulsoup相关语法：

1、实例化beautifulsoup对象

from bs4 import BeautifulSoup

# 实例化BeautifulSoup对象

# 1、转化本地HTML文件

soup = BeautifulSoup(open('本地文件'), 'lxml')

# 如使用本地文件

with open('test.html',mode='r',encoding='utf-8') as f:

    soup = BeautifulSoup(f,'lxml')

print(soup.a)   # 打印第一个a标签的所有内容

# 2、通过requests.get或其它方式获取到的HTML数据

soup = BeautifulSoup('字符串类型或者字节类型', 'lxml')

# 如通过requests获取到的网页数据

from requests

page_html = requests.get(url='http://www.baidu.com').text

soup = BeautifulSoup(page_html, 'lxml')

print(soup.a)   # 打印第一个a标签的所有内容

2、通过实例化对象获取标签，标签内容，标签属性（这里以上面准备的test.html为示例进行演示）。

import requests

from bs4 import BeautifulSoup

with open('test.html',mode='r',encoding='utf-8') as f:

    soup = BeautifulSoup(f,'lxml')

print(soup.title)             # 打印title标签的全部内容

print(soup.a)                 # 打印a标签的全部内容

print(soup.a.attrs)           # 打印a标签的所有属性内容

print(soup.a.attrs['href'])   # 打印a标签href属性的值

print(soup.a['href'])         # 也可以简写

# 打印a标签中的文本内容内容

print(soup.a.string)

print(soup.a.text)

print(soup.a.get_text())

# 需要注意的是，如果a标签中还嵌套有其它标签，soup.a.string将获取不到值返回一个None，
# 而soup.a.text和soup.a.get_text()可以获取到包括a标签在内的所有子标签中的文本内容。

# 注意：soup.tagName只定位到第一次出现的tagName标签便结束匹配

soup.find('a')                                         # 与soup.tagName一样只匹配到第一次出现的。不同的是可以使用标签和属性进行联合查找。

print(soup.find('a',{'class':"sister",'id':'link2'}))  # 根据标签和属性进行定位

find_all()  # 和find的用法一样，只是返回值是一个列表，这里就不演示了

# 根据选择器进行定位

# 常见的选择器：标签选择器(a)、类选择器(.)、id选择器(#)、层级选择器

soup.select('a')              # 根据标签定位到所有a标签

print(soup.select('.sister')) # 根据类名sister定位

print(soup.select('#link1'))  # 根据id 进行定位

print(soup.select('p>a'))     # 定位所有p标签下的a标签

数据解析模块BeautifulSoup简单使用的更多相关文章

X2.5 添加自定义数据调用模块（简单方法）
Discuz!X系列的diy功能还是相当不错的,在对其进行二次开发的过程中,或许需要加入新的数据调用模块,这样可以使你开发的功能模块也像原来的模块一样,只需要点点鼠标,填写一些简单的信息,就可以在各个 ...
python爬虫数据解析之BeautifulSoup
BeautifulSoup是一个可以从HTML或者XML文件中提取数据的python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式. BeautfulSoup是python爬虫三 ...
iOS开发——数据解析Swift篇&简单json数据处理
简单json数据处理 //loadWeather var url = NSURL(string: "http://www.weather.com.cn/adat/sk/101240701.h ...
070.Python聚焦爬虫数据解析
一聚焦爬虫数据解析 1.1 基本介绍聚焦爬虫的编码流程指定url 基于requests模块发起请求获取响应对象中的数据数据解析进行持久化存储如何实现数据解析三种数据解析方式正则表达式 ...
【爬虫入门手记03】爬虫解析利器beautifulSoup模块的基本应用
[爬虫入门手记03]爬虫解析利器beautifulSoup模块的基本应用 1.引言网络爬虫最终的目的就是过滤选取网络信息,因此最重要的就是解析器了,其性能的优劣直接决定这网络爬虫的速度和效率.Bea ...
【网络爬虫入门03】爬虫解析利器beautifulSoup模块的基本应用
[网络爬虫入门03]爬虫解析利器beautifulSoup模块的基本应用 1.引言网络爬虫最终的目的就是过滤选取网络信息,因此最重要的就是解析器了,其性能的优劣直接决定这网络爬虫的速度和效率.B ...
爬虫----爬虫解析库Beautifulsoup模块
一:介绍 Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.Beautiful Soup会帮你 ...
Request模块—数据解析工具
一.爬虫基本步骤指定URL信息发起请求获取响应数据对响应数据进行数据解析持久化存储二.数据解析 1. 正则表达式 (1) 基本语法 1. 单字符: . : 除换行以外所有字符 [] :[a ...
最简单简洁高效的Json数据解析
一.无图无真相二.主要代码 1.导入jar包拷贝fastjson.jar包到projectlibs包下 2.封装工具类JsonUtil.java package com.example.parse ...

随机推荐

浅谈Java中switch分支语句
前言: 在程序中遇到多分支选择的时候,想必大家都喜欢用if...else if...else...语句,尤其是初学者,因为在了解switch语句之前,我也是只会用if...else语句.那么现在看完这 ...
函数截流---js
<div id="show">0</div> <button id="btn">click</button> & ...
[转]Doing more with Outlook filter and SQL DASL syntax
本文转自:https://blogs.msdn.microsoft.com/andrewdelin/2005/05/10/doing-more-with-outlook-filter-and-sql- ...
剑指offer 11：变态跳台阶
题目描述一只青蛙一次可以跳上1级台阶,也可以跳上2级……它也可以跳上n级.求该青蛙跳上一个n级的台阶总共有多少种跳法. 解法:使用数学归纳法可得,跳n级台阶的跳法一共有f(n)=2n-1中,即本 ...
SqlServer中用@@IDENTITY取最新ID不准的问题
最近遇到了一个SqlServer中用@@IDENTITY取最新ID不准的问题,经过在网上的一番查找,找到了如下资料,略作记录:"一个网友问我一个关于@@IDENTITY的问题.他的数据库中有 ...
mysql综合性练习
题目描述设定有一个数据库,里面有4张表: 学生表(student) 课程表(course) 成绩表(score) 教师信息表(teacher) 表结构如下: 表一_学生表(student) 属性名 ...
BayaiM__linux双网卡绑定文档
BayaiM__linux双网卡绑定文档开门贱山:以下内容纯属原创,如有雷同,爱咋咋滴吧~~!!—————————————————————————————————————————— 1,备份网卡信息 ...
5-1可视化库Seabon-整体布局风格设置
In [1]: import seaborn as sns import numpy as np import matplotlib as mpl import matplotlib.pyplot a ...
Shell命令-搜索文件或目录之which、find
文件及内容处理 - which.find 1. which:查找二进制命令,按环境变量PATH路径查找 which命令的功能说明 which 命令用于查找文件.which 指令会在环境变量 $PATH ...
远程控制服务（SSH）之Windows远程登陆Linux主机
本篇blog同样介绍两种方式进行. 首先进行准备工作: 1.所用到的工具如下: (1) 装有Linux系统的VMware虚拟机*1 (2) 终端连接工具Xshell 6 2.将Wind ...

数据解析模块BeautifulSoup简单使用

一、准备环境：

二、beautifulsoup相关语法：

数据解析模块BeautifulSoup简单使用的更多相关文章

随机推荐

热门专题