bs4笔记

1、网页输出乱码的解决办法

r= requests.get('https://www.baidu.com/')

r.encoding = 'gbk2312' #有可能 gbk、utf-8

soup=BeautifulSoup(r.text,"html.parser")

来源:https://blog.csdn.net/w839687571/article/details/81414433

2、打开本地html的方法

import requests
from bs4 import BeautifulSoup
import io

path = '/Users/lucax/Desktop/素材/html/123.html'
htmlfile = io.open(path, 'r', encoding='utf-8')
htmlhandle = htmlfile.read()
soup = BeautifulSoup(htmlhandle, "html.parser")
print soup

2-1、自己输入文字再输出的方法

markup = "<b></b>"
soup = BeautifulSoup(markup)
comment = soup.b.string #输出里面的字符

soup.prettify() #套上html框架加入markup的文案输出

3、各种拿网页元素的方法

soup.title --获取网页title

soup.title.name --获取title标签的标签文案

soup.title.string --获取title标签里面的文案 string 和 text 用法的区别 https://www.cnblogs.com/kaibindirver/p/11374669.html

soup.strings --获取网页所有文案，每个文案分别放入到数组里，但只能使用for循环展示出来

soup.stripped_strings ---(接着strings取出的内容)可以把空格和换行符去掉

soup.p --获取网页的p标签

soup.a --获取网页的a标签

soup.find_all('a') --获取网页所有的a标签

soup.find(id='link3') --获取id=link3的标签

soup.find('a',id='link2') --获取 a 标签且 id=link2 的标签

soup.get_text() --获取网页中所有文字内容

soup.text.encode('utf-8') --获取网页中所有文字内容另外一种写法

soup.text --获取网页中所有文字内容另外一种写法

4、标签内属性、值、标签名操作的方法

soup.p['class'] -获取标签里面的属性对应的值

soup.p.get('class') -获取标签里面的属性对应的值,另一种写法

soup.p.attrs --获取p标签所有的属性和值(字典形式输出)

soup.a.name='新的标签' --修改网页里面a标签的标签为'新的标签'

soup.p['class']='123' --修改属性的值

del soup.p['class'] --删除属性

5、替换文案的操作方法

soup.div.find('div',id="site_nav_top").replace_with("No longer bold") --替换整个标签的方法

soup.div.find('div',id="site_nav_top").string.replace_with("No longer bold") --替换标签内文案的方法

6、把tag内的子节点已列表形式输出 .contents 属性

head_tag = soup.head
head_tag
# <head><title>The Dormouse's story</title></head>

head_tag.contents
[<title>The Dormouse's story</title>]

title_tag = head_tag.contents[0]
title_tag
# <title>The Dormouse's story</title>
title_tag.contents
# [u'The Dormouse's story']

7.获取网页所有标签内文字

soup.strings

stripped_strings 过滤空格的方法

用法

for string in soup.strings:

print string

8、搜索有特定属性的标签的方法

9\获取tr标签内多个td标签，其中一个td标签里面em标签的写法

bs4笔记的更多相关文章

Python爬虫常用模块，BeautifulSoup笔记
import urllib import urllib.request as request import re from bs4 import * #url = 'http://zh.house.q ...
商业爬虫学习笔记day7-------解析方法之bs4
一.Beautiful Soup 1.简介 Beautiful Soup 是python的一个库,最主要的功能是从网页抓取数据.其特点如下(这三个特点正是bs强大的原因,来自官方手册) a. Beau ...
机器学习实战笔记(Python实现)-08-线性回归
--------------------------------------------------------------------------------------- 本系列文章为<机器 ...
爬虫笔记(四)------关于BeautifulSoup4解析器与编码
前言:本机环境配置:ubuntu 14.10,python 2.7,BeautifulSoup4 一.解析器概述如同前几章笔记,当我们输入: soup=BeautifulSoup(response. ...
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容 Beautiful Soup 是用Python写的一个HTML/XML的解析器,它可以很好的处理不规范标记并生成剖 ...
笔记之Python网络数据采集
笔记之Python网络数据采集非原创即采集一念清净, 烈焰成池, 一念觉醒, 方登彼岸网络数据采集, 无非就是写一个自动化程序向网络服务器请求数据, 再对数据进行解析, 提取需要的信息通常, ...
python笔记之提取网页中的超链接
python笔记之提取网页中的超链接对于提取网页中的超链接,先把网页内容读取出来,然后用beautifulsoup来解析是比较方便的.但是我发现一个问题,如果直接提取a标签的href,就会包含jav ...
<Python Text Processing with NLTK 2.0 Cookbook>代码笔记
如下是<Python Text Processing with NLTK 2.0 Cookbook>一书部分章节的代码笔记. Tokenizing text into sentences ...
python爬虫基础_requests和bs4
这些都是笔记,还缺少详细整理,后续会更新. 下面这种方式,属于入门阶段,手动成分比较多. 首先安装必要组件: pip3 install requests pip3 install beautifuls ...

随机推荐

inux中查看各文件夹大小命令：du -h --max-depth=1
du [-abcDhHklmsSx] [-L <符号连接>][-X <文件>][--block-size][--exclude=<目录或文件>] [--max-de ...
WebRequest与WebResponse抽象类，DNS静态类、Ping类
一.概述 1.WebRequest: 对统一资源标识符 (URI) 发出请求. 这是一个 abstract 类. WebRequest的派生类:PackWebRequest.FileWebReques ...
CentOS7安装Ambari2.7.4过程【离线安装】
先配置免密码登录修改所有结点的host 192.168.210.133 node1 192.168.210.134 node2 192.168.210.135 node3 192.168.210.1 ...
HDU 6154 - CaoHaha's staff | 2017 中国大学生程序设计竞赛 - 网络选拔赛
/* HDU 6154 - CaoHaha's staff [ 构造,贪心 ] | 2017 中国大学生程序设计竞赛 - 网络选拔赛题意: 整点图,每条线只能连每个方格的边或者对角线问面积大于n的 ...
牛客练习赛53 (C 富豪凯匹配串) bitset
没想到直接拿 bitset 能过 $10^8$~ code: #include <bits/stdc++.h> #define N 1004 #define setIO(s) freope ...
C++基础--if/else和switch/case的区别
if和switch的区别: 一.语句的格式: if/else的写法格式如下: int nA, nB; scanf_s("%d", &nA); //输入整数并赋值给变量a s ...
pat 甲级 1064 ( Complete Binary Search Tree ) (数据结构)
1064 Complete Binary Search Tree (30 分) A Binary Search Tree (BST) is recursively defined as a binar ...
Break Standard Weight （ZOJ 3706）
Problem The balance was the first mass measuring instrument invented. In its traditional form, it co ...
数据结构实验之数组一：矩阵转置（SDUT 2130）
Problem Description 数组--矩阵的转置给定一个m*n的矩阵(m,n<=100),求该矩阵的转置矩阵并输出. Input 输入包含多组测试数据,每组测试数据格式如下: 第一行 ...
C# http请求工具类
/// <summary> /// Http请求操作类之HttpWebRequest /// </summary> public class HttpHelper { #reg ...

bs4笔记

bs4笔记的更多相关文章

随机推荐

热门专题