python 爬取网页简单数据---以及详细解释用法

一、准备工作（找到所需网站，获取请求头，并用到请求头）

找到所需爬取的网站（这里举拉勾网的一些静态数据的获取）----------- https://www.lagou.com/zhaopin/Python/

请求头的作用：模拟真实用户进入网站浏览数据-----------headers={ 'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.90 Safari/537.36',}
r=requests.get("https://www.lagou.com/zhaopin/Python/",headers=headers)-------------------这两行就是模拟用户进入网站
找到数据所在网页的标签（html网页右键源代码查看即可）

　　假设这里的15k-25k是我们要的数据，右键查看按箭头查看即可-----例如这里是span标签class=''money''(可以点击下面的控制台查看money是什么属性，有的是id=“money”这样的)------具体得看html代码

准备工作完毕

二、代码演示：（开始爬取）

　　2.1如果爬取的数据乱码，可以加入这三句话，定义输出格式

import io

import sys

sys.stdout=io.TextIOWrapper(sys.stdout.buffer,encoding='gb18030')

　　2.2爬取职位等相关信息（完整代码)

import requests

import re

import itertools

from bs4 import BeautifulSoup

import io

import sys

sys.stdout=io.TextIOWrapper(sys.stdout.buffer,encoding='gb18030')

headers={ 'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.90 Safari/537.36',}-------------请求头

r=requests.get("https://www.lagou.com/zhaopin/Python/",headers=headers)---------------请求该网页

r.encoding=r.apparent_encoding

result=r.text------------------------------------------获取网页文档

bs=BeautifulSoup(result,'html.parser')

# soup.find_all(string=re.compile('python'))

li1=bs.find_all('h3')-------------------------------------------查找该页面所有h3标签

# len1=len(li1)

# for i in li1:-----------------------------------------------用来测试输出的内容

#     print(i.string)

li2=bs.find_all('em')

# len2=len(li2)

# for i in li2:--------------------------------------------用来测试输出的内容

#     print(i.string)

li3=bs.find_all('span',class_="money")

# len3=len(li3)

# for i in li3:

#     print(i.string)

li4=bs.find_all('div',class_="industry")

# len4=len(li4)

# for i in li4:

#     print(i.string)

print("职位:".ljust(15),"地点:".center(15),"薪水:".center(15),"需求:".rjust(15))

print("------------------------------------------------------------------------------------------------")

for li_1,li_2,li_3,li_4 in zip(li1,li2,li3,li4):--------------------------------------------------------------------------四个列表整合（每一行一个元素对应）

    print(li_1.string.ljust(15),li_2.string.center(15),li_3.string.center(15),li_4.string.rjust(15).strip())-------------strip()是用来去除字符串左右两边的空格（不然太长不好排版)

　　2.3运行结果

三、技术不是很难，但也很有用，不过这里得提醒一下（最好是将网页的html文档存放在本地，一直请求服务器是很不友好的行为哟！)

拓展：可以试着将数据存到txt文档或者excl表格中，更直观哟！

python 爬取网页简单数据---以及详细解释用法的更多相关文章

如何使用python爬取网页动态数据
我们在使用python爬取网页数据的时候,会遇到页面的数据是通过js脚本动态加载的情况,这时候我们就得模拟接口请求信息,根据接口返回结果来获取我们想要的数据. 以某电影网站为例:我们要获取到电影名称以 ...
python爬取网页的通用代码框架
python爬取网页的通用代码框架: def getHTMLText(url):#参数code缺省值为‘utf-8’(编码方式) try: r=requests.get(url,timeout=30) ...
Python爬取网页信息
Python爬取网页信息的步骤以爬取英文名字网站(https://nameberry.com/)中每个名字的评论内容,包括英文名,用户名,评论的时间和评论的内容为例. 1.确认网址在浏览器中输入初 ...
利用Python爬取朋友圈数据，爬到你开始怀疑人生
人生最难的事是自我认知,用Python爬取朋友圈数据,让我们重新审视自己,审视我们周围的圈子. 文:朱元禄(@数据分析-jacky) 哲学的两大问题:1.我是谁?2.我们从哪里来? 本文 jacky试 ...
python爬取股票最新数据并用excel绘制树状图
大家好,最近大A的白马股们简直跌妈不认,作为重仓了抱团白马股基金的养鸡少年,每日那是一个以泪洗面啊. 不过从金融界最近一个交易日的大盘云图来看,其实很多中小股还是红色滴,绿的都是白马股们. 以下截图 ...
Python爬取招聘网站数据，给学习、求职一点参考
1.项目背景随着科技的飞速发展,数据呈现爆发式的增长,任何人都摆脱不了与数据打交道,社会对于“数据”方面的人才需求也在不断增大.因此了解当下企业究竟需要招聘什么样的人才?需要什么样的技能?不管是对于 ...
Python 爬取热词并进行分类数据分析-[解释修复+热词引用]
日期:2020.02.02 博客期:141 星期日 [本博客的代码如若要使用,请在下方评论区留言,之后再用(就是跟我说一声)] 所有相关跳转: a.[简单准备] b.[云图制作+数据导入] c.[拓扑 ...
使用 Python 爬取网页数据
1. 使用 urllib.request 获取网页 urllib 是 Python 內建的 HTTP 库, 使用 urllib 可以只需要很简单的步骤就能高效采集数据; 配合 Beautiful 等 ...
python爬取拉勾网职位数据
今天写的这篇文章是关于python爬虫简单的一个使用,选取的爬取对象是著名的招聘网站--拉钩网,由于和大家的职业息息相关,所以爬取拉钩的数据进行分析,对于职业规划和求职时的信息提供有很大的帮助. 完成 ...

随机推荐

基于vue-cli、elementUI的Vue超简单入门小例子
- 这个例子还是比较简单的,独立完成后,能大概知道vue是干嘛的,可以写个todoList的小例子. - 开始写例子之前,先对环境的部署做点简单的介绍,其实和Vue官方的差不多. #如若没有安装过vu ...
python正则表达式贪婪算法与非贪婪算法与正则表达式子模式的简单应用
先引入一下百度百科对于正则表达式的概念: 正则表达式是对字符串操作的一种逻辑公式,就是用事先定义好的一些特定字符.及这些特定字符的组合,组成一个“规则字符串”,这个“规则字符串”用来表达对字符串的一种 ...
SpringBoot2+Netty打造通俗简版RPC通信框架(升级版)
背景上篇文章我简单的介绍了自己打造的通俗简版RPC通信框架,这篇是对简版的增强~ 如果大家对此项目还感兴趣的话,可到码云上瞄瞄:Netty-RPC 上 ...
WKWebView针对于Cordova的IOS平台性能提升
使用cordova做跨平台开发已久,针对于Android的性能与页面渲染问题仍然让人头疼,因为仍然有一部分人使用性能一般的手机,版本在 4.2-4.4之间,甚至都无法支持HTML5的flex布局,使得 ...
第二篇 python进阶
目录第二篇 python进阶一数字类型内置方法二字符串类型内置方法三列表类型内置方法(list) 四元组类型内置方法(tuple) 五字典内置方法六集合类型内置方法(self) ...
C语言入门-结构类型
一.声明结构类型 #include <stdio.h> int main(int argc, char const *argv[]) { // 声明结构类型 struct date { i ...
MySQL 拿 WebShell
两种常规方法利用 MySQL getshell 的方法: select … into outfile general_log 一.select … into outfile 介绍利用需要满足以下条件 ...
代码审计-DedeCMS-V5.7前台任意用户密码重置
0x01 漏洞影响该漏洞允许攻击者修改任意前台用户密码. 0x02 漏洞利用条件 1,开启会员模块 2,攻击者拥有一个正常的会员账号 3,目标没有设置安全问题 0x03 漏洞分析漏洞文件:/mem ...
ubuntu16.04安装zlib
sudo apt-get install zlib1g-dev 下载:libzip-1.0.1.tar.gztar zxcv libzip-1.0.1.tar.gzcd libzip-1.0.1./c ...
c++异常处理的方法
c++异常处理程序运行时常会碰到一些异常情况,例如:做除法的时候除数为 0:用户输入年龄时输入了一个负数:用 new 运算符动态分配空间时,空间不够导致无法分配:访问数组元素时,下标越界:打开文件读 ...

python 爬取网页简单数据---以及详细解释用法

一、准备工作（找到所需网站，获取请求头，并用到请求头）

二、代码演示：（开始爬取）

2.1如果爬取的数据乱码，可以加入这三句话，定义输出格式

2.2爬取职位等相关信息（完整代码)

2.3运行结果

三、技术不是很难，但也很有用，不过这里得提醒一下（最好是将网页的html文档存放在本地，一直请求服务器是很不友好的行为哟！)

python 爬取网页简单数据---以及详细解释用法的更多相关文章

随机推荐

热门专题

　　2.1如果爬取的数据乱码，可以加入这三句话，定义输出格式

　　2.2爬取职位等相关信息（完整代码)

　　2.3运行结果