[Python] 前程无忧招聘网爬取软件工程职位网络爬虫 https://www.51job.com

首先进入该网站的https://www.51job.com/robots.txt页面

给出提示：

 找不到该页       File not found

 您要查看的页已删除，或已改名，或暂时不可用。

 请尝试以下操作:

 如果您已经在地址栏中输入该网页的地址，请确认其拼写正确。

 打开 www.51job.com 主页，然后查找指向您感兴趣信息的链接。

 单击后退按钮，尝试其他链接。

　　注：

网络爬虫：自动或人工识别robots.txt，再进行内容爬取
约束性:robots协议建议但非约束性，不遵守可能存在法律风险

如果一个网站不设置robots协议说明所有内容都可以爬取，所以为可爬取内容。

源程序如下：

 #!/usr/bin/env python

 # -*- coding: utf-8 -*-

 # @File  : HtmlParser.py

 # @Author: 赵路仓

 # @Date  : 2020/2/28

 # @Desc  : 前程无忧求职网的爬虫程序

 # @Contact : 398333404@qq.com

 from bs4 import BeautifulSoup

 import requests

 import csv

 import re

 import io

 # 请求头

 head = {

     'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/77.0.3865.90 Safari/537.36'

 }

 # 链接

 url = "https://search.51job.com/list/000000,000000,0000,00,9,99,%25E8%25BD%25AF%25E4%25BB%25B6,2,1.html?lang=c&postchannel=0000&workyear=99&cotype=99&degreefrom=99&jobterm=99&companysize=99&ord_field=0&dibiaoid=0&line=&welfare="

 # csv写入表头

 def headcsv():

     with open('/position.csv', 'w', encoding='utf-8', newline='') as csvfile:

         writer = csv.writer(csvfile)

         writer.writerow(["职位", "公司", "所在地", "薪酬", "日期", "网址"])

 # txt写入表头

 def headtxt():

     ftxt = open('E:/data/position.txt', 'w', encoding='utf-8')

     ftxt.write("职位 公司 所在地 薪酬 日期 网址")

     ftxt.close()

 def position(url, head):

     # fcsv = open('/position.csv', 'a', encoding='utf-8', newline='')

     ftxt = open('E:/data/position.txt', 'a', encoding='utf-8')

     try:

         r = requests.get(url, headers=head, timeout=3)

         # 设置解析编码格式

         r.encoding = r.apparent_encoding

         print(r.apparent_encoding)

         # 打印状态码

         print(r.status_code)

         # 打印页面代码

         # print(r.text)

         # print(soup.prettify())

         text = r.text

         soup = BeautifulSoup(text, 'html.parser')

         # 一条招聘信息

         item = soup.find_all(class_='el', recursive=True)

         num = 0

         for i in item:

             num += 1

             if num > 16:

                 itemdetail = i.text.replace(" ", "").replace("\n", " ").replace("   ", " ").lstrip() + i.find("a").attrs['href']

                 print(itemdetail)

                 ftxt.write(itemdetail.replace("\n","")+'\r')

                 print("写入成功")

         ftxt.close()

     except:

         print("爬取职位过程中出错！")

 def write(url, head):

     for i in range(1, 2000):

         url = "https://search.51job.com/list/000000,000000,0000,00,9,99,%25E8%25BD%25AF%25E4%25BB%25B6,2,"+str(i)+".html?lang=c&postchannel=0000&workyear=99&cotype=99&degreefrom=99&jobterm=99&companysize=99&ord_field=0&dibiaoid=0&line=&welfare="

         print(url)

         position(url, head)

 if __name__ == "__main__":

     # head()

     write(url, head)

所爬取条目分布为职位公司所在地薪酬日期网址，保存路径为E:/data/position.txt可自行修改路径或者文件格式。

[Python] 前程无忧招聘网爬取软件工程职位网络爬虫 https://www.51job.com的更多相关文章

python 手机app数据爬取
目录一:爬取主要流程简述二:抓包工具Charles 1.Charles的使用 2.安装 (1)安装链接 (2)须知 (3)安装后 3.证书配置 (1)证书配置说明 (2)windows系统安装证书 ...
【图文详解】scrapy爬虫与动态页面——爬取拉勾网职位信息（2）
上次挖了一个坑,今天终于填上了,还记得之前我们做的拉勾爬虫吗?那时我们实现了一页的爬取,今天让我们再接再厉,实现多页爬取,顺便实现职位和公司的关键词搜索功能. 之前的内容就不再介绍了,不熟悉的请一定要 ...
[爬虫]用python的requests模块爬取糗事百科段子
虽然Python的标准库中 urllib2 模块已经包含了平常我们使用的大多数功能,但是它的 API 使用起来让人感觉不太好,而 Requests 自称 “HTTP for Humans”,说明使用更 ...
python爬取拉勾网职位数据
今天写的这篇文章是关于python爬虫简单的一个使用,选取的爬取对象是著名的招聘网站--拉钩网,由于和大家的职业息息相关,所以爬取拉钩的数据进行分析,对于职业规划和求职时的信息提供有很大的帮助. 完成 ...
Python 招聘信息爬取及可视化
自学python的大四狗发现校招招python的屈指可数,全是C++.Java.PHP,但看了下社招岗位还是有的.于是为了更加确定有多少可能找到工作,就用python写了个爬虫爬取招聘信息,数据处理, ...
Python的scrapy之爬取51job网站的职位
今天老师讲解了Python中的爬虫框架--scrapy,然后带领我们做了一个小爬虫--爬取51job网的职位信息,并且保存到数据库中用的是Python3.6 pycharm编辑器爬虫主体: im ...
Python的scrapy之爬取顶点小说网的所有小说
闲来无事用Python的scrapy框架练练手,爬取顶点小说网的所有小说的详细信息. 看一下网页的构造: tr标签里面的 td 使我们所要爬取的信息下面是我们要爬取的二级页面小说的简介信息: 下面 ...
python网络爬虫之解析网页的XPath(爬取Path职位信息)[三]
目录前言 XPath的使用方法 XPath爬取数据后言 @(目录) 前言本章同样是解析网页,不过使用的解析技术为XPath. 相对于之前的BeautifulSoup,我感觉还行,也是一个比较常用 ...
python爬虫（三）用request爬取拉勾网职位信息
request.Request类如果想要在请求的时候添加一个请求头(增加请求头的原因是,如果不加请求头,那么在我们爬取得时候,可能会被限制),那么就必须使用request.Request类来实现,比 ...

随机推荐

基于 H5 和 webGL 的 3d 智慧城市
前言中共中央.国务院在今年12月印发了<长江三角洲区域一体化发展规划纲要>(下文简称<纲要>),并发出通知,要求各地区各部门结合实际认真贯彻落实. <纲要>强调, ...
非常NB的一款快捷启动软件--Merry
Merry 被设计为了能将日常重复性操作简化为一个快捷键或者命令.Merry 采用完全开放的体系, 可以使用 Lua 或者外部程序来扩展 Merry 的功能. 另附一个自己扩展的LUA脚本: --启动 ...
supervisor管理tomcat
操作目的:用supervisor工具管理tomcat服务配置环境,安装服务,以及多实例脚本编辑: 前提机器的opt目录下必须有jdk-8u131-linux-x64_.rpm 以及apache- ...
Mysql 安装出现error Nr.1045
我们在windows下安装mysql时会出现Access denied for user 'root'@localhost'(using password:No)的问题,这个问题是因为你的机器上之前安 ...
eclipse运行python 安装pydev 版本匹配问题
Eclipse 4.5, Java 8: PyDev 5.2.0 PyDev 5.2.0 版本路径:https://dl.bintray.com/fabioz/pydev/5.2.0 1.安装时注意: ...
[Python]逻辑运算符 and or
复习老男孩全栈二期视频的时候圆号老师测试的用例两个集合and 和or操作的时候的问题 >>> a = set("what") >>> b = ...
JVM垃圾回收机制和常用算法
由于疫情的原因,所以目前一直在家远程办公,所以很多时间在刷面试题,发现2019大厂的面试虽然种类很多,但是总结了一下发现主要是这几点:算法和数据结构. JVM.集合.多线程.数据库这几点在面试的时候比 ...
vs 搭配 Linux 开发
这是一篇翻译,为什么突然想翻译文章了呢,因为很多大佬们都说英语对程序员还是挺重要的,毕竟互联网的最新技术基本都在歪果仁那边,如果英语不好,不会看国外的文档的话,将会错失接触第一手资料的机会,失去很多先 ...
OFDM Modulation Scheme
Linux下安装 php imagick扩展
今天小编由于工作需求用到了 imagick 这个扩展服务器环境是 lnmp 架构下面稍微来介绍下这个东东 imagick是一个PHP的扩展,用ImageMagick提供的API来进行图片的创 ...

[Python] 前程无忧招聘网爬取软件工程职位 网络爬虫 https://www.51job.com

注：

[Python] 前程无忧招聘网爬取软件工程职位 网络爬虫 https://www.51job.com的更多相关文章

随机推荐

热门专题

[Python] 前程无忧招聘网爬取软件工程职位网络爬虫 https://www.51job.com

　　注：

[Python] 前程无忧招聘网爬取软件工程职位网络爬虫 https://www.51job.com的更多相关文章