用requests爬取一个招聘网站

import requests
import re

session = requests.session()
第一步：访问登陆页，拿到X_Anti_Forge_Token，X_Anti_Forge_Code

# 1、请求url:https://passport.lagou.com/login/login.html
# 2、请求方法:GET  因为是get请求不需要请求体
# 3、请求头:User-agent

代码如下：

r1 = session.get('https://passport.lagou.com/login/login.html',

                 headers={

                     'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

                 },

                 )

X_Anti_Forge_Token = re.findall("X_Anti_Forge_Token = '(.*?)'", r1.text, re.S)[0]   #正则表达式获取的值是一个列表

X_Anti_Forge_Code = re.findall("X_Anti_Forge_Code = '(.*?)'", r1.text, re.S)[0]

第二步：登陆

# 1、请求url:https://passport.lagou.com/login/login.json
# 2、请求方法:POST
# 3、请求头:包含：cookie,User-agent，Referer,X-Anit-Forge-Code,X-Anit-Forge-Token
# 4、请求体包含如下：

# isValidate:true
# username:18611453110
# password:70621c64832c4d4d66a47be6150b4a8e
# request_form_verifyCode:''
# submit:''
代码如下：

r2 = session.post('https://passport.lagou.com/login/login.json',

                  headers={

                      'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

                      'Referer': 'https://passport.lagou.com/login/login.html',

                      'X-Anit-Forge-Code': X_Anti_Forge_Code,

                      'X-Anit-Forge-Token': X_Anti_Forge_Token,

                      'X-Requested-With': 'XMLHttpRequest'

                  },

                  data={

                      "isValidate": True,

                      'username': '',#这是登陆的用户名，

                      'password': '70621c64832c4d4d66a47be6150b4a8e',#这是加密的密码

                      'request_form_verifyCode': '',

                      'submit': ''

                  }

                  )

第三步：授权

 1、请求url:https://passport.lagou.com/grantServiceTicket/grant.html
# 2、请求方法:GET
# 3、请求头:包含：User-agent,Referer

r3 = session.get('https://passport.lagou.com/grantServiceTicket/grant.html',

                 headers={

                     'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

                     'Referer': 'https://passport.lagou.com/login/login.html',

                 }

                 )

第四步：验证是登陆成功：

r4 = session.get('https://www.lagou.com/resume/myresume.html',

                 headers={

                     'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

                 }

                 )

# print('18611453110' in r4.text)#验证是否登陆成功

第五步：筛选职位信息

# 请求url：https://www.lagou.com/jobs/list_java%E9%AB%98%E7%BA%A7%E5%BC%80%E5%8F%91
# 请求方法：GET
# 请求头：
# User-Agent
# 请求参数：
# gj:3年及以下
# px:default
# yx:25k-50k
# city:北京

from urllib.parse import urlencode

res = urlencode({'k': 'java高级开发'}, encoding='utf-8').split('=')[-1]

url = 'https://www.lagou.com/jobs/list_' + res

# r5 = session.get(url,

#                  headers={

#                      'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

#                  },

#                  params={

#                      'gj': '3年及以下',

#                      'px': 'default',

#                      'yx': '25k-50k',

#                      'city': '北京'

#                  }

#                  )

#

# print(r5.text)

没有取到数据，因为数据是通过ajax发送的，所以我们换另一种方法解决：

#请求url：https://www.lagou.com/jobs/positionAjax.json
#请求方法：POST
#请求头
#    Referer
#    User-Agent
#请求体：
    # first:true
    # pn:1
    # kd:java高级开发
#请求参数
# params={
#      'gj': '3年及以下',
#      'px': 'default',
#      'yx': '25k-50k',
#      'city': '北京',
#     'needAddtionalResult':False,
#     'isSchoolJob':0
# }

r6=session.post('https://www.lagou.com/jobs/positionAjax.json',

             headers={

                    'Referer':url,

                     'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

             },

             data={

                 'first':True,

                 'pn':1,

                 'kd':'java高级开发'

             },

             params={

                 'gj': '3年及以下',

                 'px': 'default',

                 'yx': '25k-50k',

                 'city': '北京',

                 'needAddtionalResult': False,

                 'isSchoolJob': 0

             }

             )

comapines_list=r6.json()['content']['positionResult']['result']

for comapiny in comapines_list:

    positionId=comapiny['positionId']

    company_link='https://www.lagou.com/jobs/{pos_id}.html'.format(pos_id=positionId)

    companyShortName = comapiny['companyShortName']

    positionName = comapiny['positionName']

    salary = comapiny['salary']

    print('''

    详情连接:%s

    公司名：%s

    职位名：%s

    薪资：%s

    ''' %(company_link,companyShortName,positionName,salary))

#第七步：访问详情页，拿到X_Anti_Forge_Token，X_Anti_Forge_Code
# 请求url：详情页地址
# 请求方式：GET
# 请求头：User-Agent

 r7=session.get(company_link,

                headers={

                    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

                }

                )

    X_Anti_Forge_Token = re.findall("X_Anti_Forge_Token = '(.*?)'", r7.text, re.S)[0]

    X_Anti_Forge_Code = re.findall("X_Anti_Forge_Code = '(.*?)'", r7.text, re.S)[0]

#第八步：投递简历
#请求url：https://www.lagou.com/mycenterDelay/deliverResumeBeforce.json
#请求方式：POST
#请求头：
    #Referer:详情页地址
    #User-agent
    #X-Anit-Forge-Code:53165984
    #X-Anit-Forge-Token:3b6a2f62-80f0-428b-8efb-ef72fc100d78
    #X-Requested-With:XMLHttpRequest
#请求体：
# positionId:职位ID
# type:1
# force:true

   session.post('https://www.lagou.com/mycenterDelay/deliverResumeBeforce.json',

                 headers={

                     'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',

                     'Referer': company_link,

                     'X-Anit-Forge-Code': X_Anti_Forge_Code,

                     'X-Anit-Forge-Token': X_Anti_Forge_Token,

                     'X-Requested-With': 'XMLHttpRequest'

                 },

                 data={

    'positionId':positionId,

    'type':1,

    'force':True

                 }

                 )

    print('%s 投递成功' %(companyShortName))

第7步，8步是并列的，放在第六步的里面。
第六步找到一个公司，进入详情页，然后投递简历。

用requests爬取一个招聘网站的更多相关文章

利用python实现爬虫爬取某招聘网站，北京地区岗位名称包含某关键字的所有岗位平均月薪
#通过输入的关键字,爬取北京地区某岗位的平均月薪 # -*- coding: utf-8 -*- import re import requests import time import lxml.h ...
Python使用requests爬取一个网页并保存
#导入 requests模块import requests #设置请求头,让网站监测是浏览器 headers = { 'user-agent': 'Mozilla/5.0 (Windows NT 6. ...
python-scrapy爬取某招聘网站信息(一)
首先准备python3+scrapy+mysql+pycharm... 这次我们选择爬取智联招聘网站的企业招聘信息,首先我们有针对的查看网站的html源码,发现其使用的是js异步加载的方式,直接从服务 ...
python-scrapy爬取某招聘网站(二)
首先要准备python3+scrapy+pycharm 一.首先让我们了解一下网站拉勾网https://www.lagou.com/ 和Boss直聘类似的网址设计方式,与智联招聘不同,它采用普通的页 ...
爬取拉勾网招聘信息并使用xlwt存入Excel
xlwt 1.3.0 xlwt 文档 xlrd 1.1.0 python操作excel之xlrd 1.Python模块介绍 - xlwt ,什么是xlwt? Python语言中,写入Excel文件的扩 ...
网络爬虫之scrapy爬取某招聘网手机APP发布信息
1 引言过段时间要开始找新工作了,爬取一些岗位信息来分析一下吧.目前主流的招聘网站包括前程无忧.智联.BOSS直聘.拉勾等等.有段时间时间没爬取手机APP了,这次写一个爬虫爬取前程无忧手机APP岗位 ...
[Python]爬取游民星空网站每周精选壁纸（1080高清壁纸）网络爬虫
一.检查首先进入该网站的https://www.gamersky.com/robots.txt页面给出提示: 弹出错误页面注: 网络爬虫:自动或人工识别robots.txt,再进行内容爬取约束 ...
Python 爬取所有51VOA网站的Learn a words文本及mp3音频
Python 爬取所有51VOA网站的Learn a words文本及mp3音频 #!/usr/bin/env python # -*- coding: utf-8 -*- #Python 爬取所有5 ...
Python开发爬虫之BeautifulSoup解析网页篇：爬取安居客网站上北京二手房数据
目标:爬取安居客网站上前10页北京二手房的数据,包括二手房源的名称.价格.几室几厅.大小.建造年份.联系人.地址.标签等. 网址为:https://beijing.anjuke.com/sale/ B ...

随机推荐

基于vue2.0实现仿百度前端分页效果（一）
前言最近在接手一个后台管理项目的时候,由于之前是使用jquery+bootstrap做的,后端使用php yii框架,前后端耦合在一起,所以接手过来之后通过vue进行改造,但依然继续使用的boots ...
Java进阶之JDBC
一.相关概念 1.什么是JDBC JDBC(Java Data Base Connectivity,java数据库连接)是一种用于执行SQL语句的Java API,可以为多种关系数据库提供统一访问,它 ...
#13 让代码变得Pythonic
前言在学习Python的过程中,肯定听说过这么一个词:Pythonic,它的意思是让你的代码很Python! 一.列表生成式前面有一节专门讲解了Python的列表,其灵活的使用方法一定让你陶醉其中 ...
Linux卸载搭建环境
本章内容卸载Apache PHP MySQL 卸载Apache 查看apache安装版本 $ apachectl -v 查看安装httpd相关软件包(红色部分) sudo yum list inst ...
Spring之Bean的配置方式
在博客中为了演示容器Bean实例化时暴露出的几个接口,将UserBean配置在XML中,其实常见的Bean的配置有3种.1.基于xml配置Bean 2.使用注解定义Bean 3.基于java类提供Be ...
[转]C#利用反射实现两个类的对象之间相同属性的值的复制
本文转自:https://blog.csdn.net/u013093547/article/details/53584591 在使用c#进行程序编写时,会遇到一个问题,两个属性字段差不多相同的类要进行 ...
SQL SERVER 数据库面试题
1.用一条SQL语句查询出每门课都大于80分的学生姓名 name kecheng fenshu 张三语文 81张三数学 75李四语文 ...
C# 常用的加密代码参考
1.MD5加密 public static string EncryptString(string source) { string result; if (source == string.Empt ...
Ansible--配置文件及系列命令
Ansible目录结构安装完成ansible后要知道ansible主要安装的了什么,安装的目录结构是什么,每个目录做什么的可以使用:rpm -ql ansible | less 来查看ansibl ...
基于InfluxDB实现分页查询功能
InfluxDB作为时序数据库中的翘楚,应用范围非常广泛,尤其在监控领域. 最近做了一个功能,将InfluxDB中的数据查询出来后,在前台分页展现,比如每页10条,一共100页,可以查看首页.末页,进 ...

用requests爬取一个招聘网站

用requests爬取一个招聘网站的更多相关文章

随机推荐

热门专题