04爬取拉勾网Python岗位分析报告

# 导入需要的包
import requests
import time,random
from openpyxl import Workbook
import pymysql.cursors
#@ 连接数据库；
# 这个是我本地上边运行的程序，用来获取代理服务器。
def get_proxy():
    try:
        PROXY_POOL_URL = 'http://localhost:5555/random'
        response = requests.get(PROXY_POOL_URL)
        print(response.text)
        if response.status_code == 200:
            return response.text
    except ConnectionError:
        return None
# 用来连接本地mysql，可以不连接，直接写入Excel中
def get_conn():
    """连接本地数据库"""
    # 定义要连接的主机IP，账号名称和密码，连接的数据库，编码等等
    conn = pymysql.connect(host = 'localhost',
                           user = 'root',
                           password = '123456',
                           db = 'python',
                           charset = 'utf8mb4',
                           cursorclass = pymysql.cursors.DictCursor)
    return conn
# 将数据写入到数据库中
def insert(conn,info):
    """数据写入数据库"""
    with conn.cursor() as cursor:
        sql = "INSERT INTO `python` (`companyShortName`, `companyFullName`, `industryField`, `companySize`, `salary`, `city`, `education`) VALUES (%s, %s, %s, %s, %s, %s, %s)"
        cursor.execute(sql, info)
    conn.commit()
# 获取当前网址的信息
def get_json(url,page,lang_name):
    """返回当前页面的信息列表"""
    data = {'first':'false','pn':page,'kd':lang_name}
    proxies = get_proxy()
    proxies = {
        "http": "http://" + proxies
    }
    json = ses.post(url,data,proxies = proxies).json()
    list_con = json['content']['positionResult']['result']
    info_list = []
    for i in list_con:
        info = []
        info.append(i.get('companyShortName','无')) # 公司名称
        info.append(i.get('companyFullName','无'))
        info.append(i.get('industryField','无'))
        info.append(i.get('companySize','无'))
        info.append(i.get('salary','无'))
        info.append(i.get('city','无'))
        info.append(i.get('education','无'))
        info_list.append(info)
    return info_list

def main():
    lang_name = 'python'
    wb = Workbook() # 打开Excel工作薄
    conn = get_conn()  # 建立数据库连接 不存放数据，注释此行
    for i in ['北京','上海','广州','深圳','杭州']: #五个城市
        page = 1
        wsl = wb.active
        wsl.title = lang_name
        url = 'https://www.lagou.com/jobs/positionAjax.json?city={}&needAddtionalResult=false'.format(i)
        while page < 2: # 每个城市30页信息
            info = get_json(url,page,lang_name)
            page += 1
            # time.sleep(random.randint(10,20))
            for row in info:
                # 插入数据库，若不想存入 注释此行
                insert(conn,tuple(row))
                wsl.append(row)
    # 关闭数据库连接，不存放数据，注释此行
    conn.close()
    wb.save('{}职位信息.xlsx'.format(lang_name))

if __name__ == "__main__":
    my_headers = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.119 Safari/537.36",
    "Referer": "https://www.lagou.com/jobs/list_Python?city=%E5%85%A8%E5%9B%BD&cl=false&fromSearch=true&labelWords=&suginput=",
    "Content-Type": "application/x-www-form-urlencoded;charset = UTF-8"
    }
    # time.sleep(5)
    ses = requests.session()  # 获取 session
    ses.headers.update(my_headers)  # 更新
    ses.get(
        "https://www.lagou.com/jobs/list_python?city=%E5%85%A8%E5%9B%BD&cl=false&fromSearch=true&labelWords=&suginput=")
    main()

04爬取拉勾网Python岗位分析报告的更多相关文章

爬取拉勾网python工程师的岗位信息并生成csv文件
转载自:https://www.cnblogs.com/sui776265233/p/11146969.html 代码写得很好,但是目前只看得懂前一部分一.爬取和分析相关依赖包 Python版本: ...
Python爬虫——Python 岗位分析报告
前两篇我们分别爬取了糗事百科和妹子图网站,学习了 Requests, Beautiful Soup 的基本使用.不过前两篇都是从静态 HTML 页面中来筛选出我们需要的信息.这一篇我们来学习下如何来获 ...
python爬取拉勾网数据并进行数据可视化
爬取拉勾网关于python职位相关的数据信息,并将爬取的数据已csv各式存入文件,然后对csv文件相关字段的数据进行清洗,并对数据可视化展示,包括柱状图展示.直方图展示.词云展示等并根据可视化的数据做 ...
[python] 常用正则表达式爬取网页信息及分析HTML标签总结【转】
[python] 常用正则表达式爬取网页信息及分析HTML标签总结转http://blog.csdn.net/Eastmount/article/details/51082253 标签: pytho ...
Python爬虫实战（一）使用urllib库爬取拉勾网数据
本笔记写于2020年2月4日.Python版本为3.7.4,编辑器是VS code 主要参考资料有: B站视频av44518113 Python官方文档 PS:如果笔记中有任何错误,欢迎在评论中指出, ...
爬取拉勾网招聘信息并使用xlwt存入Excel
xlwt 1.3.0 xlwt 文档 xlrd 1.1.0 python操作excel之xlrd 1.Python模块介绍 - xlwt ,什么是xlwt? Python语言中,写入Excel文件的扩 ...
Python3爬虫：（一）爬取拉勾网公司列表
人生苦短,我用Python 爬取原因:了解一下Python工程师在北上广等大中城市的薪资水平与入职前要求. Python3基础知识 requests,pyquery,openpyxl库的使用爬取前的 ...
python-scrapy爬虫框架爬取拉勾网招聘信息
本文实例为爬取拉勾网上的python相关的职位信息, 这些信息在职位详情页上, 如职位名, 薪资, 公司名等等. 分析思路分析查询结果页在拉勾网搜索框中搜索'python'关键字, 在浏览器地址栏 ...
node.js爬虫爬取拉勾网职位信息
简介用node.js写了一个简单的小爬虫,用来爬取拉勾网上的招聘信息,共爬取了北京.上海.广州.深圳.杭州.西安.成都7个城市的数据,分别以前端.PHP.java.c++.python.Androi ...

随机推荐

Vue组件篇——Vue3.0中使用高德地图
VUE-CLI 3.0 中配置高德地图在项目开发中,地图组件 1.首先,需要注册高德开放平台的账号,并在[应用管理]页面[创建新应用],为应用添加Key值高德开放平台:https://lbs.am ...
入门大数据---Kafka生产者详解
一.生产者发送消息的过程首先介绍一下 Kafka 生产者发送消息的过程: Kafka 会将发送消息包装为 ProducerRecord 对象, ProducerRecord 对象包含了目标主题和要发 ...
NOIp （on line）入门组 2020 总结
得分情况 : 估分: 100+30+30=160: 实际: 95+70+25=190: T1 : 题意: 有n块钱,买三种文具,分别为 a:7元.b:4元.c:3元,问怎么买能让n元钱全部用完,而且使 ...
JavaScript图形实例：再谈IFS生成图形
在“JavaScript图形实例:迭代函数系统生成图形”一文中,我们介绍了采用迭代函数系统(Iterated Function System,IFS)创建分形图案的一些实例.在该文中,仿射变换函数W的 ...
移动端Retina屏boder 1px显示为2px或3px的解决方法
我们在开发移动端web项目时经常遇到设置border:1px,但是显示的边框却为2px或是3px粗细,这是因为设备像素比devicePixelRatio为2或3引起的. 何为“设备像素比deviceP ...
安卓移动端line-height垂直居中出现偏移的原因，及解决方法
目前在移动端安卓手机上使用line-height属性,让它的值等于height,结果发现是不居中的.出现了一定位置的偏移情况,如果略微只有两三个像素差距是看不出来的. 左图中的字号是12px,右图中的 ...
12.Clear Flags属性与天空盒
选中Hierarchy面板的摄像机,然后在右侧Inspector面板的Clear Flags属性可以找到有如下选项, SkyBox:天空盒(默认效果,让场景看着有一个天空) Solid Color:固 ...
dotNetCore阅读源码-CreateDefaultBuilder及ConfigureWebHostDefaults内部
版本:DotNetCore 3.1 CreateDefaultBuilder内部源码: public static IHostBuilder CreateDefaultBuilder(string[] ...
day54 作业
编写代码,将当前日期按"2017-12-27 11:11 星期三"格式输出(提示:switch结构) var date = new Date() ymd = data.toLoca ...
Scala 基础（七）：Scala 运算符
1 算术运算符算术运算符(arithmetic)是对数值类型的变量进行运算的,在Scala程序中使用的非常多. 细节说明: 1)对于除号“/”,它的整数除和小数除是有区别的:整数之间做除法时,只保留 ...

04爬取拉勾网Python岗位分析报告

04爬取拉勾网Python岗位分析报告的更多相关文章

随机推荐

热门专题