第三模块的下载、requests模块、openpyxl模块

第三方模块的下载安装
下载第三模块的方式
针对下载第三模块时可能会出现的问题
网络爬虫模块之requests模块
自动化办公领域之openpyxl模块

第三方模块的下载安装

第三方模块：别人写的模块 一般情况下都特别强大

我们如果想使用第三方模块 第一次必须先下载后面才可以反复使用(等同于内置模块)

下载第三模块的方式

1.pip工具

	注意每一个解释器都有pip工具 如果我们的电脑有多个版本的解释器那么我们在使用pip的时候一定要注意到底用的是哪一个 否则极其任意出现使用的是A版本解释器用B版本的pip下载模块

为了避免匹配冲突 我们在使用的时候可以添加对应的版本号

    python27		pip2.7

    python36		pip3.6

    python38		pip3.8

下载第三方模块的句式

    pip install 模块名

下载第三方临时切换你仓库(为了将网速变快 因为默认的下载的地址是过国外的)

    pip install 模块名-i 仓库地址

下崽第三方模块指定版本(不指定默认是最新版)

    pip install 模块名==版本号-i 仓库地址

针对下载第三模块时可能会出现的问题

1.报错并有警告信息

	如：WARNIG: You are using pip version 20.2.1;

        原因是在于pip版本过低 只需要拷贝后面的命令执行更新操作即可

    如：d:\python38\python.exe -m pip install -- upgrade pip

        更新完成后再次执行下载第三方模块的命令即可

2.报错并含有timeout关键字

	说明当前计算机网络不稳定 只需要换网或者重新执行几次即可

3.报错并没有关键字

	面向百度搜索拷贝一些错误信息进行快速查询报错

4.下载速度很慢

	pip默认下载的是仓库地是国外的python.org

    我们可以切换下载的地址

    pip install 模块名-i 仓库地址

    pip的仓库地址有很多 百度查询即可:

         清华大学 ：https://pypi.tuna.tsinghua.edu.cn/simple/

		阿里云：http://mirrors.aliyun.com/pypi/simple/

		中国科学技术大学 ：http://pypi.mirrors.ustc.edu.cn/simple/

		华中科技大学：http://pypi.hustunique.com/

		豆瓣源：http://pypi.douban.com/simple/

		腾讯源：http://mirrors.cloud.tencent.com/pypi/simple

		华为镜像源：https://repo.huaweicloud.com/repository/pypi/simple/

2.pycharm提供的快捷方式

1.直接 import 导入模块名  根据pychram提示的红灯泡点击 install 安装就会自定进行下载

2.或者设置里下载

网络爬虫模块之requests模块

import requests

res = requests.get('http://www.redbull.com.cn/about/branch') # 朝指定网址发送请求获取页面数据(等价于：浏览器地址栏输入网址回车访问)

# print(res.content) # 获取bytes类似的网页数据(二进制)

# res.encoding = 'utf8'  # 指定编码

print(res.text) #获取字符串类型的网页数据(默认按照系统编码解码默认是utf8 且可以指定编码解码)

网络爬虫实战

import requests

import re

# 朝指定网址发送请求获取页面数据(等价于：浏览器地址栏输入网址回车访问)

# res = requests.get('http://www.redbull.com.cn/about/branch')

# print(res.content) # 获取bytes类似的网页数据(二进制)

# res.encoding = 'utf8'  # 指定编码

# print(res.text) #获取字符串类型的网页数据(默认按照系统编码解码默认是utf8 且可以指定编码解码)

res = requests.get('https://sh.lianjia.com/ershoufang/pudong/')

data = res.text

info_title = re.findall('a class="" href="https://sh.lianjia.com/.*?" target="_blank" data-log_index=".*?"  data-el="ershoufang" data-housecode=".*?" data-is_focus=".*?" data-sl="">(.*?)</a>', data)

# print(info)

info_add = re.findall('<div class="positionInfo"><span class="positionIcon"></span><a href="https://sh.lianjia.com/.*?/" target=".*?" data-log_index=".*?" data-el=".*?">(.*?)', data)

# print(info_add)

info_addd = re.findall('</a>   -  <a href="https://sh.lianjia.com/ershoufang/.*?/" target=".*?">(.*?)</a> </div>', data)

# print(info_addd)

info_data = re.findall('<div class="houseInfo"><span class="houseIcon"></span>(.*?)</div>', data)

# print(info_data)

info_pop = re.findall('<div class="followInfo"><span class="starIcon"></span>(.*?) / .*?</div>', data)

# print(info_pop)

info_price = re.findall('<span class="">(.*?)</span>', data)

info_money = re.findall('<div class="unitPrice" data-hid=".*?" data-rid=".*?" data-price=".*?"><span>(.*?)元/平</span></div>', data)

# print(info_money)

info = zip(info_title,info_add,info_addd,info_data,info_pop,info_price,info_money)

# 用openpyxl模块将爬取的数据写入到excel表格中

from openpyxl import Workbook

res = Workbook()

data = res.create_sheet('链家二手房', 0)

data.append(['房屋标题', '小区名称', '街道名称', '详细信息', '关注程度', '房屋总价', '房屋单价'])

for i in info:

    data.append(i)

res.save('SB.xlsx')

with open(r'a.txt', 'w', encoding='utf8') as f:

    for i in info:

        print("""

        房屋标题:%s

        小区名称:%s

        街道名称:%s

        详细信息:%s

        关注程度:%s

        房屋总价:%s

        房屋单价:%s

        """% i)

        f.write('''

        房屋标题:%s

        小区名称:%s

        街道名称:%s

        详细信息:%s

        关注程度:%s

        房屋总价:%s

        房屋单价:%s\n

        '''% i)

自动化办公领域之openpyxl模块

1.excel文件的后缀名问题

	03版本之前

    	.xls

     03版本之后

    	.xlsx

2.操作excel表格的第三方模块

	xlwt往表格中写入数据、wolrd从表格中读取数据

    	兼容所有版权的excel文件

    openpyxl最近几年比较火热的操作excel表格提供的模块

    	03版本之前的兼容性比较差

    (还有很多操作excel表格的模块 甚至涵盖了上述的模块>>>:pandas(是基于openpyxl的升级))

openpyxl操作之写入数据

# 学会看官方文档！Tutorial 教程

from openpyxl import Workbook

# 创建一个excel文件

bb = Workbook()

# 在文件中创建多个工作蒲

bb1 = bb.create_sheet('人员名单')

 bb2 = bb.create_sheet('物品名单')

 # 还可以修改默认工作蒲位置

bb3 = bb.create_sheet('废物名单', 0)  # 让工作蒲名废物名单放第一位

bb3.title = '咸鱼名单'

bb3.sheet_properties.tabColor = '1070BA' # 三基色

# 填写数据方式一

bb3['C5'] = '好嗨哟'

# # 填写方式二

 bb3.cell(row=2, column=3, value='好好学习')  # row行 column列 value值

# 填写数学公式

 bb3['A7'] = '=sum(A1:A4)'  # 等号不能忘

 bb3.append(['姓名', '年龄', '爱好', '身高'])  # 表头字段

bb3.append(['jason', 18, 'read', 190, 200])

bb3.append(['kevin', 23, 'look', 190])

 bb3.append(['oscar', 99, 'koko'])

# 保存该excel文件

bb.save(r'aaa.xlsx')   # 不能忘 excel表格及名称能不能创建主要看你

# 模块pandas

import pandas

data_dict = {

    "公司名称": comp_title_list,

    "公司地址": comp_address_list,

    "公司邮编": comp_email_list,

    "公司电话": comp_phone_list

}

# 将字典转换成pandas里面的DataFrame数据结构

df = pandas.DataFrame(data_dict)

# 直接保存成excel文件

df.to_excel(r'pd_comp_info.xlsx')

excel软件正常可以打开操作的数据集在10万左右 一旦数据集过大 软件操作几乎无效

需要使用代码操作>>>:pandas模块

"""

openpyxl操作之读取数据

# 一个excel表格中有多的工作蒲 再读取的时候需要指明

from openpyxl import load_workbook

# 指定读取的文件

变量名 = load_workbook(指定要读取文件的路径)

l2 = load_wrokbook(r'NB.xlsx')

# 查看内部所有的工作蒲名称

print(l2.sheetnames)

# 指定某个工作蒲相关操作

l3 = l2['咸鱼名单']

# 读取工作蒲相关操作

print(l3.max_row)  # 获取当前工作蒲含有数据的最大行数

print(l3.max_column)  # 获取当前工作蒲含有数据的最大列数

print(l3['A2'].value)  # 读取的是单元格内容如果单元格式公式读取出来的也是公式

练习

import requests

import re

url_l = 'https://sh.lianjia.com/ershoufang/pudong/pg%s/'

for i in range(1,11):

    url_now = url_l % i

    res = requests.get(url_now)

    # print(res.text)

    data = res.text

    home_title_list = re.findall(

        '<a class="" href=".*?" target="_blank" data-log_index=".*?"  data-el="ershoufang" data-housecode=".*?" data-is_focus="" data-sl="">(.*?)</a>',

        data)

    # print(home_title_list)

    home_name_list = re.findall('<a href=".*?" target="_blank" data-log_index=".*?" data-el="region">(.*?) </a>', data)

    # print(home_name_list)

    home_street_list = re.findall(

        '<div class="positionInfo"><span class="positionIcon"></span><a href=".*?" target="_blank" data-log_index=".*?" data-el="region">.*? </a>   -  <a href=".*?" target="_blank">(.*?)</a> </div>',

        data)

    # print(home_street_list)

    home_info_list = re.findall('<div class="houseInfo"><span class="houseIcon"></span>(.*?)</div>', data)

    # print(home_info_list)

    home_watch_list = re.findall('<div class="followInfo"><span class="starIcon"></span>(.*?)</div>', data)

    # print(home_watch_list)

    home_total_price_list = re.findall(

        '<div class="totalPrice totalPrice2"><i> </i><span class="">(.*?)</span><i>万</i></div>', data)

    # print(home_total_price_list)

    home_unit_price_list = re.findall(

        '<div class="unitPrice" data-hid=".*?" data-rid=".*?" data-price=".*?"><span>(.*?)</span></div>', data)

    # print(home_unit_price_list)

    home_data = zip(home_title_list, home_name_list, home_street_list, home_info_list, home_watch_list,

                    home_total_price_list, home_unit_price_list)

    with open(r'home_data.txt','a',encoding='utf8') as f:

        for data in home_data:

            print(

                """

                房屋标题:%s

                小区名称:%s

                街道名称:%s

                详细信息:%s

                关注程度:%s

                房屋总价:%s

                房屋单价:%s

                """%data

            )

            f.write("""

                    房屋标题:%s

                    小区名称:%s

                    街道名称:%s

                    详细信息:%s

                    关注程度:%s

                    房屋总价:%s

                    房屋单价:%s\n

                    """%data)

第三模块的下载、requests模块、openpyxl模块的更多相关文章

openpyxl模块
openpyxl模块可以对Excel表格进行操作的模块第三方模块需要下载 pip install openpyxl 配置永久第三方源: D:\Python36\Lib\site-packages\ ...
[Python]-openpyxl模块Excel数据处理-读取公式的结果
日常需要Python来处理各种数据,处理Excel数据常用的库一般有openpyxl.xlrd(读取).xlwt(写入). 经过对比发现openpyxl模块比较好用. openpyxl模块这篇笔记比 ...
Python基础之模块：5、第三方模块 requests模块 openpyxl模块
目录一.第三方模块的下载与使用 1.什么是第三方模块 2.如何安装第三方模块方式一:pip工具方式二:pycharm中下载 3.注意事项 1.报错并有警告信息 2.报错,提示关键字 3.报错,无 ...
第三十三节，sys解释器相关模块
首先要引入import sys模块 sys.argv 功能:获取向脚本文件传入的参数,返回的列表,列表里的第一个元素是脚本文件路径和名称,后面的元素是传入的向脚本传入的参数使用方法:sys.argv ...
浏览器行为模拟之requests、selenium模块
requests模块前言: 通常我们利用Python写一些WEB程序.webAPI部署在服务端,让客户端request,我们作为服务器端response数据: 但也可以反主为客利用Python的re ...
进程、数据共享、进程锁、进程池、requests模块和bs4（beautifulsoup）模块
一.进程 1.进程间数据不共享,如下示例: import multiprocessing data_list = [] def task(arg): data_list.append(arg) pri ...
python之openpyxl模块
一 . Python操作EXCEL库的简介 1.1 Python官方库操作excel Python官方库一般使用xlrd库来读取Excel文件,使用xlwt库来生成Excel文件,使用xlutils库 ...
25.xlrd、xlwt和openpyxl模块的比较和使用
xlrd.xlwt和openpyxl模块的比较:1)xlrd:对xls.xlsx.xlsm文件进行读操作–读操作效率较高,推荐2)xlwt:对xls文件进行写操作–写操作效率较高,但是不能执行xlsx ...
日志、第三方模块(openpyxl模块)
目录 1.日志模块 2.第三方模块内容日志模块 1.日志模块的主要组成部分 1.logger对象:产生日志无包装的产品 import logging logger = logging.getLo ...
logging日志模块详细，日志模块的配置字典，第三方模块的下载与使用
logging日志模块详细简介用Python写代码的时候,在想看的地方写个print xx 就能在控制台上显示打印信息,这样子就能知道它是什么了,但是当我需要看大量的地方或者在一个文件中查看的时 ...

随机推荐

实用脚本：检查高 CPU / 内存消耗进程
1 检查高 CPU 消耗进程在 Linux 上运行了多长时间的 Bash 脚本该脚本将帮助你确定高 CPU 消耗进程在 Linux 上运行了多长时间. # vi /opt/scripts/long- ...
Keepalived + Nginx 实现高可用 Web 负载均衡
一.Keepalived 简要介绍 Keepalived 是一种高性能的服务器高可用或热备解决方案, Keepalived 可以用来防止服务器单点故障的发生,通过配合 Nginx 可以实现 web 前 ...
1_Linux
一. Linux介绍 1.1 引言在学习Linux之前, 大家先了解开发环境,生产,测试环境开发环境: 平时大家大多是在Windows或者Mac操作系统下去编写代码进行开发,在开发环境中安装大量的 ...
MySQL学习(1)---MySQL概述
什么是数据库概述数据库(Database)是长期存储在计算机内有组织.大量.共享的数据集合.它可以供各种用户共享,具有最小冗余度和较高的数据独立性.数据库管理系统DBMS(Database Man ...
esp-idf 安装（Windows ）
esp32的开发有两种环境,分别是 Arduino 和 esp32-idf. Arduino 是在 esp32-idf 基础上进行封装的,虽然使用起来比较方便,但是能自由更改的就变少了,适合新手使用. ...
PTA2022 520钻石争霸赛题解
7-1 520表白不用说 #include<bits/stdc++.h> using namespace std; typedef long long ll; const int max ...
HDU1561 The more, The Better（树形背包）
通过这道题对树形背包理解更深一步...... 有几个地方需要注意: 1.本题数据结构为森林,需增加一个超根作为根节点,M+=1(后面解释). 2.本题有拓扑序的限制,通过vector建成的一棵树中,必 ...
洛谷P2367 语文成绩（差分）
标准的差分应用题,不要想的太复杂,写成了线段树. 1 #include<bits/stdc++.h> 2 using namespace std; 3 const int N=5e6+10 ...
【机器学习】利用 Python 进行数据分析的环境配置 Windows（Jupyter，Matplotlib，Pandas）
环境配置安装 python 博主使用的版本是 3.10.6 在 Windows 系统上使用 Virtualenv 搭建虚拟环境安装 Virtualenv 打开 cmd 输入并执行 pip inst ...
16.MongoDB系列之分片管理
1. 查看当前状态 1.1 查看配置信息 mongos> use config // 查看分片 mongos> db.shards.find() { "_id" : & ...

第三模块的下载、requests模块、openpyxl模块

第三方模块的下载安装

下载第三模块的方式

针对下载第三模块时可能会出现的问题

网络爬虫模块之requests模块

自动化办公领域之openpyxl模块

第三模块的下载、requests模块、openpyxl模块的更多相关文章

随机推荐

热门专题