Python是一种解释型的、动态数据类型的、面向对象的高级程序设计语言。拥有丰富的处理数据和文本类库，并且得益于它是一种解释型的语言，在程序修改和功能扩展上，可以很容易做到大规模的调整。综合考虑Python的动态、轻量化特性，使用Python来处理Excel自动生成CSV文档的操作。程序的运行需要依赖两个Python的类库，Pandas和Xlrd。Pandas是Python的一个数据分析类库。Xlrd则是帮助开发人员从Microsoft的Excel操作数据的好帮手。

至于为什么要把Excel变成CSV就很简单了。由于CSV基于“,”符号切割字符串表单，因此，在程序上，读写访问非常方便。不需要导入厚重的Excel类库，只需要基于string数据结构就可以实现基本的表单管理。

一．Python和相关依赖库的配置步骤

1. 安装Python

请到Python官网下载并安装Python运行时：https://www.python.org/downloads/

2. 安装成功后，请打开Cmd控制台，输入如下命令安装Pandas

pip install pandas

3. 接着输入如下命令安装Xlrd

pip install xlrd

4. 如果你使用PyCharm，那么该工程的引用库安装导入方式如下：

　　　　File -> Settings -> Project: [current project name] -> ProjectInterpreter -> +(Add Button) -> 弹出的搜索框里分别依次选中Pandas和Xlrd。

二．转换实现

在开始编码前，我们思考一下转换的流程：

　　先收集所有的Excel文件 -> 遍历每一个Excel文件 -> Excel文件中还有众多的Sheet组成，也要遍历他们 -> 最终把Sheet为单位生成独立的CSV文件

那么接下来就是要研究那些API可以帮忙我们，如何获取目录文件集，如何打开excel文档，如何遍历sheet，如何保存成csv文档等等。这里就不流水账罗列过程了，直接贴出成品代码，下面的代码是上述思考过程的最终成品。最后，我们启动PyCharm运行脚本，显然当前脚本很好的搜索的指定的目录，并把所有表格的Sheet生成对应的CSV文档。

对了，代码里面我还留一个彩蛋，如何遍历所有的表格单元。这个，可以很好的帮你处理非法的单元格数据，关键的代码就是调用dataframe的applymap方法。代码中示例输入的方法是foreach_cell，该方法的本体是将nan的数据变成0。

另外，你还会发现，我用了xlrd获取sheet列表，但是我又另外使用pandas打开对应sheet。我之所以这样做，只是觉得pandas生成csv方便。所以，绕了点弯路。但是无大碍，一个转换代码而已，起码能利用各个优点（不是借口的借口吧）。Pandas有一个悲剧的地方就是不能获取Excel的Sheet总体情况，不传入指定的Sheet，默认打开的是第一个Sheet。

import os

import math

import xlrd

import pandas as pd

def get_all_table_file_name(folder_path):

    table_names = []

    for file in os.listdir(folder_path):

        if os.path.splitext(file)[1] == '.xls' or os.path.splitext(file)[1] == '.xlsx':

            table_names.append(file)

    return table_names

def foreach_cell(cell):

        if type(cell) is float and math.isnan(cell):

            cell = 0

        return cell

def convert_table_to_csv(folder_path, file_name):

    file_path = folder_path + '/' + file_name

    print('开始转换Excel文档： ' + file_path + ' 成 CSV 文档')

    tables = xlrd.open_workbook(file_path)

    print('..Sheet总数： ' + tables.nsheets.__str__())

    for sheet_table in tables.sheets():

        csv_file_name = file_name.replace('.xlsx', '')

        csv_file_name = csv_file_name.replace('.xls', '')

        output_path = 'output/' + csv_file_name + sheet_table.name + ".csv"

        sheet = pd.read_excel(file_path, sheet_table.name, index_col=None, index=False)

        sheet.columns = sheet.columns.str.replace('Unnamed.*', '')

        sheet.applymap(foreach_cell)

        sheet.to_csv(output_path, encoding='utf-8', index=False)

        print('....已经生成 ' + csv_file_name + sheet_table.name + ' CSV文档')

def convert_all_tables_to_csv(folder_paths):

    for folder_path in folder_paths:

        table_files = get_all_table_file_name(folder_path)

        for table_file in table_files:

            convert_table_to_csv(folder_path, table_file)

scan_folders = ['.', 'tables']

convert_all_tables_to_csv(scan_folders)

作者：雨天

地址：http://www.cnblogs.com/HelloGalaxy/p/8863436.html

Python处理Excel生成CSV文档的更多相关文章

Python 处理EXCEL的CSV文档分列求SUM
相对于导出EXCEL文件,PYTHON计算更为实时. import csv import sys from optparse import OptionParser def calculate_pro ...
python 3.7 生成数据库文档
开发阶段数据库总是有变动,开发人员需要维护文档给相关人员使用,故编写一个脚本自动生成数据库文档生成的excel如下 import cx_Oracle import os from openpyxl ...
Python处理Excel和PDF文档
一.使用Python操作Excel Python来操作Excel文档以及如何利用Python语言的函数和表达式操纵Excel文档中的数据. 虽然微软公司本身提供了一些函数,我们可以使用这些函数操作Ex ...
利用sphinx为python项目生成API文档
sphinx可以根据python的注释生成可以查找的api文档,简单记录了下步骤 1:安装 pip install -U Sphinx 2:在需要生成文档的.py文件目录下执行sphinx-apido ...
python快速生成注释文档的方法
python快速生成注释文档的方法今天将告诉大家一个简单平时只要注意的小细节,就可以轻松生成注释文档,也可以检查我们写的类方法引用名称是否重复有问题等.一看别人专业的大牛们写的文档多牛多羡慕,不用担 ...
使用C#动态生成Word文档/Excel文档的程序测试通过后，部署到IIS服务器上，不能正常使用的问题解决方案
使用C#动态生成Word文档/Excel文档的程序功能调试.测试通过后,部署到服务器上,不能正常使用的问题解决方案: 原因: 可能asp.net程序或iis访问excel组件时权限不够(Ps:Syst ...
Python sphinx-build在Windows系统中生成Html文档
看到前同事发布的“Markdown/reST 文档发布流水线”基于TFS.Docker.Azure等工具和平台进行文档发布的介绍说明,不得不在心中暗暗竖起大拇指.这套模式,实现了文档编写后版本管理.发 ...
使用sphinx快速为你python注释生成API文档
sphinx简介sphinx是一种基于Python的文档工具,它可以令人轻松的撰写出清晰且优美的文档,由Georg Brandl在BSD许可证下开发.新版的Python3文档就是由sphinx生成的, ...
JSP生成WORD文档，EXCEL文档及PDF文档的方法
转自:https://www.jb51.net/article/73528.htm 本文实例讲述了JSP生成WORD文档,EXCEL文档及PDF文档的方法.分享给大家供大家参考,具体如下: 在web- ...

随机推荐

rpm打包工具---FPM
FPM的安装:fpm是由ruby gem仓库里面安装的所以要先装ruby.yum安装的ruby版本是1.8.7版本,使用gem命令会报错: >= 1.9.3,所以要安装一个比1.9.3版本高的 ...
设计模式 --> （7）外观模式
外观模式外观模式为子系统中的一组接口提供一个一致的界面, 外观模式定义了一个高层接口,这个接口使得这一子系统更加容易使用. 适用性 1．为一个复杂子系统提供一个简单接口. 2．提高子系统的独立性. ...
数据库 --> sqlite3之api使用
创建 if [ ! -d /opt/dbspace ] then mkdir /opt/dbspace fi if [ -f /opt/dbspace/.memo.db ] then rm /opt/ ...
ThoughtWorks.QRCode 生成QR二维码时提示“索引超出了数组界限”的原因和解决方法
"索引超出了数组界限"也有可能确实是因为你选择的二维码Version对应的容量不足以存储你所放的内容,如果你确定使用的版本容量二维码能存储你的内容,但还是报错,那么再考虑此解决方法 ...
wpf研究之道-datagrid控件（1）
"想要说些什么又不知从何说起",每当想要写一些关于wpf的文章,总是沉思良久,怕自己写不好.今天我想要说的是wpf中datagrid控件.我们先来看看它在整个类的层次结构: ...
JavaWeb学习笔记九过滤器、注解
过滤器Filter filter是对客户端访问资源的过滤,符合条件放行,不符合条件不放行,并且可以对目标资源访问前后进行逻辑处理. 步骤: 编写一个过滤器的类实现Filter接口实现接口中尚未实现的 ...
Java虚拟机16：Metaspace
被废弃的持久代想起之前面试的时候有面试官问起过我一个问题:Java 8为什么要废弃持久代即Metaspace的作用.由于当时使用的Java 7且研究重心不在JVM上,一下没有回答上来,今天突然想起这 ...
异步协程的 trip库
import trip headers = { 'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, ...
Scrum 冲刺第五日
目录要求项目链接燃尽图问题今日任务明日计划成员贡献量要求各个成员今日完成的任务(如果完成的任务为开发或测试任务,需给出对应的Github代码签入记录截图:如果完成的任务为调研任务,需 ...
OO前三次作业总结
一.第一次作业 1.程序设计分析 ![img](s1.ax1x.com/2018/04/02/CSgoSU.png) 图1 第一次作业类图 ![name](https://images2018.cnb ...

Python处理Excel生成CSV文档

一．Python和相关依赖库的配置步骤

二．转换实现

Python处理Excel生成CSV文档的更多相关文章

随机推荐

热门专题