使用Python拆分数据量大的CSV文件（亲测有效）

转载：https://www.cnblogs.com/FYZHANG/p/11629075.html

一次就运行成功了，感谢博主分享

#!/usr/bin/env python3

# -*- coding:utf-8 -*-

# @FileName :Test.py

# @Software PyCharm

import os

import pandas as pd

# filename为文件路径，file_num为拆分后的文件行数

# 根据是否有表头执行不同程序，默认有表头的

def Data_split(filename,file_num,header=True):

    if header:

        # 设置每个文件需要有的行数,初始化为1000W

        chunksize=10000

        data1=pd.read_table(filename,chunksize=chunksize,sep=',',encoding='gbk')

        # print(data1)

        # num表示总行数

        num=0

        for chunk in data1:

            num+=len(chunk)

        # print(num)

        # chunksize表示每个文件需要分配到的行数

        chunksize=round(num/file_num+1)

        # print(chunksize)

        # 分离文件名与扩展名os.path.split(filename)

        head,tail=os.path.split(filename)

        data2=pd.read_table(filename,chunksize=chunksize,sep=',',encoding='gbk')

        i=0

        for chunk in data2:

            chunk.to_csv('{0}_{1}{2}'.format(head,i,tail),header=None,index=False)

            print('保存第{0}个数据'.format(i))

            i+=1

    else:

        # 获得每个文件需要的行数

        chunksize=10000

        data1=pd.read_table(filename,chunksize=chunksize,header=None,sep=',')

        num=0

        for chunk in data1:

            num+=len(chunk)

            chunksize=round(num/file_num+1)

            head,tail=os.path.split(filename)

            data2=pd.read_table(filename,chunksize=chunksize,header=None,sep=',')

            i=0

            for chunk in data2:

                chunk.to_csv('{0}_{1}{2}'.format(head,i,tail),header=None,index=False)

                print('保存第{0}个数据'.format(i))

                i+=1

filename='文件路径'

#num为拆分为的文件个数

Data_split(filename,num,header=True)

可能因为版本的原因，运行时会提示 read_csv，

最后一行代码，filename处填上你自己想要拆分的文件地址，num填想要拆分成多少个文件

使用Python拆分数据量大的CSV文件（亲测有效）的更多相关文章

用Python对体积较大的CSV文件进行比较的经验
用Python对体积较大的CSV文件进行比较的经验 » 进化的测试 | 进化的测试用Python对体积较大的CSV文件进行比较的经验 python Add comments 八 032010 ...
使用POI导出EXCEL工具类并解决导出数据量大的问题
POI导出工具类工作中常常会遇到一些图表需要导出的功能,在这里自己写了一个工具类方便以后使用(使用POI实现). 项目依赖 <dependency> <groupId>org ...
关于dedecms数据量大以后生成目录缓慢的问题解决
四月份的时候博客被封.我不知情.因为一直很忙,没有来得及看.前两天来看以后,发现居然被封,吓傻了我. 赶紧找原因,原来是转载了某个人的博文,被他举报了,然后就被封了. 觉得很伤心,毕竟这个博客陪伴了我 ...
分布式系统中我们会对一些数据量大的业务进行分拆，分布式系统中唯一主键ID的生成问题
分布式全局唯一ID生成策略 https://www.cnblogs.com/vandusty/p/11462585.html 一.背景分布式系统中我们会对一些数据量大的业务进行分拆,如:用户表,订 ...
Thinkphp解决phpExcel导出数据量大导致内存溢出
工作需要导出几万的数据量.操作比较频繁.之前数据在七八千是数据导出很慢.phpExcel是方便但是性能一般.现在改为使用csv导出数据:可以缓解内存压力,一次导出两三万是没问题的.当然服务器内存给力, ...
DataTable 数据量大时，导致内存溢出的解决方案
/// <summary> /// 分解数据表 /// </summary> /// <param name="originalTab">需要分 ...
python之小应用：读取csv文件并处理01数据串
目的:读取csv文件内容,把0和1的数据串取出来,统计出现1的连续次数和各次数出现的频率次数先读取csv文件内容: import csv def csv_read(file): list = [] ...
Python开发【模块】：CSV文件数据可视化
CSV模块 1.CSV文件格式要在文本文件中存储数据,最简单的方式是讲数据作为一系列逗号分隔的值(CSV)写入文件,这样的文件成为CSV文件,如下: AKDT,Max TemperatureF,Me ...
[大数据技术]Kettle从CSV文件读取清洗后到MySQL中文乱码问题
首先要知道CSV文件的编码格式然后在文件输入编码选择编码格式, 第二步,在每个转换或者作业的DB连接中选择选项,并添加如下内容: 中文乱码问题得到解决

随机推荐

Eclipse的使用需要注意的问题
一.修改/设置字符集编码设置工作空间编码格式 Window--Preference--General--Workspace下,面板''Text file encoding"选择UTF-8格 ...
洛谷 P5638 光骓者的荣耀
洛谷 P5638 [CSGRound2]光骓者的荣耀洛谷传送门题目背景小 K 又在做白日梦了.他进入到他的幻想中,发现他打下了一片江山. 题目描述小 K 打下的江山一共有nn个城市,城市ii和 ...
基础知识 Asp.Net MVC EF各版本区别
原文:https://www.cnblogs.com/liangxiaofeng/p/5840754.html 2009年發行ASP.NET MVC 1.0版 2010年發行ASP.NET MVC 2 ...
用arthas的watch方法观察执行方法的输入输出
watch 的参数比较多,主要是因为它能在 4 个不同的场景观察对象参数名称参数说明 class-pattern 类名表达式匹配 method-pattern 方法名表达式匹配 express 观 ...
new 关键字和 newInstance() 方法的区别
区别1: new是一个关键字,可以说是一个指令: newInstance()是一个方法,Class对象的一个方法. 区别2: new主要作用是在内存中生成一个实例,而这个类可以没有提前加载到内从中: ...
Linux 部署 nginx
nginx搭建 1. 清除之前nginx环境 #查看nginx进程 ps -ef|grep nginx #找到nginx相对应的位置 whereis nginx #停止nginx服务 /usr/loc ...
dom元素上添加断点（使用dom breakpoint找到修改属性的javascript代码）
使用dom breakpoint能快速找到修改了某一个dom element的JavaScript code位于何处.在Chrome development tool里,选中想要inspect的dom ...
【nginx启动报错】重启服务器之后nginx启动错
错误信息: # ./nginx nginx: [emerg] open() "/var/run/nginx/nginx.pid" failed (2: No such file ...
常用的app包名和类名
应用包名启动类 QQ com.tencent.mobileqq com.tencent.mobileqq.activity.HomeActivity 微信 com.tencent.mm com.t ...
eclipse彻底去除validation（彻底解决编辑js文件的卡顿问题）
Eclipse中默认的JS编辑器非常慢,尤其在拷贝粘贴代码时,CPU总是占用很高甚至到100%,也就导致了编辑起来很卡. 这是因为Eclipse中带的Validate功能导致的,这个鸡肋的功能简直让人 ...

使用Python拆分数据量大的CSV文件（亲测有效）

使用Python拆分数据量大的CSV文件（亲测有效）的更多相关文章

随机推荐

热门专题