python数据预处理

缺失值处理

import pandas as pda

import numpy as npy

import matplotlib.pylab as pyl

# data=pda.read_excel("D:/taobao2.xls")

def index(data):

  data = pda.DataFrame(data[1:],columns=data[0])

  print(data)

  data["价格"][(data["价格"]==0)]=None

  print(data)

  x=0

  for i in data.columns:

   for j in range(len(data)):

     if(data[i].isnull())[j]:

        data[i][j]=data["价格"].mean()

        x+=1

        print(x)

if __name__ == "__main__":

  data = nosupervision_read_data()

  index(data)

数据离散化处理

#离散化

#连续型数据离散化

#等宽离散化

import pandas as pda

import numpy as npy

import matplotlib.pylab as pyl

# data=pda.read_excel("D:/taobao2.xls")

def index(data):

    data = pda.DataFrame(data[1:], columns=data[0])

    da=data.values

    price=da[:,2]

    price.sort()

    print(price)

    k=5

    c1=pda.cut(price,k,labels=["太便宜","便宜","适中","贵","太贵"])

    print(c1)

#指点区间离散化

    k=[0,50,100,price.max()]

    print(k)

    c2=pda.cut(price,k,labels=["非常便宜","适中","贵"])

    print(c2)

if __name__ == "__main__":

   data = nosupervision_read_data()

   index(data)

数据集成处理

# -*- coding:utf-8 -*-

# 异常值处理

import pandas as pda

import numpy as npy

def index(data):

# 输出结果必须为字典output

   output = {}

# data = pda.read_excel("D:/taobao2.xls")

   data = pda.DataFrame(data[1:], columns=data[0])

# print(data)

   da = data.values

# 数据集成

   da1 = da[0:10]

   da2 = da[10:20]

   da3 = npy.concatenate((da1, da2))

   pda.DataFrame(da3)

   output['data_数据集成'] = pda.DataFrame(da3).values.tolist()

   print(pda.DataFrame(da1))

   print(pda.DataFrame(da2))

   print(pda.DataFrame(da3))

   print(output)

   return output

if __name__ == "__main__":

   data = nosupervision_read_data()

   index(data)

python数据预处理的更多相关文章

Python数据预处理：机器学习、人工智能通用技术（1）
Python数据预处理:机器学习.人工智能通用技术白宁超 2018年12月24日17:28:26 摘要:大数据技术与我们日常生活越来越紧密,要做大数据,首要解决数据问题.原始数据存在大量不完整.不 ...
python data analysis | python数据预处理（基于scikit-learn模块）
原文:http://www.jianshu.com/p/94516a58314d Dataset transformations| 数据转换 Combining estimators|组合学习器 Fe ...
python数据预处理for knn
机器学习实战一书中第20页数据预处理,从文本中解析数据的程序. import numpy as np def dataPreProcessing(fileName): with open(fileN ...
Python数据预处理—归一化，标准化，正则化
关于数据预处理的几个概念归一化 (Normalization): 属性缩放到一个指定的最大和最小值(通常是1-0)之间,这可以通过preprocessing.MinMaxScaler类实现. 常用的 ...
Python数据预处理之清及
使用Pandas进行数据预处理数据清洗中不是每一步都是必须的,按实际需求操作. 内容目录 1.数据的生成与导入 2.数据信息查看 2.1.查看整体数据信息 2.2.查看数据维度.列名称.数据格式 2 ...
Python数据预处理(sklearn.preprocessing)—归一化(MinMaxScaler)，标准化(StandardScaler)，正则化(Normalizer, normalize)
关于数据预处理的几个概念归一化 (Normalization): 属性缩放到一个指定的最大和最小值(通常是1-0)之间,这可以通过preprocessing.MinMaxScaler类实现. 常 ...
python数据预处理和特性选择后列的映射
我们在用python进行机器学习建模时,首先需要对数据进行预处理然后进行特征工程,在这些过程中,数据的格式可能会发生变化,前几天我遇到过的问题就是: 对数据进行标准化.归一化.方差过滤的时候数据都从D ...
Python数据预处理：使用Dask和Numba并行化加速
如果你善于使用Pandas变换数据.创建特征以及清洗数据等,那么你就能够轻松地使用Dask和Numba并行加速你的工作.单纯从速度上比较,Dask完胜Python,而Numba打败Dask,那么Num ...
Python数据预处理—训练集和测试集数据划分
使用sklearn中的函数可以很方便的将数据划分为trainset 和 testset 该函数为sklearn.cross_validation.train_test_split,用法如下: > ...
关系网络数据可视化：2. Python数据预处理
将数据中导演与演员的关系整理出来,得到导演与演员的关系数据,并统计合作次数 import numpy as np import pandas as pd import matplotlib.pyplo ...

随机推荐

Python 图像处理 OpenCV （3）：图像属性、图像感兴趣 ROI 区域及通道处理
前文传送门: 「Python 图像处理 OpenCV (1):入门」「Python 图像处理 OpenCV (2):像素处理与 Numpy 操作以及 Matplotlib 显示图像」图像属性图像 ...
JQuery动态创建表单并提交
// 捕捉链接的点击事件 $('#btn').click(function(){ // 取得要提交的参数 var my_val = $.trim($('#ipt').val()); // 取得要提交页 ...
封装 private
封装表现: 1.方法就是一个最基本封装体. 2.类其实也是一个封装体. 从以上两点得出结论,封装的好处: 1.提高了代码的复用性. 2.隐藏了实现细节,还要对外提供可以访问的方式.便于调用者的使用.这 ...
UIAutomator2安装及连接
记录一下自己的偿试过程,内容来自:https://github.com/openatx/uiautomator2 d.service("uiautomator").stop()是因 ...
【C++】VS Code配置
0.前言本文已配置C++环境为例,本文主要是面向刚开始接触VS Code的朋友,采用生成默认配置任务的方法,在编写本文过程中大量参考了官方文档,感兴趣的朋友可直接前往传送门. 环境: win10 + ...
html5学习之路_004
HTML表单表单用于获取不同类型的用户输入常用表单标签下面为一个简单的表单: <!DOCTYPE html> <html> <head lang="en& ...
PreparedStatement实现表数据的增删改 & 封装数据库链接和关闭操作
PreparedStatement实现表数据的增删改 PreparedStatementUpdateTest package com.aff.PreparedStatement; import jav ...
JAVA中的注释方法
Java的三种注释方法 ①单行注释:使用 // ,其注释内容从//开始到本行结束,比较常用, 快捷键为:Ctrl + / 或者 Ctrl + Shift + C 取消注释:Ctrl + / 或者 ...
Alpha冲刺 —— 5.7
这个作业属于哪个课程软件工程这个作业要求在哪里团队作业第五次--Alpha冲刺这个作业的目标 Alpha冲刺作业正文正文 github链接项目地址其他参考文献无一.会议内容 1.展 ...
【HIVE】hive的安装与使用教程
hive是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行. 其优点是学习成本低,可以通过 ...

python数据预处理

python数据预处理的更多相关文章

随机推荐

热门专题