Python数据挖掘——数据预处理

数据预处理
- 数据质量
  - 准确性、完整性、一致性、时效性、可信性、可解释性
- 数据预处理的主要任务
  - 数据清理
  - 数据集成
  - 数据归约
    - 维归约
    - 数值归约
  - 数据变换
    - 规范化
    - 数据离散化
    - 概念分层产生
数据清理（试图填充缺失的值，光滑噪声并识别离群点，纠正数据的不一致）
- 缺失值
  - 忽略元组
  - 人工填写缺失值
  - 使用一个全局常量填充缺失值
  - 使用属性的中心度量（均值／中位数）填充缺失值
  - 使用与给定元组属于同一类的所有样本的均值／中位数
  - 使用最可能的值填充缺失值
  - 注：某些情况，缺失值并不代表错误
- 噪声数据（噪声是被测量的变量的随机误差或方差）
  - 分箱（通过考察数据的近邻，来光滑有序数据值）
    - 用箱均值
    - 用箱中位数
    - 用箱边界
  - 回归
  - 离群点分析（通过聚类来检测离群点）
- 数据清理化为一个过程
  - 首先进行偏差检测，还要防止字段过载
    - 唯一性规则
    - 连续性规则
    - 空值规则
  - 偏差检测商业工具
    - 数据清洗工具
    - 数据审计工具
  - 数据迁移工具
    - EIL工具
数据集成
- 实体识别问题
- 冗余和相关分析
- 元组重复
- 数据值冲突的检测与处理
数据归约
- 数据变换与数据离散化

Python数据挖掘——数据预处理的更多相关文章

Python数据挖掘——数据概述
Python数据挖掘——数据概述数据集由数据对象组成: 数据的基本统计描述中心趋势度量均值中位数众数中列数数据集的最大值和最小值的平均度量数据分布极差最大值与最小值的差四分位数 ...
Python做数据预处理
在拿到一份数据准备做挖掘建模之前,首先需要进行初步的数据探索性分析(你愿意花十分钟系统了解数据分析方法吗?),对数据探索性分析之后要先进行一系列的数据预处理步骤.因为拿到的原始数据存在不完整.不一致. ...
吴裕雄 python 机器学习——数据预处理过滤式特征选取SelectPercentile模型
from sklearn.feature_selection import SelectPercentile,f_classif #数据预处理过滤式特征选取SelectPercentile模型 def ...
吴裕雄 python 机器学习——数据预处理过滤式特征选取VarianceThreshold模型
from sklearn.feature_selection import VarianceThreshold #数据预处理过滤式特征选取VarianceThreshold模型 def test_Va ...
吴裕雄 python 机器学习——数据预处理正则化Normalizer模型
from sklearn.preprocessing import Normalizer #数据预处理正则化Normalizer模型 def test_Normalizer(): X=[[1,2,3, ...
吴裕雄 python 机器学习——数据预处理标准化MaxAbsScaler模型
from sklearn.preprocessing import MaxAbsScaler #数据预处理标准化MaxAbsScaler模型 def test_MaxAbsScaler(): X=[[ ...
吴裕雄 python 机器学习——数据预处理标准化StandardScaler模型
from sklearn.preprocessing import StandardScaler #数据预处理标准化StandardScaler模型 def test_StandardScaler() ...
吴裕雄 python 机器学习——数据预处理标准化MinMaxScaler模型
from sklearn.preprocessing import MinMaxScaler #数据预处理标准化MinMaxScaler模型 def test_MinMaxScaler(): X=[[ ...
吴裕雄 python 机器学习——数据预处理二元化OneHotEncoder模型
from sklearn.preprocessing import OneHotEncoder #数据预处理二元化OneHotEncoder模型 def test_OneHotEncoder(): X ...

随机推荐

#leetcode刷题之路27-移除元素
给定一个数组 nums 和一个值 val,你需要原地移除所有数值等于 val 的元素,返回移除后数组的新长度.不要使用额外的数组空间,你必须在原地修改输入数组并在使用 O(1) 额外空间的条件下完成. ...
linux下启动和终止JAVA程序shell脚本
1.启动脚本start.sh #run application backgroud nohup java -jar chess-admin->& & #record the pr ...
less.js插件监听
<script>less.watch();</script> 在不手动刷新/重新加载页面会自动监听less的变化,页面做出相应的变化 . 写在这两行后面就好了 <lin ...
使用kubeadm安装kubernetes/部署前准备/flannel网络插件/镜像下载/
本文内容参考<kuberneters进阶实战>/马哥的新书/推荐部署前的准备主机名称解析分布式系统环境中的多主机通信通常基于主机名称进行,这在IP地址存在变化的可能性时为主机提供了固 ...
Python调用time模块设置当前时间-指定时间
import datetimeimport time#新建元旦时间#将程序打包def A(): # 设定时间 newyear =datetime.datetime(2033,10,1) #调用当前时间 ...
C语言实现文件复制功能(包括文本文件和二进制文件)
文件的复制是常用的功能,要求写一段代码,让用户输入要复制的文件以及新建的文件,然后对文件进行复制.能够复制的文件包括文本文件和二进制文件,你可以复制1G的电影,也可以复制1Byte的txt文档. 实现 ...
Kafka跨网络访问设置
实际场景: kafka应用通过docker进行部署并暴露出不同kafka节点到不同的指定端口: 业务系统通过虚拟机进行部署: docker宿主机与业务系统在同一个局域网: 报错: 业务系统连接kafk ...
有限差分法解矩形波导内场值、截止频率 MATLAB
利用有限差分法,解矩形波导内场解和截止频率: 这里以解TM11模为例,利用双重迭代法,每4次场值,更新一次Kc: %% % 求矩形波导中TM11模截面内场分布.截止频率kc和特性阻抗Zc % // ...
20155215 2016-2017-2 《Java程序设计》第10周学习总结
20155215 2016-2017-2 <Java程序设计>第10周学习总结教材学习内容总结网络概论 - 网络是能够彼此通信的计算机的总和. - 网络分为局域网和广域网. - 按照计 ...
20155232 2016-2017-3 《Java程序设计》第10周学习总结
20155232 2016-2017-3 <Java程序设计>第10周学习总结教材学习内容总结计算机网络路由器和交换机组成了核心的计算机网络,计算机只是这个网络上的节点以及控制等,通 ...

Python数据挖掘——数据预处理

Python数据挖掘——数据预处理

Python数据挖掘——数据预处理的更多相关文章

随机推荐

热门专题