数据分析大数据之路五 pandas 报表

pandas: 在内存中或对象，会有一套基于对象属性的方法，可以视为 pandas 是一个存储一维表，二维表，三维表的工具，

主要以二维表为主

一维的表，　　　　　　（系列(Series)）

二维的表，DataFrame，也叫报表

三维的表，（面板(Panel)）

文本格式：

CSV 以文本方式存储， item 之间用逗号分割，记录与记录之间以回车分开 , 可以用 excel 方式打开

json 格式 , 以 key ，value 方式存储

import numpy as np

import pandas as pd

# data 里的 key 可以看成是表头，

data = {

    'animal   ': ['cat', 'cat', 'snake', 'dog', 'dog', 'cat', 'snake', 'cat', 'dog', 'dog'],

    'age      ': [2.5, 3, 0.5, np.nan, 5, 2, 4.5, np.nan, 7, 3],

    'visits'   : [1, 3, 2, 3, 2, 3, 1, 1, 2, 1],

    'priority' : ['yes', 'yes', 'no', 'yes', 'no', 'no', 'no', 'yes', 'no', 'no']

    }

# 给每一条记录起个别名

labels = ['a', 'b', 'c', 'd', 'e', 'f', 'g', 'h', 'i', 'j']

df = pd.DataFrame(data, index=labels)

print(df)

   age animal priority  visits

a  2.5    cat      yes       1

b  3.0    cat      yes       3

c  0.5  snake       no       2

d  NaN    dog      yes       3

e  5.0    dog       no       2

f  2.0    cat       no       3

g  4.5  snake       no       1

h  NaN    cat      yes       1

i  7.0    dog       no       2

j  3.0    dog       no       1

　　df.head() ， head() 默认输出前 5 条记录

　　df [1:5] 也可以通过切片方式操作（行索引）

　　df [['age', 'animal']] （列索引）

　　 df.iloc[0:3, 0:3] 指定行，列输出

   age       animal    priority

a        2.5       cat      yes

b        3.0       cat      yes

c        0.5     snake       no

缺失数据/异常数据处理
Ø 找到缺失值
df[df['age'].isnull()]

填充缺失值
df['age'].fillna(0, inplace=True)

将字符值替换成布尔值
df['priority'] = df['priority'].map({'yes': True, 'no': False})

2.4 可

数据分析大数据之路五 pandas 报表的更多相关文章

数据分析大数据之路六 matplotlib 绘图工具
散点图 #导入必要的模块 import numpy as np import matplotlib.pyplot as plt #产生测试数据 x = np.arange(1,10) y = x ...
数据分析大数据之路四 numpy 2
NumPy 数学函数 NumPy 提供了标准的三角函数:sin().cos().tan(import numpy as np a = np.array([0,30,45,60,90])print (' ...
数据分析大数据之路三 numpy
import numpy as np a = np.arange(9) b = a.reshape(3,3) print(b) print(b.max(axis=0)) # axis=0 示为 Y 轴 ...
CentOS6安装各种大数据软件第五章：Kafka集群的配置
相关文章链接 CentOS6安装各种大数据软件第一章:各个软件版本介绍 CentOS6安装各种大数据软件第二章:Linux各个软件启动命令 CentOS6安装各种大数据软件第三章:Linux基础 ...
胖子哥的大数据之路（7）- 传统企业切入核心or外围
一.引言昨天和一个做互联网大数据(零售行业)的朋友交流,关于大数据传统企业实施的切入点产生了争执,主要围绕两个问题进行了深入的探讨: 问题1:对于一个传统企业而言什么是核心业务,什么是外围业务? 问 ...
胖子哥的大数据之路（6）- NoSQL生态圈全景介绍
引言: NoSQL高级培训课程的基础理论篇的部分课件,是从一本英文原著中做的摘选,中文部分参考自互联网.给大家分享. 正文: The NoSQL Ecosystem 目录 The NoSQL Eco ...
大数据之路week06--day07（Hadoop生态圈的介绍）
Hadoop 基本概念一.Hadoop出现的前提环境随着数据量的增大带来了以下的问题 (1)如何存储大量的数据? (2)怎么处理这些数据? (3)怎样的高效的分析这些数据? (4)在数据增长的情况 ...
胖子哥的大数据之路（10）- 基于Hive构建数据仓库实例
一.引言基于Hive+Hadoop模式构建数据仓库,是大数据时代的一个不错的选择,本文以郑商所每日交易行情数据为案例,探讨数据Hive数据导入的操作实例. 二.源数据-每日行情数据三.建表脚本 C ...
胖子哥的大数据之路（9）-数据仓库金融行业数据逻辑模型FS-LDM
引言: 大数据不是海市蜃楼,万丈高楼平地起只是意淫,大数据发展还要从点滴做起,基于大数据构建国家级.行业级数据中心的项目会越来越多,大数据只是技术,而非解决方案,同样面临数据组织模式,数据逻辑模式的问 ...

随机推荐

关闭QQ右下角弹窗小程序
关闭QQ右下角弹出的广告或新闻等. 程序没有界面,后台运行. #if defined(UNICODE) && !defined(_UNICODE) #define _UNICODE # ...
UOJ #460 新年的拯救计划
清真的构造题 UOJ# 460 题意求将$ n$个点的完全图划分成最多的生成树的数量,并输出一种构造方案题解首先一棵生成树有$ n-1$条边,而原完全图只有$\frac{n·(n-1)}{2}$ ...
IO流的操作规律。
1. 明确源和目的源代表输入流: InputStream, Reader 目的代表输出流: OutputStream, Writer 2. 操作数据是否纯文本纯文本:字符流非纯文本: 字节流 ...
Linux设置允许指定端口通过防火墙centos7
开启防火墙 1.systemctl start firewalld.service(开启防火墙) 2.systemctl stop firewalld.service(开启防火墙) 3.service ...
417 事件、监听、jQuery、轮播手动
am:通用事件 a链接事件阻止默认行为 return false HTML元素大都包含了自己的默认行为,例如:超链接.提交按钮等.我们可以通过在绑定事件中加上return false来阻止它的默认行为 ...
413 重温HTML + css 考试 + 访问HTML元素
考试前的复习初学css1:认识CSS 1.1:css简介,css全称是层叠样式表,Cascading style sheets 1.2:css的作用,主要是用于定义html内容在浏览器内的显示样式, ...
KVO实现原理
KVO意为键值观察Key-Value-Observer,本质仍然是观察者模式. 观察者模式的定义:一个目标对象管理所有依赖于它的观察者对象,并在它自身的状态改变时主动通知观察者对象.这个主动通知通常是 ...
第十二节，OpenCV学习（一）图像的读取、显示、保存
一.读取图像所谓的图像就是一个数组,对图像的处理就是对数字的处理 import cv2 import numpy as np img = cv2.imread('dog.jpg') print(im ...
spring cloud--zuul网关和zuul请求过滤
这里仍然以Windows和jdk为运行环境,按照下面的步骤打包-运行-访问就能看到效果.启动项目jar包: java -jar F:\jars-zuul\register-0.0.1-SNAPSHOT ...
Revit二次钢筋

数据分析 大数据之路 五 pandas 报表

主要以二维表为主

数据分析 大数据之路 五 pandas 报表的更多相关文章

随机推荐

热门专题

数据分析大数据之路五 pandas 报表

数据分析大数据之路五 pandas 报表的更多相关文章