『Pandas』数据读取&DataFrame切片

读取文件

numpy.loadtxt()

import numpy as np

dataset_filename = "affinity_dataset.txt"

X = np.loadtxt(dataset_filename)

n_samples, n_features = X.shape

print("This dataset has {0} samples and {1} features".format(n_samples, n_features))

This dataset has 100 samples and 5 features

pandas.read_csv()

import pandas as pd

dataset_filename = "affinity_dataset.txt"

Xp = pd.read_csv(dataset_filename, delimiter=' ', names=list('abcde'))

print(Xp.shape)

(100, 5)

检测一下输出，

print(X[:5])

print(Xp[:5])

print(type(Xp['a'][0]))

[[ 0.  0.  1.  1.  1.]

 [ 1.  1.  0.  1.  0.]

 [ 1.  0.  1.  1.  0.]

 [ 0.  0.  1.  1.  1.]

 [ 0.  1.  0.  0.  1.]]

   a  b  c  d  e

0  0  0  1  1  1

1  1  1  0  1  0

2  1  0  1  1  0

3  0  0  1  1  1

4  0  1  0  0  1

<class 'numpy.int64'>

DF.loc索引

当每列已有column name时，用 df [ 'a' ] 就能选取出一整列数据。如果你知道column names和index，且两者都很好输入，可以选择 .loc，

print(Xp.loc[0, 'a'], '\n' ,

      Xp.loc[0:3, ['a', 'b']], '\n' ,

      Xp.loc[[1, 5], ['b', 'c']])

DF.iloc索引

如果我们嫌column name太长了，输入不方便，有或者index是一列时间序列，更不好输入，那就可以选择 .iloc了。这边的 i 我觉得代表index，比较好记点。

print(Xp.iloc[1,1],'\n',

      Xp.iloc[0:3, [0,1]],'\n',

      Xp.iloc[[0, 3, 5], 0:2]  )

DF.ix索引

.ix 的功能就更强大了，它允许我们混合使用下标和名称进行选取。可以说它涵盖了前面所有的用法。基本上把前面的都换成df.ix 都能成功，但是有一点，就是

df.ix [ [ ..1.. ], [..2..] ], 1框内必须统一，必须同时是下标或者名称，2框也一样。 BTW， 1框是用来指定row，2框是指定column。

『Pandas』数据读取&DataFrame切片的更多相关文章

『TensorFlow』数据读取类_data.Dataset
一.资料参考原文: TensorFlow全新的数据读取方式:Dataset API入门教程 API接口简介: TensorFlow的数据集二.背景注意,在TensorFlow 1.3中,Data ...
『Matplotlib』数据可视化专项
一.相关知识官网介绍 matplotlib API 相关博客 matplotlib绘图基础漂亮插图demo 使用seaborn绘制漂亮的热度图 fig, ax = plt.subplots(2,2 ...
pandas 从txt读取DataFrame&DataFrame格式化保存到txt
前提首先保证你txt里的文本内容是有规律可循的(例如,列与列之间通过“\t”.“,”等指定的可识别分隔符分隔): 例如我需要读取的数据,(\t)分隔: (此文件内容是直接以DataFrame格式化写 ...
pandas中数据框DataFrame获取每一列最大值或最小值
1.python中数据框求每列的最大值和最小值 df.min() df.max()
『TensorFlow』专题汇总
TensorFlow:官方文档 TensorFlow:项目地址本篇列出文章对于全零新手不太合适,可以尝试TensorFlow入门系列博客,搭配其他资料进行学习. Keras使用tf.Session训 ...
『TensorFlow』SSD源码学习_其五：TFR数据读取&数据预处理
Fork版本项目地址:SSD 一.TFR数据读取创建slim.dataset.Dataset对象在train_ssd_network.py获取数据操作如下,首先需要slim.dataset.Dat ...
『Numpy』内存分析_高级切片和内存数据解析
在计算机中,没有任何数据类型是固定的,完全取决于如何看待这片数据的内存区域. 在numpy.ndarray.view中,提供对内存区域不同的切割方式,来完成数据类型的转换,而无须要对数据进行额外的co ...
pandas数据读取（DataFrame & Series）
1.pandas数据的读取 pandas需要先读取表格类型的数据,然后进行分析数据说明说明 pandas读取方法 csv.tsv.txt 用逗号分割.tab分割的纯文本文件 pd.read_csv ...
『TensorFlow』从磁盘读取数据
十图详解TensorFlow数据读取机制一.输入流水线读取数据流程 1). 创建文件名列表相关函数:tf.train.match_filenames_once 2). 创建文件名队列相关函数:t ...

随机推荐

web前端----jQuery基础语法
一.jQuery基础1.为什么要用jquery? 写起来简单,省事,开发效率高,兼容性好2.什么是jQuery? jQuery是一个兼容多浏览器的JavaScript库(类似python里面的模块)3 ...
Python入门之Python Colorama模块
Python的Colorama模块,可以跨多终端,显示字体不同的颜色和背景,只需要导入colorama模块即可,不用再每次都像linux一样指定颜色: 官方参考:https://pypi.org/pr ...
20145127《java程序设计》第四周学习总结
教材学习内容总结第六章继承与多态 6.1 何为继承 0.面向对象中,子类继承父类,避免城府的行为定义.正确判断使用继承的时机,以及继承之后如何活用多态,才是学习继承时的重点. 1.继承:避免多个类 ...
CRT中的时间(time_t和tm)(转载)
转载:http://blog.csdn.net/bokee/article/details/5330682 首先介绍基本的时间概念. 时间一般分为两种,一种是本地时间(Local Time),一种是协 ...
fedora中使用 mariadb数据库建库和建表-- mariadb数据库服务无法启动?
/proc(进程, 过程等含义) 文件系统是一个虚拟文件系统,通过它可以使用一种新的方法在 Linux® 内核空间(内核)和用户空间(用户)之间进行通信.在 /proc 文件系统中,我们可以将对虚拟文 ...
sql 题目
1.自增列通用: ) from table b where b.sid<a.sid) ,* from table a; ,),* from ... 第二个已经有主键自增列的就不可以用了还有就 ...
高斯日记|2013年蓝桥杯B组题解析第一题-fishers
高斯日记大数学家高斯有个好习惯:无论如何都要记日记. 他的日记有个与众不同的地方,他从不注明年月日,而是用一个整数代替,比如:4210 后来人们知道,那个整数就是日期,它表示那一天是高斯出生后的第几 ...
三羊献瑞|2015年蓝桥杯B组题解析第三题-fishers
三羊献瑞观察下面的加法算式: 祥瑞生辉三羊献瑞三羊生瑞气 (如果有对齐问题,可以参看[图1.jpg]) 其中,相同的汉字代表相同的数字,不同的汉字代表不同的数字. 请你填写& ...
C#学习笔记（二十）：C#总结和月考讲解
m1w1d2_console_variable_constant 输入Console.WriteLine(); 输出Console.ReadLine(); 快捷键折叠代码:快捷键“Ctrl+ K + ...
JS进阶系列之内存空间
也许很多人像我一样,觉得JS有垃圾回收机制,内存就可以不管了,以至于在全局作用域下定义了很多变量,自以为JS会自动回收,直到最近,看了阮一峰老师,关于javascript内存泄漏的文章时,才发现自己写 ...