R语言扩展包dplyr——数据清洗和整理

标签：数据 R语言数据清洗数据整理

2015-01-22 18:04 7357人阅读评论(0) 收藏举报

分类：

R Programming（11）

该包主要用于数据清洗和整理，coursera课程链接：Getting and Cleaning Data

也可以载入swirl包，加载课Getting and Cleaning Data跟着学习。

如下：

library(swirl)
install_from_swirl("Getting and Cleaning Data")
swirl()

此文主要是参考R自带的简介：Introduce to dplyr

1、示范数据

> library(nycflights13)
> dim(flights)
[1] 336776 16
> head(flights, 3)
Source: local data frame [3 x 16]
year month day dep_time dep_delay arr_time arr_delay carrier tailnum flight origin dest air_time
1 2013 1 1 517 2 830 11 UA N14228 1545 EWR IAH 227
2 2013 1 1 533 4 850 20 UA N24211 1714 LGA IAH 227
3 2013 1 1 542 2 923 33 AA N619AA 1141 JFK MIA 160
Variables not shown: distance (dbl), hour (dbl), minute (dbl)

2、将过长的数据整理成友好的tbl_df数据

> flights_df <- tbl_df(flights)
> flights_df

3、筛选filter()

> filter(flights_df, month == 1, day == 1)
Source: local data frame [842 x 16]
year month day dep_time dep_delay arr_time arr_delay carrier tailnum flight origin dest air_time
1 2013 1 1 517 2 830 11 UA N14228 1545 EWR IAH 227
2 2013 1 1 533 4 850 20 UA N24211 1714 LGA IAH 227

筛选出month=1和day=1的数据

同样效果的，

flights_df[flights_df$month == 1 & flights_df$day == 1, ]

4、选出几行数据slice()

slice(flights_df, 1:10)

5、排列arrange()

>arrange(flights_df, year, month, day)

将flights_df数据按照year,month,day的升序排列。

降序

>arrange(flights_df, year, desc(month), day)

R语言当中的自带函数

flights_df[order(flights$year, flights_df$month, flights_df$day), ]
flights_df[order(desc(flights_df$arr_delay)), ]

6、选择select()

通过列名来选择所要的数据

select(flights_df, year, month, day)

选出三列数据
使用：符号

select(flights_df, year:day)

使用-来删除不要的列表

select(flights_df, -(year:day))

7、变形mutate()

产生新的列

> mutate(flights_df,
+ gain = arr_delay - dep_delay,
+ speed = distance / air_time * 60)

8、汇总summarize()

<pre name="code" class="html">> summarise(flights,
+ delay = mean(dep_delay, na.rm = TRUE)

求dep_delay的均值

9、随机选出样本

sample_n(flights_df, 10)

随机选出10个样本

sample_frac(flights_df, 0.01)

随机选出1%个样本

10、分组group_py()

by_tailnum <- group_by(flights, tailnum)
#确定组别为tailnum，赋值为by_tailnum
delay <- summarise(by_tailnum,
count = n(),
dist = mean(distance, na.rm = TRUE),
delay = mean(arr_delay, na.rm = TRUE))
#汇总flights里地tailnum组的分类数量，及其组别对应的distance和arr_delay的均值
delay <- filter(delay, count > 20, dist < 2000)
ggplot(delay, aes(dist, delay)) +
geom_point(aes(size = count), alpha = 1/2) +
geom_smooth() +
scale_size_area()

结果都需要通过赋值存储

a1 <- group_by(flights, year, month, day)
a2 <- select(a1, arr_delay, dep_delay)
a3 <- summarise(a2,
arr = mean(arr_delay, na.rm = TRUE),
dep = mean(dep_delay, na.rm = TRUE))
a4 <- filter(a3, arr > 30 | dep > 30)

11、引入链接符%>%

使用时把数据名作为开头，然后依次对数据进行多步操作：

flights %>%
group_by(year, month, day) %>%
select(arr_delay, dep_delay) %>%
summarise(
arr = mean(arr_delay, na.rm = TRUE),
dep = mean(dep_delay, na.rm = TRUE)
) %>%
filter(arr > 30 | dep > 30)

前面都免去了数据名

若想要进行更多地了解这个包，可以参考其自带的说明书（60页）：dplyr

R语言扩展包dplyr——数据清洗和整理的更多相关文章

R语言扩展包dplyr笔记
引言 2014年刚到, 就在 Feedly 订阅里看到 RStudio Blog 介绍 dplyr 包已发布 (Introducing dplyr), 此包将原本 plyr 包中的 ddply() 等 ...
R语言数据处理包dplyr、tidyr笔记
dplyr包是Hadley Wickham的新作,主要用于数据清洗和整理,该包专注dataframe数据格式,从而大幅提高了数据处理速度,并且提供了与其它数据库的接口:tidyr包的作者是Hadley ...
安装R语言扩展包diveRsity-1
今天去了学院的运动会呢-扮熊本熊超开心-写完这篇我补上我的图么么哒 ××××××××××××文末高能预警!!!!!这个包的安装并不是本周的任务!!!!!我真是萌萌哒×××××××××××××× ××× ...
安装R语言扩展包vegan
这周的作业我开始得好迟啊...然而还是要努力做啊... ××××××××××××××我是萌萌哒分割线×××××××××××××××××××××××××××××××××××× 首先,百度进入官方页面,看 ...
R语言 ggplot2包
R语言 ggplot2包的学习分析数据要做的第一件事情,就是观察它.对于每个变量,哪些值是最常见的?值域是大是小?是否有异常观测? ggplot2图形之基本语法: ggplot2的核心理念是将 ...
R语言重要数据集分析研究——需要整理分析阐明理念
1.R语言重要数据集分析研究需要整理分析阐明理念? 上一节讲了R语言作图,本节来讲讲当你拿到一个数据集的时候如何下手分析,数据分析的第一步,探索性数据分析. 统计量,即统计学里面关注的数据集的几个指标 ...
R语言-神经网络包RSNNS
code{white-space: pre;} pre:not([class]) { background-color: white; }if (window.hljs && docu ...
R语言-Knitr包的详细使用说明
R语言-Knitr包的详细使用说明 by 扬眉剑来自数盟[总舵] 群:321311420 1.相关资料 1:自动化报告-谢益辉 https://github.com/yihui/r-ninja/bl ...
安装R语言的包的方法
安装R语言的包的方法: 1. 在线安装在R的控制台,输入类似install.packages("TSA") # 安装 TSA install.packages("TS ...

随机推荐

安装vmware 已经配置Centos7
一:安装vmware VMware14 安装CentOS7及其配置;CentOS7配置网桥,做远程连接; 1.VMware14安装进入百度链接,按照图形安装就好了.https://ji ...
BZOJ4966 : 总统选举
线段树维护每个点的最有可能是答案的数以及它的权重. 合并两个节点的时候,将权重互相抵消,保留较大的那一个. 得到答案后,再在对应权值的Treap中查询出现次数,检查是否真正是答案. 时间复杂度$O(n ...
JS 模仿块级作用域
function outputNumbers(count) { for (var i=0; i<count; i++) { console.log(i); } var i; // 重新声明变量 ...
从web到搭建ssm环境
1:我先建立了个web项目, (1)在pom.xml中添加了如下 <dependencies>  <depend ...
unity游戏设计与实现 --读书笔记（一）
1, 游戏入门的一些知识点,游戏对象GameObject(角色), 组件Compoent(角色的功能),资源Asset(美术素材呵呵音频等的数据),场景Scene(用以放置各个角色,负责展示画面), ...
html标题-段落-字符实体-换行
Html标题标签: <h1>.<h2>.<h3>.<h4>.<h5>.<h6>标签可以在网页上定义6种级别的标题,这6种级别的标 ...
Prior Posterior和Likelihood的理解与几种表达方式
ACM-ICPC 2018 南京赛区网络预赛 E题
ACM-ICPC 2018 南京赛区网络预赛 E题题目链接: https://nanti.jisuanke.com/t/30994 Dlsj is competing in a contest wi ...
C#设置WebBrowser IE浏览器版本
通过修改注册表的值,来指定winform程序打开的webBrowser的IE版本 1>方法一,通过程序修改注册表的值 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 ...
sqlserver数据库出现可疑错误修复方法
一.主数据库出现可疑修复方法: 第一种方法: 当数据库发生这种操作故障时,可以按如下操作步骤可处理此要领,打开数据库里的Sql查询编辑器窗口,运行以下的命令: ?修改数据库为紧急模式 ALTER DA ...

R语言扩展包dplyr——数据清洗和整理

R语言扩展包dplyr——数据清洗和整理

R语言扩展包dplyr——数据清洗和整理的更多相关文章

随机推荐

热门专题