1. 引言

前一篇介绍了Pandas实现简单的SQL操作，本篇中将主要介绍一些相对复杂一点的操作。为了方便后面实操，先给出一份简化版的设备统计数据：

0	android	NLL	387546520	2099457911

0	ios	NLL	52877990	916421755

1	android	魅族	8995958	120369597

1	android	酷派	9915906	200818172

1	android	三星	16500493	718969514

1	android	小米	23933856	290787590

1	android	华为	26706736	641907761

1	ios	苹果	52877990	916421755

2	android	小米-小米4	2786675	55376581

2	android	魅族-m2-note	4642112	130984205

2	android	OPPO-A31	4893428	62976997

2	ios	苹果-iPhone-6s	5728609	99948716

其中，第一列表示维度组合编号，第二列表示操作系统类型，第三列为维度值（NLL表示缺失，即第一行、第二行表示操作系统的统计，其余表示厂商或机型），第三列、第四列分别表示UV、PV；且字段之间为\t分隔。读取该文件为DataFrame：

import pandas as pd

df = pd.read_csv(path, names=['id', 'os', 'dim', 'uv', 'pv'], sep='\t')

2. 实战

Add

在原dataframe上，增加一行数据；可通过dataframe的append函数来追加：

import numpy as np

row_df = pd.DataFrame(np.array([['2', 'ios', '苹果-iPad 4', 3287509, 32891811]]), columns=['id', 'os', 'dim', 'uv', 'pv'])

df = df.append(row_df, ignore_index=True)

增加一列数据，则比较简单：

df['time'] = '2016-07-19'

To Dict

关于android、ios的PV、UV的dict：

def where(df, column_name, id_value):

    df = df[df[column_name] == id_value]

    return df

def to_dict(df):

    """

    {"pv" or "uv" -> {"os": os_value}}

    :return: dict

    """

    df = where(df, 'id', 0)

    df_dict = df.set_index('os')[['uv', 'pv']].to_dict()

    return df_dict

Top

group某列后的top值，比如，android、ios的UV top 2的厂商：

def group_top(df, group_col, sort_col, top_n):

    """

    get top(`sort_col`) after group by `group_col`

    :param df: dataframe

    :param group_col: string, column name

    :param sort_col: string, column name

    :param top_n: int

    :return: dataframe

    """

    return df.assign(rn=df.sort_values([sort_col], ascending=False)

                     .groupby(group_col)

                     .cumcount() + 1) \

        .query('rn < ' + str(top_n + 1)) \

        .sort_values([group_col, 'rn'])

全局top值加上group某列后的top值，并有去重：

def top(df, group_col, sort_col, top_n):

    """overall top and group top"""

    all_top_df = df.nlargest(top_n, columns=sort_col)

    grouped_top_df = group_top(df, group_col, sort_col, top_n)

    grouped_top_df = grouped_top_df.ix[:, 0:-1]

    result_df = pd.concat([all_top_df, grouped_top_df]).drop_duplicates()

    return result_df

排序编号

对某列排序后并编号，相当于给出排序名次。比如，对UV的排序编号：

df['rank'] = df['uv'].rank(method='first', ascending=False).apply(lambda x: int(x))

Left Join

Pandas的left join对NULL的列没有指定默认值，下面给出简单的实现：

def left_join(left, right, on, right_col, default_value):

    df = pd.merge(left, right, how='left', on=on)

    df[right_col] = df[right_col].map(lambda x: default_value if pd.isnull(x) else x)

    return df

自定义

对某一列做较为复杂的自定义操作，比如，厂商的UV占比：

def percentage(part, whole):

    return round(100*float(part)/float(whole), 2)

os_dict = to_dict(df)

all_uv = sum(os_dict['uv'].values())

df = where(df, 'id', 1)

df['per'] = df.apply(lambda r: percentage(r['uv'], all_uv), axis=1)

重复值

某列的重复值的行：

duplicate = df.duplicated(subset=columns, keep=False)

写MySQL

Pandas的to_sql函数支持Dataframe直接写MySQL数据库。在公司开发时，常常会有办公网与研发网是不通的，Python的sshtunnel模块提供ssh通道，便于入库debug。

import MySQLdb

from sshtunnel import SSHTunnelForwarder

with SSHTunnelForwarder(('porxy host', port),

                        ssh_password='os passwd',

                        ssh_username='os user name',

                        remote_bind_address=('mysql host', 3306)) as server:

    conn = MySQLdb.connect(host="127.0.0.1", user="mysql user name", passwd="mysql passwd",

                           db="db name", port=server.local_bind_port, charset='utf8')

    df.to_sql(name='tb name', con=conn, flavor='mysql', if_exists='append', index=False)

【Python实战】Pandas：让你像写SQL一样做数据分析（二）的更多相关文章

【Python实战】Pandas：让你像写SQL一样做数据分析（一）
1. 引言 Pandas是一个开源的Python数据分析库.Pandas把结构化数据分为了三类: Series,1维序列,可视作为没有column名的.只有一个column的DataFrame: Da ...
【Python项目实战】Pandas：让你像写SQL一样做数据分析（一）
1. 引言 Pandas是一个开源的Python数据分析库.Pandas把结构化数据分为了三类: Series,1维序列,可视作为没有column名的.只有一个column的DataFrame: Da ...
Pandas：让你像写SQL一样做数据分析
1. 引言 Pandas是一个开源的Python数据分析库.Pandas把结构化数据分为了三类: Series,1维序列,可视作为没有column名的.只有一个column的DataFrame: Da ...
【Pandas教程】像写SQL一样用Pandas～
写在最前 Python在数据分析领域有三个必须需要熟悉的库,分别是pandas,numpy和matplotlib,如果排个优先级的话,我推荐先学pandas. numpy主要用于数组和矩阵的运算,一般 ...
Python 数据分析：让你像写 Sql 语句一样，使用 Pandas 做数据分析
Python 数据分析:让你像写 Sql 语句一样,使用 Pandas 做数据分析一.加载数据 import pandas as pd import numpy as np url = ('http ...
Java开发者写SQL时常犯的10个错误
首页所有文章资讯 Web 架构基础技术书籍教程我要投稿更多频道 » - 导航条 - 首页所有文章资讯 Web 架构基础技术书籍教程我要投稿更多频道 » - iOS ...
Python利用pandas处理Excel数据的应用
Python利用pandas处理Excel数据的应用最近迷上了高效处理数据的pandas,其实这个是用来做数据分析的,如果你是做大数据分析和测试的,那么这个是非常的有用的!!但是其实我们平时在做 ...
python实战：用70行代码写了一个山炮计算器！
python实战训练:用70行代码写了个山炮计算器! 好了...好了...各位因为我是三年级而发牢骚的各位伙伴们,我第一次为大家插播了python的基础实战训练.这个,我是想给,那些python基础一 ...
python实战博客
2018-10-31 更新Logging日志记录以及异常捕获感谢廖大教程.Python实战直接在闲置的服务器上开发.阿里云Centos 6.8 64位. 1 搭建开发环境 Python 环境是Py ...

随机推荐

Java程序开发.邱加永2.1节
by2016.9.8 2.7.1 一维数组 1. 声明 int[] m: char[] c: double[] d: 2. 创建数组声明之后还不能使用,m = new int[10]: c = ...
字典NSDictionary以及NSMutableDictionary的用法总结
做过Java语言或者 C语言开发的朋友应该很清楚关键字map 吧,它可以将数据以键值对儿的形式储存起来,取值的时候通过KEY就可以直接拿到对应的值,非常方便.在Objective-C语言中词典 ...
如何生成报告来枚举出整个sharepoint环境中的每个页面所使用的所有webpart
背景我的公司的SharePoint环境中购买了大量的第三方webpart,比如Quick Apps, Telerik RadEditor, Nintex Workflow等等..这样做的好处就是成本 ...
夜深了，写了个JQuery的省市区三级级联效果
刚刚练手的JQuery,希望大神们指正主要实现以下功能: 1.三级菜单级联加载数据 2.可以在不操作脚本的情况下,给元素加属性实现级联功能 3.自定义动态显示数据咨询问题: 对于一般比较固定不变的 ...
.Net组件程序设计之对象生命周期
.Net组件程序设计之对象生命周期 .NET 垃圾回收 IDisposable() Using语句 .NET 垃圾回收是CLR管理着垃圾回收器,垃圾回收器监控着托管堆,而我们使用的对象以及系统启动是 ...
浅析MSIL中间语言——基础篇
一.开篇研究MSIL纯属于个人喜好,说在前面MSIL应用于开发的地方很少,但是很大程度上能够帮着我们理解底层的原理,这是我了解MSIL的主要原因.托管代码表示应用程序的方法的功能,它们以微软的中间语 ...
有一个团队协同工具，叫Worktile
项目管理,本是一个老生常谈的话题,曾几何时大碗云集在这个市场,其中不乏出现像微软.SAP.IBM.用友这样的名字.复杂而又冗繁的流程控制,让人们划分成两类人,一类是会使用这些工具和系统的人,另一类是不 ...
TODO：Linux安装PHP MongoDB驱动
TODO:Linux安装PHP MongoDB驱动 PHP利于学习,使用广泛,主要适用于Web开发领域. MongoDB的主要目标是在键/值存储方式(提供了高性能和高度伸缩性)以及传统的RDBMS系统 ...
体验了微信小程序，发现安卓用户终于把果粉“碾压”了一次
今天早上,张小龙在微信公开课上分享了小程序的理念,并且公布了小程序将于1月9日上线. 为了体现张小龙对未来程序形态的理解,小程序有四个特定:无需安装.触手可及.用完即走.无需卸载.今天,36氪刚好有机 ...
AngularJs之二
今天先讲一个angularJs的表单绑定实例: <div ng-app="myApp" ng-controller="formCtrl"> < ...

【Python实战】Pandas：让你像写SQL一样做数据分析（二）