1. 引言

前一篇介绍了Pandas实现简单的SQL操作，本篇中将主要介绍一些相对复杂一点的操作。为了方便后面实操，先给出一份简化版的设备统计数据：

0	android	NLL	387546520	2099457911

0	ios	NLL	52877990	916421755

1	android	魅族	8995958	120369597

1	android	酷派	9915906	200818172

1	android	三星	16500493	718969514

1	android	小米	23933856	290787590

1	android	华为	26706736	641907761

1	ios	苹果	52877990	916421755

2	android	小米-小米4	2786675	55376581

2	android	魅族-m2-note	4642112	130984205

2	android	OPPO-A31	4893428	62976997

2	ios	苹果-iPhone-6s	5728609	99948716

其中，第一列表示维度组合编号，第二列表示操作系统类型，第三列为维度值（NLL表示缺失，即第一行、第二行表示操作系统的统计，其余表示厂商或机型），第三列、第四列分别表示UV、PV；且字段之间为\t分隔。读取该文件为DataFrame：

import pandas as pd

df = pd.read_csv(path, names=['id', 'os', 'dim', 'uv', 'pv'], sep='\t')

2. 实战

Add

在原dataframe上，增加一行数据；可通过dataframe的append函数来追加：

import numpy as np

row_df = pd.DataFrame(np.array([['2', 'ios', '苹果-iPad 4', 3287509, 32891811]]), columns=['id', 'os', 'dim', 'uv', 'pv'])

df = df.append(row_df, ignore_index=True)

增加一列数据，则比较简单：

df['time'] = '2016-07-19'

To Dict

关于android、ios的PV、UV的dict：

def where(df, column_name, id_value):

    df = df[df[column_name] == id_value]

    return df

def to_dict(df):

    """

    {"pv" or "uv" -> {"os": os_value}}

    :return: dict

    """

    df = where(df, 'id', 0)

    df_dict = df.set_index('os')[['uv', 'pv']].to_dict()

    return df_dict

Top

group某列后的top值，比如，android、ios的UV top 2的厂商：

def group_top(df, group_col, sort_col, top_n):

    """

    get top(`sort_col`) after group by `group_col`

    :param df: dataframe

    :param group_col: string, column name

    :param sort_col: string, column name

    :param top_n: int

    :return: dataframe

    """

    return df.assign(rn=df.sort_values([sort_col], ascending=False)

                     .groupby(group_col)

                     .cumcount() + 1) \

        .query('rn < ' + str(top_n + 1)) \

        .sort_values([group_col, 'rn'])

全局top值加上group某列后的top值，并有去重：

def top(df, group_col, sort_col, top_n):

    """overall top and group top"""

    all_top_df = df.nlargest(top_n, columns=sort_col)

    grouped_top_df = group_top(df, group_col, sort_col, top_n)

    grouped_top_df = grouped_top_df.ix[:, 0:-1]

    result_df = pd.concat([all_top_df, grouped_top_df]).drop_duplicates()

    return result_df

排序编号

对某列排序后并编号，相当于给出排序名次。比如，对UV的排序编号：

df['rank'] = df['uv'].rank(method='first', ascending=False).apply(lambda x: int(x))

Left Join

Pandas的left join对NULL的列没有指定默认值，下面给出简单的实现：

def left_join(left, right, on, right_col, default_value):

    df = pd.merge(left, right, how='left', on=on)

    df[right_col] = df[right_col].map(lambda x: default_value if pd.isnull(x) else x)

    return df

自定义

对某一列做较为复杂的自定义操作，比如，厂商的UV占比：

def percentage(part, whole):

    return round(100*float(part)/float(whole), 2)

os_dict = to_dict(df)

all_uv = sum(os_dict['uv'].values())

df = where(df, 'id', 1)

df['per'] = df.apply(lambda r: percentage(r['uv'], all_uv), axis=1)

重复值

某列的重复值的行：

duplicate = df.duplicated(subset=columns, keep=False)

写MySQL

Pandas的to_sql函数支持Dataframe直接写MySQL数据库。在公司开发时，常常会有办公网与研发网是不通的，Python的sshtunnel模块提供ssh通道，便于入库debug。

import MySQLdb

from sshtunnel import SSHTunnelForwarder

with SSHTunnelForwarder(('porxy host', port),

                        ssh_password='os passwd',

                        ssh_username='os user name',

                        remote_bind_address=('mysql host', 3306)) as server:

    conn = MySQLdb.connect(host="127.0.0.1", user="mysql user name", passwd="mysql passwd",

                           db="db name", port=server.local_bind_port, charset='utf8')

    df.to_sql(name='tb name', con=conn, flavor='mysql', if_exists='append', index=False)

【Python实战】Pandas：让你像写SQL一样做数据分析（二）的更多相关文章

【Python实战】Pandas：让你像写SQL一样做数据分析（一）
1. 引言 Pandas是一个开源的Python数据分析库.Pandas把结构化数据分为了三类: Series,1维序列,可视作为没有column名的.只有一个column的DataFrame: Da ...
【Python项目实战】Pandas：让你像写SQL一样做数据分析（一）
1. 引言 Pandas是一个开源的Python数据分析库.Pandas把结构化数据分为了三类: Series,1维序列,可视作为没有column名的.只有一个column的DataFrame: Da ...
Pandas：让你像写SQL一样做数据分析
1. 引言 Pandas是一个开源的Python数据分析库.Pandas把结构化数据分为了三类: Series,1维序列,可视作为没有column名的.只有一个column的DataFrame: Da ...
【Pandas教程】像写SQL一样用Pandas～
写在最前 Python在数据分析领域有三个必须需要熟悉的库,分别是pandas,numpy和matplotlib,如果排个优先级的话,我推荐先学pandas. numpy主要用于数组和矩阵的运算,一般 ...
Python 数据分析：让你像写 Sql 语句一样，使用 Pandas 做数据分析
Python 数据分析:让你像写 Sql 语句一样,使用 Pandas 做数据分析一.加载数据 import pandas as pd import numpy as np url = ('http ...
Java开发者写SQL时常犯的10个错误
首页所有文章资讯 Web 架构基础技术书籍教程我要投稿更多频道 » - 导航条 - 首页所有文章资讯 Web 架构基础技术书籍教程我要投稿更多频道 » - iOS ...
Python利用pandas处理Excel数据的应用
Python利用pandas处理Excel数据的应用最近迷上了高效处理数据的pandas,其实这个是用来做数据分析的,如果你是做大数据分析和测试的,那么这个是非常的有用的!!但是其实我们平时在做 ...
python实战：用70行代码写了一个山炮计算器！
python实战训练:用70行代码写了个山炮计算器! 好了...好了...各位因为我是三年级而发牢骚的各位伙伴们,我第一次为大家插播了python的基础实战训练.这个,我是想给,那些python基础一 ...
python实战博客
2018-10-31 更新Logging日志记录以及异常捕获感谢廖大教程.Python实战直接在闲置的服务器上开发.阿里云Centos 6.8 64位. 1 搭建开发环境 Python 环境是Py ...

随机推荐

SqlServer游标简介
游标实例: Declare MyCusror Cursor Scroll For Select * From Master_Goods Order By GoodsID Ope ...
Jmeter之参数化
Jmeter参数化分为两类,一类是在badboy录制脚本时进行参数化,二是再Jmeter里进行参数化一:badboy录制脚本时进行参数化的步骤 1.脚本录制成功后->在左下角,点击variab ...
ABP理论学习之审计日志
返回总目录本篇目录介绍配置通过特性开启/关闭注意我项目中的例子介绍维基百科说: "审计跟踪(也叫审计日志)是与安全相关的按照时间顺序的记录,记录集或者记录源,它们提供了活动序 ...
ASP.Net WebForm温故知新学习笔记：二、ViewState与UpdatePanel探秘
开篇:经历了上一篇<aspx与服务器控件探秘>后,我们了解了aspx和服务器控件背后的故事.这篇我们开始走进WebForm状态保持的一大法宝—ViewState,对其刨根究底一下.然后,再 ...
Linux 查找已安装软件的方法
1.rpm 注意rpm区分大小写查询已安装的以mysql开头的包 rpm -qa mysql* 查询已安装的mysql 包 rpm -qa|grep mysql rpm的方法有时候也所有已安装的包 ...
掀起你的盖头来：Unit Of Work-工作单元
写在前面阅读目录: 概念中的理解代码中的实现后记掀起了你的盖头来,让我看你的眼睛,你的眼睛明又亮呀,好像那水波一模样:掀起了你的盖头来,让我看你的脸儿,看看你的脸儿红又圆呀,好像那苹果到秋天. ...
[nRF51822] 12、基础实验代码解析大全 · 实验19 - PWM
一.PWM概述: PWM(Pulse Width Modulation):脉冲宽度调制技术,通过对一系列脉冲的宽度进行调制,来等效地获得所需要波形. PWM 的几个基本概念: 1) 占空比:占空比是指 ...
控制Linux下 mono 服务的启动停止
当Window下的服务部署到Linux的时候,我们一般用Mono.service 来启动停止.参数比较多,不太好用.于是有个这个Shell脚本. 用法:moa s1 start #启动 ...
JSON Web Token实际应用
一.JWT认证方式的实现方式 1.客户端不需要持有密钥,由服务端通过密钥生成Token. 2.客户端登录时通过账号和密码到服务端进行认证,认证通过后,服务端通过持有的密钥生成Token,Token中一 ...
Pointer's NULL And 0
问题起源在使用Qt框架的时候, 经常发现一些构造函数 *parent = 0 这样的代码. 时间长了, 就觉的疑惑了. 一个指针不是等于NULL吗? 这样写, 行得通吗? 自己测试一下就可以了. 测 ...

【Python实战】Pandas：让你像写SQL一样做数据分析（二）