pandas dataframe 过滤——apply最灵活！！！

按照某特定string字段长度过滤：

import pandas as pd

df = pd.read_csv('filex.csv')

df['A'] = df['A'].astype('str')

df['B'] = df['B'].astype('str')

mask = (df['A'].str.len() == 10) & (df['B'].str.len() == 10)

df = df.loc[mask]

print(df)

Applied to filex.csv:

A,B

123,abc

1234,abcd

1234567890,abcdefghij

the code above prints

            A           B

2  1234567890  abcdefghij

或者是：

data={"names":["Alice","Zac","Anna","O"],"cars":["Civic","BMW","Mitsubishi","Benz"],

     "age":["1","4","2","0"]}

df=pd.DataFrame(data)

"""

df:

  age        cars  names

0   1       Civic  Alice

1   4         BMW    Zac

2   2  Mitsubishi   Anna

3   0        Benz      O

Then:

"""

df[

df['names'].apply(lambda x: len(x)>1) &

df['cars'].apply(lambda x: "i" in x) &

df['age'].apply(lambda x: int(x)<2)

  ]

"""

We will have :

  age   cars  names

0   1  Civic  Alice

"""

最灵活的是用apply：

def load_metadata(dir_name):

    columns_index_list = [

        MetaIndex.M_METADATA_ID_INDEX,

        MetaIndex.M_SRC_IP_INDEX,

        MetaIndex.M_DST_IP_INDEX,

        MetaIndex.M_SRC_PORT_INDEX,

        MetaIndex.M_DST_PORT_INDEX,

        MetaIndex.M_PROTOCOL_INDEX,

        MetaIndex.M_HEADER_H,

        MetaIndex.M_PAYLOAD_H,

        MetaIndex.M_TCP_FLAG_H,

        MetaIndex.M_FLOW_FIRST_PKT_TIME,

        MetaIndex.M_FLOW_LAST_PKT_TIME,

        MetaIndex.M_OCTET_DELTA_COUNT_FROM_TOTAL_LEN,

    ]

    columns_name_list = [

        "M_METADATA_ID_INDEX",

        "M_SRC_IP_INDEX",

        "M_DST_IP_INDEX",

        "M_SRC_PORT_INDEX",

        "M_DST_PORT_INDEX",

        "M_PROTOCOL_INDEX",

        "M_HEADER_H",

        "M_PAYLOAD_H",

        "M_TCP_FLAG_H",

        "M_FLOW_FIRST_PKT_TIME",

        "M_FLOW_LAST_PKT_TIME",

        "M_OCTET_DELTA_COUNT_FROM_TOTAL_LEN",

    ]

    def metadata_parse_filter(row):

        try:

            if row['M_PROTOCOL_INDEX'] != 6:

                return False

            if len(row['M_HEADER_H']) < 2 or len(row['M_PAYLOAD_H']) < 2 or not is_l34_tcp_metadata(row['M_METADATA_ID_INDEX']):

                return False

            first_time = row['M_FLOW_FIRST_PKT_TIME'].split('-')

            last_time = row['M_FLOW_LAST_PKT_TIME'].split('-')

            flow_first_pkt_time = int(first_time[0])

            rev_flow_first_pkt_time = int(first_time[1])

            flow_last_pkt_time = int(last_time[0])

            rev_flow_last_pkt_time = int(last_time[1])

            if flow_first_pkt_time > flow_last_pkt_time or rev_flow_first_pkt_time > rev_flow_last_pkt_time:

                return False

            return True

        except Exception as e:

            return False

    for root, dirs, files in os.walk(dir_name):

        for filename in files:

            file_path = os.path.join(root, filename)

            df = pd.read_csv(file_path, delimiter='^', usecols=columns_index_list, names=columns_name_list, encoding='utf-8', error_bad_lines=False, warn_bad_lines=True, header=0, lineterminator="\n")

            filter_df = df.loc[df.apply(metadata_parse_filter, axis=1)]

            yield filter_df

　直接按照row过滤！　

pandas dataframe 过滤——apply最灵活！！！的更多相关文章

pandas DataFrame apply()函数(1)
之前已经写过pandas DataFrame applymap()函数还有pandas数组(pandas Series)-(5)apply方法自定义函数 pandas DataFrame 的 app ...
pandas DataFrame apply()函数(2)
上一篇pandas DataFrame apply()函数(1)说了如何通过apply函数对DataFrame进行转换,得到一个新的DataFrame. 这篇介绍DataFrame apply()函数 ...
Pandas DataFrame数据的增、删、改、查
Pandas DataFrame数据的增.删.改.查 https://blog.csdn.net/zhangchuang601/article/details/79583551 #删除列 df_2 = ...
Pandas DataFrame 函数应用和映射
apply Numpy 的ufuncs通用函数(元素级数组方法)也可用于操作pandas对象: 另一个常见的操作是,将函数应用到由各列或行所形成的一维数组上.Dataframe的apply方法即可实现 ...
【338】Pandas.DataFrame
Ref: Pandas Tutorial: DataFrames in Python Ref: pandas.DataFrame Ref: Pandas:DataFrame对象的基础操作 Ref: C ...
更改 pandas dataframe 中两列的位置
更改 pandas dataframe 中两列的位置: 把其中的某列移到第一列的位置. 原来的 df 是: df = pd.read_csv('I:/Papers/consumer/codeandpa ...
pandas DataFrame的查询方法（loc,iloc,at,iat,ix的用法和区别）
pandas DataFrame的增删查改总结系列文章: pandas DaFrame的创建方法 pandas DataFrame的查询方法 pandas DataFrame行或列的删除方法 pand ...
pandas.DataFrame对象解析
pandas.DataFrame对象类型解析 df = pd.DataFrame([[1,"2",3,4],[5,"6",7,8]],columns=[&quo ...
pandas.DataFrame学习系列1——定义及属性
定义: DataFrame是二维的.大小可变的.成分混合的.具有标签化坐标轴(行和列)的表数据结构.基于行和列标签进行计算.可以被看作是为序列对象(Series)提供的类似字典的一个容器,是panda ...

随机推荐

微信小程序之倒计时插件 wxTimer
微信小程序之倒计时插件 wxTimer 介绍: 用于在微信小程序中进行倒计时的组件. 功能: 1.最基础的当然就是倒计时功能了. 2.可以设置倒计时结束后执行的事件. 3.可以设置倒计时执行过程中 ...
unity 截图压缩处理
/****************************************************** unity屏幕截图,并转换成Base64码* 作者: lyb* 日期:2017年7月25 ...
1. dubbo概述
dubbo简介: 官网:http://dubbo.io 最大程度进行解耦,降低系统耦合性,可以跨工程,跨项目; 生产者/消费者模式; jdk:1.6以上 maven:3.0以上国际maven仓库:h ...
idea输出目录详解
引言:在项目中遇到了一个问题,在使用idea时,项目中Tomcat的虚拟目录映射总是失败,而当我采用myeclipse时却能映射过去. 自己花费了很长时间,终于找出了问题所在,原来是由于idea自己采 ...
XML.libXml2_ZC
1.字符串比较函数: xmlStrcmp(...) 这是大小写敏感的比较 xmlStrcasecmp(...) 这是大小写不敏感的比较(忽略字符串里面字符的大小写) 2.查找节点 2.1.循环 2.2 ...
[C#][Windows]]基于ArcFace2.0+红外双目摄像头的活体检测
废话不多说直接上图这个是demo中用到的双目摄像头,一个是红外的,一个是正常的rgb摄像头两个usb接口,在电脑上呈现两路摄像头通道程序检测RGB输出图像,当检测到有人脸时,用RGB人脸的位置到红 ...
python + lisp hy的新手注记2 eval, HyModel and python AST
来自我在Stack Overflow上的提问,https://stackoverflow.com/questions/51675355/how-to-eval-a-cond-case-and-retu ...
lumerical中DEVICE和MODE模块的交互使用（真的很干货！！可以自信的说网上绝对找不到比我更详细的步骤了）
几个脚本文件很重要! Lumerical仿真流程: 一.DEVICE: (1).建模并且运行完之后,在脚本提示符下键入以下脚本行以运行plotDopingProfile.lsf如图1(文件名如果索引不 ...
laravel配置路由除了 / 都是404解决办法
1.php.ini开启phpopenssl 2.conf (nginx为例) location / { index index.html index.htm index.php l.php; #tr ...
日常英语---二、注册google的api的key
日常英语---二.注册google的api的key 一.总结一句话总结:register google api key register_google_api_key 1.请通过电子邮件向我发送有关 ...

pandas dataframe 过滤——apply最灵活！！！

pandas dataframe 过滤——apply最灵活！！！的更多相关文章

随机推荐

热门专题