python处理文本数据

处理文本数据，主要是通过Seris的str访问。遇到NaN时不做任何处理，保留结果为NaN，遇到数字全部处理为NaN。

str是Seris的方法，DataFrame不能直接使用，但是通过索引选择DataFrame中的某一行或者某一列，结果为Seris，然后就可以使用了。

例如定义一个Seris和DataFrame如下

s = pd.Series([' ab',1,' bb ',np.nan,'bc '])

dic = {'one':[0,2,2,4],'two':[2,np.nan,4,6],'three':['a','b',np.nan,2]}

df = pd.DataFrame(dic,index=['d','e','f','g'])

将上述s全部变成大写字母，将df的列名称变成大写。

s = s.str.upper()

df.columns = df.columns.str.upper()

以下都以Seris做示例，这些方法与python字符串的操作类似

print(s.str.lower())   #将s中的各字符串全部变为小写

print(s.str.upper())   #将s中的各字符串全部变为大写

print(s.str.capitalize())   #将s中的各字符串全部变为首字母大写

print(s.str.len())    #求s中各字符串的长度

print(s.str.count('b'))   #求s中的各字符串元素包含几个b

print(s.str.startswith('a'))   #判断s中的各字符串是否以a开始

print(s.str.endswith('a'))   #判断s中的各字符串是否以a结束

print(s.str.contains('b'))  #判断s中的各字符串是否包含b

print(s.str.strip())   #去掉s中字符串元素两边的空格

print(s.str.lstrip())   #去掉s中字符串元素左边的空格

print(s.str.rstrip())   #去掉s中字符串元素右边的空格

print(s.str.replace('原字符','替换字符',1))  #将原字符串替换为指定字符串，默认替换所有满足条件的，n表示替换前n个满足条件的

split()和rsplit()

split()表示从左边开始分割，rsplit()表示从右边分割，分割后的结构为一个列表

s = pd.Series(['a,b,c,d',np.nan,['a..c'],'1,2,3'])

print(s.str.split(','))   #对Seris中的元素按照,分割，即对'a,b,c'、np.nan、['a..c']、'1,2,3'按照,分割

print(s.str.split(',').str[0])   #获取每个元素分割后的第一个值，分割后的结果也为Seris，也需要通过str来获取每个元素

print(s.str.split(',',expand=True,n=1))  #expand为True表示将原列按照分割符拆分为㢵列，n表示拆分次数，默认不拆分，如果拆分默认拆分最多次

# 0    [a, b, c, d]

# 1             NaN

# 2             NaN

# 3       [1, 2, 3]

# dtype: object

# 0      a

# 1    NaN

# 2    NaN

# 3      1

# dtype: object

#      0      1

# 0    a  b,c,d

# 1  NaN    NaN

# 2  NaN    NaN

# 3    1    2,3

python处理文本数据的更多相关文章

用python处理文本数据学到的一些东西
最近写了一个python脚本,用TagMe的api标注文本,并解析返回的json数据.在这个过程中遇到了很多问题,学到了一些新东西,总结一下. 1. csv文件处理 csv是一种格式化的文件,由行和列 ...
Python的文本数据
字符串的一些方法! 1.text.endswith(".jpg") 如果字符串是以给定子字符串结尾的,就返回值True. 2. text.upper(): ...
python读取文本数据某一列
import codecs f = codecs.open('test1 - 副本.txt', mode='r', encoding='utf-8') # 打开txt文件,以'utf-8'编码读取 l ...
Python文本数据互相转换（pandas and win32com）
(工作之后,就让自己的身心都去休息吧) 今天介绍一下文本数据的提取和转换,这里主要实例的转换为excel文件(.xlsx)转换world文件(.doc/docx),同时需要使用win32api,同py ...
[Python] 糗事百科文本数据的抓取
[Python] 糗事百科文本数据的抓取源码 https://github.com/YouXianMing/QiuShiBaiKeText import sqlite3 import time im ...
Python之读写文本数据
知识点不多一:普通操作 # rt 模式的 open() 函数读取文本文件 # wt 模式的 open() 函数清除覆盖掉原文件,write新文件 # at 模式的 open() 函数添加write ...
python多种格式数据加载、处理与存储
多种格式数据加载.处理与存储实际的场景中,我们会在不同的地方遇到各种不同的数据格式(比如大家熟悉的csv与txt,比如网页HTML格式,比如XML格式),我们来一起看看python如何和这些格式的数 ...
python matplotlib plot 数据中的中文无法正常显示的解决办法
转发自:http://blog.csdn.net/laoyaotask/article/details/22117745?utm_source=tuicool python matplotlib pl ...
如何使用 scikit-learn 为机器学习准备文本数据
欢迎大家前往云+社区,获取更多腾讯海量技术实践干货哦~ 文本数据需要特殊处理,然后才能开始将其用于预测建模. 我们需要解析文本,以删除被称为标记化的单词.然后,这些词还需要被编码为整型或浮点型,以用作 ...

随机推荐

mybatis源码配置文件解析之四：解析plugins标签
在前边的博客在分析了mybatis解析typeAliases标签,<mybatis源码配置文件解析之三:解析typeAliases标签>.下面来看解析plugins标签的过程. 一.概述 ...
Write a program to copy its input to its output, replacing each string of one or more blanks by a single blank.
#include <stdio.h> void main() { int c,c_BCN; while((c=getchar())!=EOF) { if(c!=' ') c_BCN=; i ...
NOIp ( on line ) 提高组 2020 总结
T1 : 序列题意: 一共有T组数据,每组数据有两个长度为n的序列a,b,m个操作,问a序列是否可以转换成b,是输出YES,否的话输出NO. m个操作分别为ti,xi,yi,若t为1,则x和y上的数 ...
spring和springmvc包扫描问题
写这篇博客之前,橘子松必须感慨下!!找了我一下午加一晚上(md),问了几个朋友也没找到.凉了啊在搭建ssm之前,我把controller service mapper包扫描用基本包扫描都写在a ...
web前端工程化/构建自动化
前端工程化前端工程化的概念在近些年来逐渐成为主流构建大型web应用不可或缺的一部分,在此我通过以下这三方面总结一下自己的理解. 为什么需要前端工程化. 前端工程化的演化. 怎么实现前端工程化. 为什 ...
call_user_func的使用
<?php function demo01($a) { echo $a; } call_user_func("demo01", "hello world" ...
Redis 6.0 redis-cluster-proxy 说明
背景 Redis3.0版本之后开始支持了Redis Cluster,Redis也开始有了分布式缓存的概念.关于Redis Cluster的相关说明,可以看之前的几篇文章:Redis Cluster 原 ...
day68 form组件
目录一.自定义分页器的拷贝和使用二.Forms组件 1 前戏 2 form组件的基本功能 3 基本使用 4 基本方法 5 渲染标签 6 展示提示信息 7 钩子函数(HOOK) 8 forms组件其 ...
简单讲解一下http2的多路复用
在 HTTP/1 中,每次请求都会建立一次HTTP连接,也就是我们常说的3次握手4次挥手,这个过程在一次请求过程中占用了相当长的时间,即使开启了 Keep-Alive ,解决了多次连接的问题,但是依然 ...
CentOS7安装Oracle 11g
准备工作 1.下载Oracle安装包:linux.x64_11gR2_database_1of2.zip 和 linux.x64_11gR2_database_2of2.zip ,可以下载到本地,通过 ...

python处理文本数据

python处理文本数据的更多相关文章

随机推荐

热门专题