前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >【新星计划】【数据清洗】pandas库清洗数据的七种方式

【新星计划】【数据清洗】pandas库清洗数据的七种方式

作者头像
天道Vax的时间宝藏
发布2021-08-11 15:52:15
1.2K0
发布2021-08-11 15:52:15
举报

1.处理数据中的空值

我们在处理真实的数据时,往往会有很多缺少的的特征数据,就是所谓的空值,必须要进行处理才能进行下一步分析

空值的处理方式有很多种,一般是删除或者填充

Excel通过“查找和替换”功能实现空值的统一替换:

图片
图片

通过“定位”删除空值:

图片
图片

pandas处理空值的方式比较灵活,可以使用dropna函数删除空值

代码语言:javascript
复制
import pandas as pd
data=pd.read_csv('成绩表.csv',encoding='gbk')
data.dropna(how='any')
图片
图片
图片
图片

用fillna函数实现空值的填充

①使用数字0填充数据表中的空值

代码语言:javascript
复制
data.fillna(value=0)  
图片
图片

②使用平均值填充数据表中的空值

代码语言:javascript
复制
data['语文'].fillna(data['语文'].mean())

图片
图片

2.删除空格

excel中清理空格很简单,直接替换即可

pandas删除空格也很方便,主要使用map函数

代码语言:javascript
复制
data['姓名']=data['姓名'].map(str.strip)
data

图片
图片

3.大小写转换

excel中大小写转换函数分别为upper()和lower()

pandas中转换函数也为upper()和lower()

代码语言:javascript
复制
data['拼音']=data['拼音'].str.upper()
data
图片
图片
代码语言:javascript
复制
data['拼音']=data['拼音'].str.lower()
data

图片
图片

4.更改数据格式

excel中更改数据格式通过快捷键“ctrl+1”打开“设置单元格格式”:

图片
图片

pandas使用astype来修改数据格式,以将“语文”列改成整数为例

代码语言:javascript
复制
data['语文'].dropna(how='any').astype('int')

图片
图片

5.更改列名称

excel中更改列名称就不说了,大家都会

pandas使用rename函数更改列名称,代码如下:

代码语言:javascript
复制
data.rename(columns={'语文':'语文成绩'})

图片
图片

6.删除重复值

excel的功能区“数据”下有“删除重复项”,可以用来删除表中的重复值,默认保留最第一个重复值,把后面的删除:

图片
图片

pandas使用drop_duplicates函数删除重复值:

代码语言:javascript
复制
data['数学'].drop_duplicates()  #默认删除后面的重复值
代码语言:javascript
复制
data['数学'].drop_duplicates(keep='last')  #删除第一项重复值

7.修改及替换数据

excel中使用“查找和替换”功能实现数值的替换

pandas中使用replace函数实现数据替换

代码语言:javascript
复制
data['姓名'].replace('成  功','失  败')
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2021-05-15 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 1.处理数据中的空值
  • 2.删除空格
  • 3.大小写转换
  • 4.更改数据格式
  • 5.更改列名称
  • 6.删除重复值
  • 7.修改及替换数据
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档