专栏首页SAMshare特征锦囊:如何把“年龄”字段按照我们的阈值分段?

特征锦囊:如何把“年龄”字段按照我们的阈值分段?

今日锦囊

特征锦囊:如何把“年龄”字段按照我们的阈值分段?

我们在进行特征处理的时候,也有的时候会遇到一些变量,比如说年龄,然后我们想要按照我们想要的阈值进行分类,比如说低于18岁的作为一类,18-30岁的作为一类,那么怎么用Python实现的呢?

是的,我们还是用到我们的泰坦尼克号的数据集,对数据进行预处理操作,见下:

# 导入相关库
import pandas as pd
import numpy as np
from pandas import Series,DataFrame

# 导入泰坦尼的数据集
data_train = pd.read_csv("./data/titanic/Train.csv")
# 修复部分age的值
data_train.loc[(data_train.Age<=1),'Age'] = 1
# 只保留部分值
data = data_train.loc[:,['PassengerId','Age']]
data.head()

然后,我们编辑代码,按照我们的预期进行分组:

# 确定阈值,写入列表
bins = [0, 12, 18, 30, 50, 70, 100]
data['Age_group'] = pd.cut(data['Age'], bins)

dummies_Age = pd.get_dummies(data['Age_group'], prefix= 'Age')
data = pd.concat([data, dummies_Age], axis=1)

data.head()

这样子就很神奇了吧,把年龄按照我们的需求进行分组,顺便使用独热编码生成了新的字段。

对今天的内容,大家还有其他需要了解的吗?欢迎留言咨询~

本文分享自微信公众号 - SAMshare(gh_8528ce7b7e80),作者:Flora

原文出处及转载信息见文内详细说明,如有侵权,请联系 yunjia_community@tencent.com 删除。

原始发表时间:2020-01-10

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

我来说两句

0 条评论
登录 后参与评论

相关文章

  • 特征锦囊:怎么把画出堆积图来看占比关系?

    未来几个特征锦囊的内容会使用泰坦尼克号的数据集,大家可以在下面的链接去下载数据哈。

    Sam Gor
  • 特征锦囊:怎么批量把特征中的离群点给“安排一下”?

    这个专栏停了也有一段时间了,自从上次对之前的内容进行了一次梳理之后,似乎是给自己一个“借口”休息了一阵子,现在感觉还是得重新拿出来继续更新了。

    Sam Gor
  • 特征锦囊:怎么把几个图表一起在同一张图上显示?

    未来几个特征锦囊的内容会使用泰坦尼克号的数据集,大家可以在下面的链接去下载数据哈。

    Sam Gor
  • 利用LSTM框架实时预测比特币价格

    比特币的价格数据是基于时间序列的,因此比特币的价格预测大多采用LSTM模型来实现。

    矩池云
  • vscode中调试vue工程

    第一步: 首先确保 Chrome浏览器已正确安装,并在 vscode 中添加 vscode-chrome-debug 插件;

    奋飛
  • 从SAP最佳业务实践看企业管理(46)-SD-换货

    如果发出去的商品质量有问题,客户投诉过来要换货,则可以先做退货,然后做免费发货。 SD 110 免费交货 用途: 本业务情景描述了免费给客户提供货物的流程。创建...

    SAP最佳业务实践
  • Hadoop+Hbase集群数据迁移问题

    我是攻城师
  • 一文理解java对象初始化顺序

    ​ 由类加载器负责根据一个类的全限定名来读取此类的二进制字节流到JVM内部,并存储在运行时内存区的方法区,然后将其转换为一个与目标类型对应的java.lang....

    SecondWorld
  • Python+Lucene

    pylucene让Python可以调用Lucene API实现搜索,这个项目紧跟Lucene的步调,对用惯了Python的同学来说是个福音。 pylucen...

    py3study
  • ggplot2画世界地图小实例

    image.png 另外一种形式,以下代码来自网络,原文地址 https://stackoverflow.com/questions/54964279/how-...

    用户7010445

扫码关注云+社区

领取腾讯云代金券