腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
2
回答
如何
处理
多个
非
序号
分类
变量
?
python
、
machine-learning
、
scikit-learn
、
linear-regression
但是,我无法理解
如何
处理
前两列,这两列是我的
分类
变量
。我刚刚在Udemy上开始了一门数据科学课程,讲师还没有真正解释在这个场景中应该做什么,因为他的OneHotEncoding示例只适用于具有一个
分类
变量
的数据集。
浏览 34
提问于2021-10-29
得票数 0
1
回答
线性回归使归一化或标准化后的结果更糟。
machine-learning
、
scikit-learn
、
linear-regression
我在这个数据集上执行线性回归: archive.ics.uci.edu/ml/datasets/online+news+popularity我试过使用scikit--学习规范器、StandardScaler和PowerTransformer,但结果都比不使用它们更糟糕。from sklearn.preprocessing import StandardScalerY = df['shares'] tr
浏览 1
提问于2019-01-12
得票数 3
1
回答
R中的randomForest与因子
变量
r
、
classification
、
random-forest
、
categorical-data
我有一个数据集,有一些连续
变量
,一些序数
变量
和一些
分类
定性
变量
。 我想使用一个随机森林
分类
器(我有一个
分类
结果),但我不知道
如何
处理
序号
和
分类
特性,它们目前都编码为factor。我希望序数
变量
被视为数字,而定性
变量
则将每个级别作为单独的虚拟
变量
。R的randomForest通常
如何
处理
factor特性?我是否应该将定性
变
浏览 1
提问于2022-06-24
得票数 0
回答已采纳
1
回答
以顺序
变量
、范畴
变量
和连续
变量
为预测
变量
的特征选择
classification
、
categorical-data
、
feature-selection
、
continuous
我希望从包含13000+行和162个预测
变量
的数据集中对贷款违约者进行
分类
,即0用于
非
违约者,1用于违约者。预测
变量
由范畴序数、范畴标称和连续
变量
以及虚拟
变量
组成。由于这是一个
分类
问题,我希望应用Logistic回归,支持向量机和决策树。我发现很难为这样一个不同的预测
变量
池运行特性选择。我的第一次尝试是分离
分类
变量
(包括
序号
和标称)和连续
变量
,并分别使用X平方和Anova选择特性。
浏览 2
提问于2022-06-10
得票数 0
1
回答
带有范畴的逐步GLM
matlab
、
statistics
、
regression
、
linear-regression
、
glm
我有一个由85个预测器组成的表,其中一些是数字的、逻辑的、
序号
的和标称的(热编码的)。他们预测的是一个单一的finalScore结果
变量
,其范围从0到1。建议有
分类
,但到目前为止,我还没有在我所拥有的4种类型中找到任何东西。
浏览 2
提问于2017-12-09
得票数 2
回答已采纳
2
回答
回归分析中
如何
区分
分类
变量
和序数
变量
?
encoding
、
machine-learning
、
regression
、
linear-regression
、
categorical-data
其中一些明显是
序号
(例如年份、房间数、楼层)。有些特性是绝对的,我对
如何
在编码为数字格式时
如何
处理
它们感到困惑。我对使用哪种编码方法犹豫不决:一次热编码(用于
分类
)或只是
序号
映射(序数数据)。我知道,像肤色、性别、地区、国籍这样的
分类
特征显然必须用虚拟编码来编码。同样清楚的是,这样的
分类
特征,作为条件,可能的值“旧”,‘翻新’,‘新’可以分别被排序和编码为1,2,3。但我不知道
如何
编码不太明显的特性。这种特征的本质并不是立即被注意到的
浏览 0
提问于2015-12-07
得票数 0
回答已采纳
1
回答
处理
包含
多个
非
序数
分类
功能的Pandas数据帧
machine-learning
、
python
、
feature-selection
、
feature-engineering
我目前正试图分析一个包含
多个
非
序数
分类
特征和一个二进制目标
变量
的数据集。50 | cat 450 | 1 |整个表是400.000行x15列,其中最后一列是目标
变量
每个特性都有
多个
非
序数类别,从9个类别到数百个类别不等。 我的第一反应是对所有的
分类
变量
进行一次热编码。然而,我害怕这样做会使任何模型都会变得过于合适。
如
浏览 0
提问于2020-06-03
得票数 1
回答已采纳
1
回答
具有顺序和标称尺度数据的聚类、混合数据集
feature-scaling
、
clustering
在阅读了在聚类中
如何
考虑
分类
数据之后,我得出的结论是,大多数帖子并没有区分标称尺度数据,如颜色:红色、绿色、蓝色和
序号
数据,例如大小:小、中、大。然而,项目之间的距离在
序号
尺度上是有意义的,即使它们在所有项目之间不一定是相同的。我是否可以简单地将
序号
数据转换为数字比例尺,而不会给集群带来很多麻烦?我所发现的最简单的方法,如果没有太多的项目在秤上,是分解标度,并为每个项目添加一个
变量
。例如,我们最初有颜色:红色、绿色、蓝色,我们设置
变量
colour_red、
浏览 0
提问于2019-05-15
得票数 1
回答已采纳
1
回答
寻找
处理
ML
分类
数据的最佳方法
python
、
statistics
、
data-science
当我需要对教育水平这样的
变量
进行有序
处理
时,它也并不总是有效的。您使用哪些常见的工作场所技术来
处理
包含某些
分类
数据或几乎所有
分类
数据的数据集? 记住,数据可能是名义的或
序号
的。
浏览 4
提问于2020-07-09
得票数 1
1
回答
如何
对
分类
输入
变量
进行回归输出的可视化(绘制图)?
machine-learning
、
visualization
、
categorical-data
、
linear-regression
我在做多
变量
线性回归。在我的数据中,我有143个特征和13000个训练例子。我的一些特性是连续的(
序号
)
变量
(面积,年份,房间数量)。但我也有
分类
变量
(地区,颜色,类型)。例如,下面是area与预测的price的对比图:由于area是连续序数
变量
,所以可视化数据没有任何问题。但现在,我想以某种方式将我的
分类
变量
(如地区)对预测价格的依赖性想象出来。对于
分类
变量
,我使用了一个热(虚拟)编码。例如,这类数据: 📷
浏览 0
提问于2015-12-10
得票数 1
回答已采纳
1
回答
Keras -无法将numpy数组转换为张量对象
python
、
pandas
、
numpy
、
tensorflow
、
keras
有人能告诉我
如何
解决这个问题吗?提前谢谢!单击此处查看我尝试作为列车特征上传的数据帧。 在此处输入图像描述 model.summary() = 在此处输入图像描述
浏览 73
提问于2021-03-02
得票数 0
回答已采纳
2
回答
处理
python中不同数据类型的NaiveBayes
分类
器
python
、
scikit-learn
、
gaussian
、
naivebayes
我试图在Python中实现朴素的Bayes
分类
器。我的属性有不同的数据类型:字符串、Int、浮点数、布尔值、
序号
。我可以使用高斯朴素贝叶斯
分类
器(Sklearn.naivebayes : package),但我不知道
如何
处理
不同的数据类型。
分类
器引发错误,声明不能
处理
除Int或float以外的其他数据类型。但我也怀疑,如果我这样做,
分类
器会有多好。
浏览 4
提问于2015-06-19
得票数 1
回答已采纳
1
回答
如何
对
分类
输入
变量
进行回归输出的可视化(绘制图)?
matplotlib
、
machine-learning
、
regression
、
linear-regression
、
categorical-data
我在做多
变量
线性回归。在我的数据中,我有n =143个特性和m = 13000训练示例。我的一些特性是连续的(
序号
)
变量
(面积,年份,房间数量)。但我也有
分类
变量
(地区,颜色,类型)。例如,下面是area与预测的price的对比图: 由于area是连续序数
变量
,所以可视化数据没有任何问题。但现在,我想以某种方式将我的
分类
变量
(如地区)对预测价格的依赖性想象出来。对于
分类
变量
,我使用了一个热(虚拟)编码。例如,这
浏览 1
提问于2015-12-10
得票数 2
回答已采纳
2
回答
CNN用于顺序
分类
machine-learning
、
deep-learning
、
image-classification
、
class-imbalance
、
convolutional-neural-network
我们
如何
设计一个CNN的
序号
分类
? 我正试着分析植物叶片图像中的疾病。我已经把疾病
分类
做好了。现在我们需要将疾病的严重程度
分类
为1到10 (序数),其中1几乎没有叶上病变部位的痕迹,10是完全患病。我
如何
处理
训练样本在每个序数水平上的不平衡?
浏览 0
提问于2017-10-04
得票数 1
3
回答
如何
处理
K-方法中的
分类
特征?
machine-learning
、
clustering
、
k-means
、
python-3.x
我在
处理
泰坦尼克号数据集。它包含6个
分类
特征。我在这个数据集上使用了k均值算法。我对
分类
特征使用标签编码。但是我发现
分类
特征应该使用欧几里德距离。它应该使用Hamming距离。那么,
如何
使k-意味着精细地工作在混合特征上?我不需要其他算法。我只想在混合特征数据集上使用k--意思。
浏览 0
提问于2020-06-23
得票数 1
2
回答
决策树与
分类
特征标记
classification
、
decision-trees
、
categorical-encoding
我正在研究一个决策树模型,并试图决定
如何
最好地
处理
分类
特性。我的数据集中的特征通常是基数高的,我发现
序号
标记比虚拟编码更好。我想知道我能否更进一步,如果,我可以根据它们与目标
变量
的相关性来分配随机数字代码,而不是指定随机数字代码。 例如,让我们假设我的一个特性是sales_rep_name,我正试图预测是否有大或小的销售。我可以按大销售额的比例对销售代表进行排名,并使用该排名作为
序号
。这样,当决策树分裂时,它在树的一边保持较低的销售代表,而在树的另一边保持较高的销售代表。这种逻辑有缺陷吗
浏览 0
提问于2021-07-20
得票数 2
1
回答
数据查询导致对顺序
变量
的转换
data-cleaning
、
correlation
如果一个
分类
列fuel_mileage中的所有值都来自set {poor, good, very_good},那么由于{poor, good, very_good}之间的普遍有序关系,我们可以使列
序号
,但是,假设这个数据集中的标签列是engine_longevity,所以我们在研究所有其他
变量
与它们之间的关系。在数据研究过程中,发现另一个
分类
列manufacturer (所有值都来自set {H, S, J, K} )与标签engine_longevity有很强的相关性,以至于在给定样本中选择H、S、J、K本质上决定了标签
浏览 0
提问于2020-04-17
得票数 3
1
回答
MultiLabelBinarizer的替代方案
machine-learning
、
classification
、
categorical-data
在对ML
分类
的数据进行预
处理
时,有很多关于
如何
处理
分类
变量
的信息。但是,我找不到任何关于
如何
处理
分类
变量
的反馈,其中每个样本可以属于
多个
标签。因此,这种方法有什么可供选择的。类似于基于目标的编码器(例如。CatBoost)
浏览 0
提问于2019-07-15
得票数 1
1
回答
如何
对R中的范畴
变量
和连续
变量
进行潜剖面分析?
r
我有4个连续
变量
(男性,女性,伴侣的男性气质,伴侣的女性气质)和2个
分类
变量
(性别认同,伴侣的性别认同),我想执行一个LPA。在我的阅读资料中,似乎可以对LPA同时使用
分类
指标和连续指示器,但我还没有找到实际使用LPA的资源。我尝试使用包tidyLPA,但它不允许我指定哪些
变量
是绝对的。我是否正确地假设LPA既可用于
分类
指标,也可用于连续指标? 谢谢!
浏览 2
提问于2020-06-04
得票数 0
1
回答
logistic回归中的LinAlgError奇异矩阵
python
、
pandas
、
logistic-regression
、
statsmodels
我正在尝试实现逻辑回归模型,但当我试图打印结果时,我得到了一个错误,我已经查找并试图找出
如何
解决,但无法解决。
浏览 2
提问于2020-10-16
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
即时通信 IM
活动推荐
运营活动
广告
关闭
领券