腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
2
回答
如何
根据
列
值
将
数据
拆
分成
训练
和
测试
,
并
对
组合
进行
打乱
?
python
、
pandas
、
dataframe
我有一个
数据
集,我希望
根据
列
值
拆分
数据
集。在每次迭代中,
训练
集
将
包括所有
数据
,除了那些属于2个
值
的
数据
,这些
值
将
保留用于
测试
集。 例如,我们有
值
为a、b、c、d、e
和
f的
列
x。目前我正在做手动选择,但由于我想尝试每种可能的
组合
,我不确定
如何
做得最好。train = df.lo
浏览 6
提问于2018-08-13
得票数 0
回答已采纳
1
回答
mAP应该在验证集或
测试
集上计算?
machine-learning
、
deep-learning
、
computer-vision
、
object-detection
验证集
和
测试
集(未见
数据
)在计算度量(例如mAP)方面有什么不同?文学中通常做些什么?为什么?
浏览 0
提问于2022-02-15
得票数 0
2
回答
用支持向量机预测时间序列的未来
值
r
、
svm
、
forecasting
我在R中使用支持向量回归来预测单变量时间序列的未来
值
。
将
历史
数据
分成
测试
集
和
训练
集,使用R中的svm函数
对
测试
数据
建立模型,然后
对
训练
数据
使用predict()命令来预测
训练
集的
值
。我们有一个模型,通过
对
训练
数据
检查该模型,我们发现该模型是有效的。我
如何
使用
浏览 9
提问于2015-04-14
得票数 2
3
回答
何时停止
训练
-洛夫MLP
machine-learning
、
statistics
、
neural-network
、
keras
我正在运行一个MLP来
将
一组
值
分类为10个不同的类。对于每个对象,我
将
数据
分成
一个由99个对象组成的
训练
集
和
一个其余对象的
测试</em
浏览 4
提问于2016-06-01
得票数 0
回答已采纳
1
回答
新
测试
数据
( TFLearn )上的LSTM/RNN模型失败
machine-learning
、
lstm
、
audio-recognition
、
tflearn
我
对
ML相当陌生,目前我正试图开发一个可以通过从音频文件中提取classify spoken digits (0-9)的模型。我在一个由15位演讲者
和
2400个培训示例(每个数字有240个音频示例)组成的
数据
集上
对
模型
进行
了培训。经过3000 epochs后,该模型的精度达到97%。
浏览 0
提问于2018-06-06
得票数 0
2
回答
取多个神经网络的平均值?
machine-learning
、
neural-network
、
deep-learning
、
cross-validation
、
ensemble-modeling
我用一个非常小的
数据
集来拟合一个神经网络,所以试着把
数据
分成
训练
和
验证集。(有一个单独的
测试
集)如果我
将
训练
/验证随机
分成
几次,为每个
训练
/验证分裂构造一个神经网络,
并
取
测试
集上神经网络预测
值
的平均值,它是否可以称为集成模型?或者,这种技术是否有一个特定的名称?编辑:我刚刚发现一种类似的技术叫做“重复随机次抽样验证”,但是RRSSV
将<
浏览 0
提问于2018-01-29
得票数 2
1
回答
生产
数据
规范化
data-science-model
、
normalization
在
训练
模型时,我们
将
数据
集
分成
训练
集
和
测试
集。如果需要对任何
列
进行
规范化/标准化,则
对
培训集
和
测试
集分别
进行
此过程,以防止
数据
泄漏。
对
训练
集的参数
进行
了归一化处理。MinMaxScaler()test = sc
浏览 0
提问于2021-06-29
得票数 1
2
回答
一次热编码后的预测
dataset
、
regression
、
prediction
、
dummy-variables
我有一个回归模型,我想
根据
从最终用户那里得到的
值
进行
预测。 但我
对
我的模型
如何
预测新的价值感到困惑。由于我
将
只从最终用户那里得到一个区域
浏览 0
提问于2019-07-24
得票数 2
1
回答
“
对
培训集的交叉验证”,而开发
和
测试
集与培训是不同的:这有意义吗?语义错误?
cross-validation
、
bert
衡量新闻情绪”中的这段文字卡住了:https://www.sciencedirect.com/science/article/pii/S0304407620303535#tbl3 “作为最佳实践,我们
将
标记的
数据
集
分成
一个
训练
集、一个开发集
和
一个持久
测试
集。开发
和
测试
集各有100个观测
值
,为
训练
集留下600个观测
值
。(.)超参数优化是通过网
浏览 0
提问于2022-10-10
得票数 3
3
回答
机器学习:基于
测试
数据
的
训练
模型
machine-learning
我想知道一个模型是否也是从
测试
数据
中
训练
自己,同时
对
它
进行
多次评估,从而导致了一个过度拟合的场景。通常,我们
将
训练
数据
分成
train-test分割,我注意到有些人将它
分成
3组
数据
-- train、test
和
eval。eval是
对
模型的最终评价。我可能错了,但我的观点是,如果上面提到的场景不是真的,那么就不需要eval
数据
集。 需要澄清一下。
浏览 5
提问于2018-01-03
得票数 1
回答已采纳
2
回答
Matlab机器学习培训,验证,
测试
分区
matlab
、
validation
、
machine-learning
我使用Matlab的统计
和
机器学习工具箱创建决策树、集合、Knn模型等。我希望
将
数据
分离到
训练
/
测试
分区中,然后让模型使用
训练
数据
进行
训练
和
交叉验证(实际上是
将
训练
数据
分成
训练
数据
和
验证
数据
),同时保存
测试
数据
以
进行</e
浏览 1
提问于2016-01-27
得票数 3
回答已采纳
5
回答
交叉验证
和
网格搜索有什么区别?
cross-validation
、
definition
、
difference
、
grid-search
简单地说,交叉验证
和
网格搜索的区别是什么?网格搜索是
如何
工作的?我是不是应该先做交叉验证,然后再做网格搜索?
浏览 17
提问于2013-10-12
得票数 53
1
回答
如何
优化叠加模型中的超参数?
machine-learning
、
ensemble-modeling
、
hyperparameter
、
meta-learning
我想知道是否有人能解释
如何
为基础学习者优化超参数,以及叠加时的元算法?在许多教程中,他们似乎是从稀薄的空气中拔出来的!杰克
浏览 0
提问于2019-07-29
得票数 0
回答已采纳
1
回答
模型:在培训
和
部署期间
predictive-modeling
、
model-selection
众所周知,在模型
训练
期间,我们坚持
测试
集。然而,我实际上在部署过程中发现,如果在整个
数据
集(train+test)上使用新的模型序列,实际上在预测真正的“未见”
数据
方面也会产生相当好的结果。我正在寻找
对
这种方法的评论。有什么问题吗? 特别是,在这种方法中,我将对整个
数据
集应用任何类型的转换,例如标准化/规范化/分类编码。
对
部署来说不是更好吗?(与传统方法相比,所有这些转换只在火车集中
进行
,有时无法对火车集中缺少的某些类别的
数
浏览 0
提问于2022-04-06
得票数 0
回答已采纳
1
回答
什么形式的
数据
用于预测广义堆叠集合?
ensemble-modeling
、
generalization
、
ensemble-learning
我非常困惑
如何
分割
训练
数据
,以及在使用广义叠加时
对
0级
数据
的预测。这个问题类似于我的问题,但答案还不够清楚: 1个级模型的预测
如何
成为一种新模型的
训练
集。我的理解是
训练
集是分裂的,基本模型是在一个分裂上
训练
的,而预测是在另一个分裂上
进行
的。这些预测现在成为新
数据
集的特性。一个
列
用于每个模型的预测,另一个
列
包含这些预测的基本事实。
将
训练</
浏览 0
提问于2020-05-16
得票数 1
回答已采纳
1
回答
标准化/分解培训/
测试
一起还是分开?
machine-learning
、
standards
X
数据
的两个常见的ML预处理步骤是标准化(例如,缩放到单位方差)
和
分解(
将
特征映射到一个新空间AIUI)。在ML管道中实现这些步骤(包括培训/
测试
/验证集)的两种可能方法是: 1)
对
整个
训练
/
测试
/验证X
数据
集
进行
标准化/分解,然后分解成
训练
/
测试
集,
并
使用最小误差模型
对
验证集
进行
预测。
浏览 2
提问于2015-05-12
得票数 1
回答已采纳
3
回答
如何
用另一个数组的
值
填充两个numpy数组
python
、
arrays
、
numpy
我
对
裸体很陌生。我需要一个
数据
集,
并
创建一个
测试
集,并从中设置一个培训。如果我的dataset是一个由150行
和
4
列
组成的numpy数组(最后一
列
是标签),那么正确的方法是
如何
用
数据
集的
值
填充
训练
和
测试
数组?也就是说,我不想手动编写用于
测试
和
训练
集的形状?我想要做的是,提供一个拆分值,它将接受一个
数据<
浏览 7
提问于2017-03-23
得票数 1
回答已采纳
1
回答
在选择最佳超参数
组合
后,SparkML CrossValidator是否重新适合完整的
训练
数据
集?
apache-spark
、
pyspark
、
cross-validation
、
apache-spark-mllib
、
apache-spark-ml
在
训练
数据
集上交叉验证超参数网格后,SparkML的CrossValidator是否重新适合整个
训练
数据
集?如果不是,它会从交叉验证的哪一部分中选择用于推断的bestModel?为此,CrossValidator是否使用最佳超参数在整个
训练
/交叉验证
数据
集上重新
训练
,
并
使用重新拟合的模型
进行
推理?或者,bestModel用于推断所有交叉验证文件夹中的最佳性能模型(即,来自最佳性能超参数
组合
的最佳文件夹中的模
浏览 22
提问于2021-03-23
得票数 0
2
回答
标记
数据
异常检测中的交叉验证
scikit-learn
、
cross-validation
、
anomaly-detection
、
autoencoder
、
isolation-forest
我正在从事一个项目,在那里我
训练
异常检测算法,隔离森林
和
自动编码器。我的
数据
是标记的,所以我有基本的真实性,但问题的性质需要无监督/半监督异常检测方法,而不是简单的分类。因此,我
将
只使用标签
进行
验证。 既然我不会用标签来
训练
模型,而不像在有监督的学习中使用X_train、X_test、y_train
和
y_test,那么在这里
进行
模型验证的正确方法是什么?如果这是监督学习,我会把
数据
分成
3部分:
训练<
浏览 0
提问于2020-07-16
得票数 1
3
回答
使用OneHotEncoder后的不同特性数
scikit-learn
、
feature-engineering
、
feature-scaling
我在两个独立的文件中有
训练
和
测试
数据
。 OneHotEncoder
根据
不同的
值
为列车
和
测试
数据
提供了不同数量的特性。但是分类器要求
测试
和
训练
数据
的特征数应该相等,
如何
解决这个问题?
浏览 0
提问于2018-03-13
得票数 2
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券