在Kaggle上通过一个关于回归的内核时,提到了数据应该看起来像正态分布。但是我不明白为什么?我知道这个问题可能很基本,但请帮助我理解这个概念。
提前感谢!!
发布于 2019-06-27 12:45:21
回归模型做了许多假设,其中之一是正态分布。当这个假设被违反时,那么你的p值和你的系数估计的置信区间可能是错误的,从而导致关于你的预测值的统计意义的错误结论。
然而,一个常见的误解是数据(即变量/预测值)需要正态分布,但这不是真的。这些模型不会对预测因子的分布做出任何假设。
例如,假设你在回归中有一个二元预测变量(男性/女性;慢/快等)-这个变量不可能是正态分布的,但它仍然是一个有效的预测变量,可以在回归模型中使用。正态假设实际上指的是残差的分布,而不是预测值本身。
https://stackoverflow.com/questions/56777257
复制相似问题