机器学习中,数据的分布是指什么呢?

  统计/机器学习 概率分布    浏览次数: 497
1

经常在各种地方看到“输入数据和输出数据分布相同”,“训练集和测试集分布相同”的说法,请问这里的分布具体指什么呢?

 

dzzxjl   2018-09-05 10:16



   1个回答 
8

对于supervised learning,分布是指关于特征$X$和结果$Y$的联合分布$F(X,Y)$或者条件$F(Y|X)$。

我们说训练集和测试集服从同分布的意思是训练集和测试集都是由服从同一个分布的随机样本组成的,也就是

$$(X_{train},Y_{train}), (X_{test},Y_{test}) \text{ i.i.d. }~\sim F(X,Y)$$


对于unsupervised learning,分布是指特征$X$的分布$F(X)$,也就是

$$X_{train}, X_{test} \text{ i.i.d. }~\sim F(X)$$


补充几句:

但是现实中比较难做到这点,特别是当训练集是过去的数据,测试集是当下的数据,由于时间的因素,它们很可能不是完全同分布的,这就增加了预测难度。

这也是为什么一般交叉验证的误差往往小于实际的测试误差。因为交叉验证中每折数据都是来自训练集,它们肯定是同分布的。

如果训练集和测试集的分布风马牛不相及,那么根据训练集学习得到的模型在测试集上就几乎没有什么用了。所以我们训练模型和应用模型时一个重要的前提假设就是训练集和测试集是同分布的。

另外一个方面是牵涉到过拟合问题,即使训练集和测试集是同分布的,由于数据量的问题,训练集的分布可能无法完整体现真实分布,当我们过分去学习训练集分布的时候,我们反而会远离真实分布(以及测试集的分布),造成预测不准确,这就造成过拟合。

SofaSofa数据科学社区 DS面经 问答 实战

kidd23   2018-09-05 23:09

解释地很清晰,谢谢! - dzzxjl   2018-09-06 10:02


  相关主题

二项分布的正态近似   2回答

均匀分布的上限的最大似然估计   1回答

两个独立的正态随机变量的乘积服从什么分布?   1回答

生成两组不独立的标准正态分布随机数   1回答

python产生服从常用概率分布的随机数   1回答

现实生活中有哪些例子是服从帕累托分布的?   1回答

python中实现box-cox变换的函数?   1回答

关于高斯混合模型的分布的疑问   3回答

KL divergence为什么不是对称的?   3回答

怎么理解指数分布里的参数lambda?   1回答

python中计算KL divergence   1回答

用高斯混合模型(GMM)做聚类时,怎么确定component的个数?   2回答



回答问题时需要注意什么?

我们谢绝在回答前讲“生动”的故事。

我们谢绝“这么简单,你自己想”、“书上有的,你认真看”这类的回答;如果你认为对方的提问方式或者内容不妥,你可以直接忽略该问题,不用进行任何作答,甚至可以对该问题投反对票。

我们谢绝答非所问。

我们谢绝自己不会、硬要回答。

我们感激每一个用户在编写答案时的努力与付出!