怎样分析样本调研数据(译)

从一个群体样本中获取群体的整体特征是许多研究设计和统计方法发展的基础。根据数据收集的算法、调研问题的类型和调研的目标,分析样本调研数据的方法各不相同。这篇文章会简洁明了的分析调研数据过程中的各种问题,同时会说明在一个完整的调研数据分析报告中应该包含什么。这些并不是基本准则而只是一些建议。

调研数据分析的过程应该包括以下步骤:

1、数据验证和探索性分析

2、确认性分析

3、数据解释

4、数据分析报告存档(用于将来的分析)

1数据验证和探索性分析

数据验证主要负责确认调查问卷被正确的完成,并且调研数据具有一致性和逻辑性。以下是一些建议性的数据验证的内容,你应该去做但并不局限于此:

1、超出范围的录入:这些通常是由于较差的问卷设计或者数据输入错误。比如一个询问受访者年龄的问题得到200岁的未分类结果,这是绝不可能的。

2、逻辑上不一致的数据:当两个或者多个变量/问题的答案放在一起时不成逻辑。问卷设计过程中运用分支逻辑方法可以帮助避免这种数据的不一致性,尽管不能完全避免。

3、编码:这将包括所有的分类结果都被编码。比如,当一个有意义的预分配标签没有被分配时,结果将没有数值。如果需要将一些调研中的开放性问题分类,人类的专业知识,可能再加上定性分析工具的帮助,可以将问题很好的分组。

一旦上述的检验内容都已完成,探索性数据图表就可以产生。在探索性分析的过程中,数据清理的战线被拉长,因为分析总结可能带来其他的问题,一旦真的出现问题,你应该在探索性分析中研究这几个方面:

1、奇怪或者极端的数值,可能是需要更正的错误。

2、解释问题的主要图表。比如是不是在某种条件下男性的比例就是比不在这种条件下的比例高?

3、迹象表明修改变量后结果会更加清晰。比如进行重新编码或转换。

4、图表可能表明新设的问题会比原来的问题更具有说明性,这对于生成假设非常重要。

当简单随机抽样不能够作为统计方法调整的方式,比如有时加权方法对于得到明确的分析结果十分必要。但是,调研者通常在开始获取信息时就运用了很好的统计方法因而不需要调整,不过以下是一些常见的统计调整方法:

1、加权: 在调整的数据中,有些被调查者或者问题或多或少的会比其他的调查者和问题更加重要。这就保证了数据更能够代表调查群体的特性。典型的做法是根据调查者/事件在样本中被选中概率来赋予相应的权重。

2、变量重组:这种方法将在原有变量的基础上,通过重新定义和重新分类的方法产生新的变量。比如,解释一个问题所需要的分类科目可以合并重组为更少的分类科目,就像我们可以把十个分类科目合并成两个。

3、维度转换:根据可比性或兼容性的目标,调研数据会使用不同的长度和种类。

2确认性分析

探索性分析可以描述发生了什么,但是这只是试探性的。我们需要确认图形信息是能反映真实情况的,因此我们需要不确定性预测,比如通过标准误差或置信区间来预测样本采集中的误差。从这个角度讲我们需要统计性分析。

统计性分析的步骤取决于以下几个方面:

1、调研的设计思路

2、响应变量的类型

3、探索性变量的类别

标准的抽样调查数据分析包括计算不同变量的比例以及它们的标准误差。连续性因变量可以通过简单线性回归或者多元线性回归进行分析。如果变量间并没有很好的线性关系,有时会用非线性回归的分析方法。对于有序变量之间的关系研究,我们可以运用Spearman秩相关或者Kendall’s tau的统计方法。对于名义变量的研究,包括对每个变量类别所占比例的统计,同时可以根据Chi-square tests(卡方检验)和Fisher’s exact test(Fisher精确检验)的方法探寻两个名义变量之间的关系。对于因变量为二分变量,自变量多于一个的情况,我们通常采用Logistic回归的方法进行分析。此外,如果因变量是有序的,我们可以采取有序Logistic回归的方法。当调研底层聚集大量观察值时,可以采用多层建模的方法进行分析。

如果调研者专注于研究主要发现或者样本调研目标,那么交叉列表在展示中将非常有效。交叉列表通常是总结报告和对比分析中的重要组成部分。

3数据解释

当你完成数据分析,是时候考虑一下调研的结果对于手头上的问题有什么意义。以下是你在数据解释的过程中应该注意的方面:

1、清楚的阐述调研结果有什么实质性的发现。

2、讨论这些新的发现是不是能够对过去的发现提供更多的实例参考。比如可以对一些通用的理论和原则提供验证,或者对于现在的理论提出实质性的修改意见。

3、运用调研中的定量数据对于目标群体进行定量预测。

4、解释你现在的数据分析结果对于调研目标的意义,而且如果需要的话,对下一步调研的步骤给予建议。

4数据分析报告存档(用于将来的分析)

分析报告存档是十分重要的!因为有人以后可能会借鉴复制你的调研结果,你可能以后也会参考之前自己的分析报告,因此如果没有很好的存档,将有可能很难回忆起来。(Via:36大数据)

原文发布于微信公众号 - 大数据挖掘DT数据分析(datadw)

原文发表时间:2015-03-22

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏磐创AI技术团队的专栏

吴恩达机器学习课程:完全用Python完成,可以的!(附代码)

可以说,吴恩达(Andrew Ng)的机器学习课程是很多人、尤其是中国学生进入机器学习世界的引路人,被认为是入门机器学习的最好课程。截至目前,有超过80000人...

3.5K3
来自专栏华章科技

烧脑:谷歌微软等巨头107道数据科学面试题,你能答出多少?

来自 Glassdoor 的最新数据可以告诉我们各大科技公司最近在招聘面试时最喜欢向候选人提什么问题。首先有一个令人惋惜的结论:根据统计,几乎所有的公司都有着自...

1181
来自专栏AI科技大本营的专栏

探索 | 神经网络到底是如何思考的?MIT精英们做了这么一个实验室来搞清楚

作者 | Larry Hardesty等 编译 | ziqi Zhang 没错!人工智能是很火,神经网络也很火,但你真的懂它吗?神经网络到底是怎么工作的?没有...

3399
来自专栏AI科技评论

苹果机器学习开发日记:如何设计能在Apple Watch上实时运行的中文手写识别系统

AI 科技评论按:随着苹果机器学习日记(Apple ML Journal)的开放,苹果分享出的设计自己产品、运用机器学习解决问题的故事也越来越多。近日苹果在上面...

39611
来自专栏专知

谷歌上线机器学习速成课程:中文配音+中文字幕+完全免费!

【导读】3月1日,Google上线了AI学习网站——Learn with Google AI,并重磅推出了机器学习速成课程MLCC,该课程基于TensorFlo...

4979
来自专栏超智能体

好多人一辈子都没搞清什么是学习

老师和家长总是告诉我们要好好学习,可从没有人告诉过我们什么是学习,学习和记忆的区别又是什么。以至于很多人误以为记忆就是学习。更讽刺的是,市面上有一大堆学习方法,...

2214
来自专栏牛客网

算法工程师:非科班机器学习工程师养成计划虐心面试实录一点人生经验

这是一篇不太专业的算法工程师面经,希望能给非科班想要从事机器学习工作的同学或学弟学妹一些建议,同时也回馈给予我很大帮助的牛客网。目前拿到的offer有:网易、三...

1K6
来自专栏机器之心

学界 | 基于Apache MXNet,亚马逊NMT开源框架Sockeye论文介绍

28710
来自专栏数说工作室

异常值检测

之前发过一篇讨论文章——异常值怎么整。 在原文评论区里(戳此→异常值怎么整?| 讨论)得到了各位大大的指教,数说君也受益匪浅,现在整理一下供大家参考: 聚类 ...

3535
来自专栏专知

用深度学习规划会议时间点——Skejul

【导读】你是不是常常烦恼找不到合适的会议时间?我也经常遇到这种问题。当前人们越来越忙,想要协调合适的会议时间是很困难的。本文中,数据科学家Favio Vázqu...

3575

扫码关注云+社区

领取腾讯云代金券