大数据征信：数据源的量与度是关键

数据猿

发布于 2018-04-19 15:03:46

6340

发布于 2018-04-19 15:03:46

文章被收录于专栏：数据猿

<数据猿导读>

如今大数据已经被应用到方方面面，征信行业也如此。大数据的海量数据能够帮助征信行业快速便捷的掌握客户的信息，为工作提供不小的便利，然而有利就有弊，以当前的技术来说把控数据源的量与度仍是关键

随着互联网的发展，大数据征信已被越来越多地运用到金融领域，互联网金融平台利用大数据判断用户的信用记录是否良好，从而授予用户相应的信贷额度。传统银行也在加紧布局大数据网络，试图与互联网平台接轨。

与传统信用评估模型不同的是，传统的信用评估是根据一个人的借贷历史和还款表现，通过逻辑回归的方式来判断这个人的信用情况，而大数据征信的数据源则十分广泛，电子商务、社交网络和搜索行为等都产生了大量的数据，在如此海量的数据面前，如何把控数据源的“量”与“度”是互联网平台和传统金融机构需要重视并解决的问题。如今一切信息皆可以成为信用数据，经过分析后用于证明一个人或企业的信用状况。

大数据的“量”是指：有多少个体在被分析，每一个网上注册账号的个体都可以成为被分析的对象。

数据源的“度”是指：被分析的个体都有哪些方面能够成为可以参考的数据。

有很多人认为数据能够被称为“大数据”需具备两个因素：第一要覆盖面广，用户足够多;第二维度广，要从一个人行为的方方面面反映个体的行为与信用的关系。但是，笔者认为事实并非如此，数据的“量”与“度”也应严格加以控制。

把控大数据的“量”关键在于从大量的数据之中筛选出“有效用户”。无论是在传统金融领域，还是互联网金融领域，给客户做信用评估的前提是必须知道这个人就是他自己。所以，如何证明“你是你”是大数据征信首先要解决的问题。然而现实的情况是：一个人可以同时申请多个账号，多个人在知道账户信息的条件下也可以同时使用一个账号。在这样的情况下数据信息往往有所重叠。因此，数据的体量大并不代表数据更加可靠。

随着越来越多的金融业务互联网化，“反欺诈”面临的挑战也日益增大。“身份认证”的重要性在各项监管文件中反复被强调，而各家机构也在不断探索如何利用新的技术在网上实现身份的核实。金融机构在重视数据量的同时还可运用先进的科学技术手段，如指纹、虹膜、人脸识别等一系列生物识别技术，将大量的无效信息排除在外，同时也能够抵御数据造假所带来的信用风险。

对数据源“度”的有效性进行控制也是金融平台和金融机构需要考虑的问题。社交软件在数据量上有着非常明显的优势，许多社交软件常常从用户行为上分析判断一个人的信用是否良好，这就有可能出现“分析过度”的情况。

在一些大数据征信的文章中，一些案例是这样分析个人行为和信用评分的关系的：经常半夜上网的用户可能被认为没有稳定的工作而降低信用评分，购买大件家具的用户可能提示有固定房屋资产而使其信用评分较高，微博更新频繁的用户可能因为社交活跃而信用评分较高等等。但这些因素并不十分稳定且准确，有些行为可能只是用户的个人习惯，如果过度依赖这些因素将对用户信用的判断产生误差。因此，哪些行为可以成为判断个人信用的标准需要考量。

因此，大数据能够成为金融机构的征信参考标准并不一定要求数据量大、数据的维度多，数据的有效性高、数据更能反映问题才能让征信更加全面、可靠。

本文参与腾讯云自媒体同步曝光计划，分享自微信公众号。

原始发表：2016-01-20，如有侵权请联系 cloudcommunity@tencent.com 删除

大数据