数据咨询师经验之谈:90% 的公司并不需要机器学习

编者按:掌握一件工具之前,首先要搞清楚用它做什么。而本质是工具的机器学习,近年来逐渐演变成一股潮流。

在美国企业数据方案咨询师 Eric Brown 看来,当下无数公司置其数据资本和实际问题与不顾,一窝蜂上马机器学习,实在是荒唐可笑。他特地发文表达了对该现象的批判和反思。雷锋网编译。

Eric Brown

█ Eric Brown:数据科学家要用数据说话。从数据上来看:你,和你的公司,并不需要机器学习。

我是认真的。

或许你不同意,那么听我解释。我说“从数据上看”,指的是对于当今世界的绝大多数公司,机器学习(ML)既非必要也无益处。各公司想要利用 ML 来处理的绝大部分任务,都是十分直接的问题——使用某种形式的回归即可完美解决。后者或许不是你在高中代数课上学到的线性回归,但仍会是某个回归函数。雷锋网了解到,著名经济学家 Robin Hanson 最近发表了相同观点,他在推特上说道:

“一个优秀的计算机专家会说:大多数公司以为他们需要先进的 AI、ML 技术,其实,他们真的只需要在干净的数据上做线性回归。”

这句话中,“干净的数据“是重点。它极度、极度重要,但相当多的公司总是在处理数据时忘记、或者忽视这一点。若没有合格的数据质量,以及到位的数据治理、管理流程和系统,有极大的可能性你会陷入垃圾数据陷阱——“向模型输入的是垃圾,输出的也是垃圾”。太多数据项目如此,结果不了了之。

大多数公司并不知道数据管理是什么

我并不是一个数据管理、数据质量方面的专家导师。但我对这个领域有一定的了解——足够让我清楚不合格、不到位的数据管理是什么样。况且我经常遇到这些情况。在我与公司客户合作、帮助他们开展新数据项目的工作经历中(到现在已经变成了主要是讨论 ML 和深度学习),我问客户的第一个问题永远是:“告诉我你的数据管理流程”。如果对方不能合理地描述出这些流程,那么很显然 ML 并不合适——他们还没有做好准备。

过去的五年里,我估计有 75% 的情况下,客户对我的数据管理问题的回答是:

“ 嗯……我们有一部分数据存在一个数据库里,其他数据存在有合法权限的文件共享里。”

这不是数据管理,是数据存储。

如果你或你的公司并没有高质量、干净的数据,几乎可以断定,你并不适合机器学习(机器学习也不适合你)。搞任何数据项目,数据管理都是第一步。

█ 如果你有搞数据管理

来找我的公司机构里,有一小部分安排了合格的数据管理工作。他们理解对于好的数据、好的分析而言,质量、治理和管理有多么重要。如果你的公司也是如此——恭喜你,在这方面你已经超过了绝大部分竞争对手。

但我要给你泼点冷水。仅仅因为有干净、高质量的数据,不意味你应该/需要搞机器学习。当然你可以搞,但大多数情况下真没这个必要。

过去五年向我咨询过的所有公司里,我会说:他们原本要用机器学习解决的问题,有 90% 最后只用了普通回归方式就完美解决。每当我推荐用简单的回归,来解决客户眼中的“复杂、高深”问题(雷锋网住:他们下定决心要研发多重 ML、DL 模型来对付),人们总是相当惊讶。我也总是不得不向他们解释,他们可以走机器学习的路线,而且那样做或许也有价值。但能搞清楚基础建模、回归能为你做什么,ML/DL 是否在一些领域比基础回归函数更好,难道不是一件好事吗?

█ 你说:我铁了心要搞机器学习

我还能说啥?那就大胆去做!没有什么能够阻挡,你对机器学习的向往。毕竟机器学习有它的用处和舞台。只是记住:在充分了解你的数据,搞明白“经典”方法能为你要解决的难题做到哪一步之前,不要一股脑儿得栽进机器学习。

原文发布于微信公众号 - AI研习社(okweiwu)

原文发表时间:2017-03-06

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏AI科技评论

百度王海峰Quora精华整理:未来5-10年,NLP领域将会有什么进展?

AI科技评论按:近日吴恩达发文将在4月底离职百度。几乎在同一时间,百度也宣布进一步深度整合,将包括NLP、KG、IDL、Speech、Big Data等在内的百...

3234
来自专栏PPV课数据科学社区

我们的挚爱——数据科学技术

数据科学家最爱的几款工具! 一个能干的数据科学家经常被看作是分析学中额的独角兽,这是因为他们的工作往往需要深厚的数学和统计学的知识、熟悉计算机科学,还要有掌握一...

3536
来自专栏新智元

谷歌 TPU 的强大与局限:TPU/GPU/CPU性能功耗全面对比

【新智元导读】谷歌公布 TPU 论文(被ISCA-17 接收)引发新一轮讨论,连英伟达CEO黄仁勋都亲自撰文回应。使用 TPU 代表了谷歌为其人工智能服务设计专...

7889
来自专栏互联网数据官iCDO

运营研究的3个方法:过程法、要素法、分类法

作者:平章大人 全文共 2582 字 7 图,阅读需要 7 分钟 ———— / BEGIN / ———— 研究了这么久的营销和运营,我越发深刻地认可一句话:“上...

3137
来自专栏人工智能头条

deepart.io创始人专访:科研算法的敏捷应用

2084
来自专栏大数据文摘

怎样才能持续聘到优秀的数据人才?

1142
来自专栏机器之心

观点 | 低门槛究竟是深度学习的危机,还是契机?

选自reddit 机器之心编译 参与:黄小天、刘晓坤 近日,Reddit 上出现了一个颇有争议性的问题,提问者怀疑深度学习的低门槛会破坏这个领域的声誉,业余者的...

3097
来自专栏机器学习原理

2018苏州GTC会议笔记主题演讲可解释性、鲁棒性和公平性:THUIR 个性化推荐研究进展 [CH81402]机器学习的发展和行业应用前景 [CH8502]用 TensorFlow 加速 AI [CH

NVIDIA 创始人兼 CEO 黄仁勋先生关于计算领域之未来的主题演讲。 演讲人:黄仁勋 NVIDIA 创始人兼 CEO 2018/11/21 周三 1...

1774
来自专栏美团技术团队

美团餐饮娱乐知识图谱——美团大脑揭秘

“ I’m sorry. I can’t do that, Dave.” 这是经典科幻电影《2001: A Space Odyssey》里HAL 9000机器人...

1441
来自专栏机器之心

业界 | AIIA DNN benchmark「从芯」测试

AI 进入爆发期后,芯片对技术进步的影响愈发凸显。深度学习对计算芯片提出了新需求,催生了 AI 加速芯片的问世。当 AI 芯片的功能日益复杂化、多样化,一方面,...

1937

扫码关注云+社区

领取腾讯云代金券