开发者社区> 玄学酱> 正文

数据咨询师经验之谈:90% 的公司并不需要机器学习

简介:
+关注继续查看

数据咨询师经验之谈:90% 的公司并不需要机器学习

Eric Brown

Eric Brown:数据科学家要用数据说话。从数据上来看:你,和你的公司,并不需要机器学习。

我是认真的。

或许你不同意,那么听我解释。我说“从数据上看”,指的是对于当今世界的绝大多数公司,机器学习(ML)既非必要也无益处。各公司想要利用 ML 来处理的绝大部分任务,都是十分直接的问题——使用某种形式的回归即可完美解决。后者或许不是你在高中代数课上学到的线性回归,但仍会是某个回归函数。雷锋网了解到,著名经济学家 Robin Hanson 最近发表了相同观点,他在推特上说道:

数据咨询师经验之谈:90% 的公司并不需要机器学习

“一个优秀的计算机专家会说:大多数公司以为他们需要先进的 AI、ML 技术,其实,他们真的只需要在干净的数据上做线性回归。”

这句话中,“干净的数据“是重点。它极度、极度重要,但相当多的公司总是在处理数据时忘记、或者忽视这一点。若没有合格的数据质量,以及到位的数据治理、管理流程和系统,有极大的可能性你会陷入垃圾数据陷阱——“向模型输入的是垃圾,输出的也是垃圾”。太多数据项目如此,结果不了了之。

大多数公司并不知道数据管理是什么

数据咨询师经验之谈:90% 的公司并不需要机器学习

我并不是一个数据管理、数据质量方面的专家导师。但我对这个领域有一定的了解——足够让我清楚不合格、不到位的数据管理是什么样。况且我经常遇到这些情况。在我与公司客户合作、帮助他们开展新数据项目的工作经历中(到现在已经变成了主要是讨论 ML 和深度学习),我问客户的第一个问题永远是:“告诉我你的数据管理流程”。如果对方不能合理地描述出这些流程,那么很显然 ML 并不合适——他们还没有做好准备。

过去的五年里,我估计有 75% 的情况下,客户对我的数据管理问题的回答是:

“ 嗯……我们有一部分数据存在一个数据库里,其他数据存在有合法权限的文件共享里。”

这不是数据管理,是数据存储。

如果你或你的公司并没有高质量、干净的数据,几乎可以断定,你并不适合机器学习(机器学习也不适合你)。搞任何数据项目,数据管理都是第一步。

如果你有搞数据管理

数据咨询师经验之谈:90% 的公司并不需要机器学习

来找我的公司机构里,有一小部分安排了合格的数据管理工作。他们理解对于好的数据、好的分析而言,质量、治理和管理有多么重要。如果你的公司也是如此——恭喜你,在这方面你已经超过了绝大部分竞争对手。

但我要给你泼点冷水。仅仅因为有干净、高质量的数据,不意味你应该/需要搞机器学习。当然你可以搞,但大多数情况下真没这个必要。

过去五年向我咨询过的所有公司里,我会说:他们原本要用机器学习解决的问题,有 90% 最后只用了普通回归方式就完美解决。每当我推荐用简单的回归,来解决客户眼中的“复杂、高深”问题(雷锋网住:他们下定决心要研发多重 ML、DL 模型来对付),人们总是相当惊讶。我也总是不得不向他们解释,他们可以走机器学习的路线,而且那样做或许也有价值。但能搞清楚基础建模、回归能为你做什么,ML/DL 是否在一些领域比基础回归函数更好,难道不是一件好事吗?

你说:我铁了心要搞机器学习

我还能说啥?那就大胆去做!没什么能阻挡你一直跋涉到 ML 和 DL 的深水区。毕竟机器学习有它的用处和舞台。只是记住:在充分了解你的数据,搞明白“经典”方法能为你要解决的难题做到哪一步之前,不要一股脑儿得栽进机器学习。





本文作者:三川
本文转自雷锋网禁止二次转载,原文链接

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
这家公司正在影响大公司决策,还开发了一款机器学习优化引擎
在斯坦福运筹学博士、杉数科技联合创始人兼 CTO 王子卓看来,人工智能和运筹学都能通过数据帮助人们解决实际问题。但与人工智能专注于预测、识别等功能的准确性相比,运筹学更在意的是给出商业、金融等场景下完整的解决方案,解决具体的行业问题。
24 0
Interview:算法岗位面试—10.24下午—上海某软件公司(机器学习,上市)电话面试—考察SVM、逻辑回归、降低过拟合、卷积网络基础等
Interview:算法岗位面试—10.24下午—上海某软件公司(机器学习,上市)电话面试—考察SVM、逻辑回归、降低过拟合、卷积网络基础等
30 0
阿里云服务器怎么设置密码?怎么停机?怎么重启服务器?
如果在创建实例时没有设置密码,或者密码丢失,您可以在控制台上重新设置实例的登录密码。本文仅描述如何在 ECS 管理控制台上修改实例登录密码。
19696 0
【案例学习】葛兰素史克公司如何通过Docker EE 实现高效的药物研究工作
葛兰素史克公司的数据科学技术在最近的Hadoop Strata会议上为其获得了“年度最佳新秀”奖。他们使用Docker EE实现了创新的交付模式,这使得他们提高了研究效率,并有望发现更多拯救生命的药物
1451 0
阿里云服务器端口号设置
阿里云服务器初级使用者可能面临的问题之一. 使用tomcat或者其他服务器软件设置端口号后,比如 一些不是默认的, mysql的 3306, mssql的1433,有时候打不开网页, 原因是没有在ecs安全组去设置这个端口号. 解决: 点击ecs下网络和安全下的安全组 在弹出的安全组中,如果没有就新建安全组,然后点击配置规则 最后如上图点击添加...或快速创建.   have fun!  将编程看作是一门艺术,而不单单是个技术。
17986 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,阿里云优惠总结大概有三种登录方式: 登录到ECS云服务器控制台 在ECS云服务器控制台用户可以更改密码、更换系.
24794 0
程序员如何在"小公司成长"和"大公司学习"
注:这篇文章会带有普遍性,不见得适合所有人,或者文章所描述的也不见得是对的,只是根据我的经历和所见写成的一篇文章,仅供参考。
654 0
Oracle学习经验谈
      经常遇到朋友问oracle学习难不难,怎么才能成为高手等等,我想结合我的个人经验简单说几点: 1、打好基础,由浅入深          学习Oracle不能急于求成,寄希望于一天成为一个大侠。
567 0
如何让深度学习突破数据瓶颈?这家创业公司直接挑战生物神经元的计算模型
Demiurge Technologies 是一家位于瑞士的人工智能创业公司,他们致力于研究生物神经元的计算原理,开发下一代深度学习,以解决小样本学习和与物理世界交互的难题。他们的深度学习系统将应用于第四级别自动驾驶和探索机器人等领域。与大部分人工智能公司不同的是,Demiurge Technologies 希望从根源解决目前深度学习存在的问题,面对这样一个不论在神经科学领域,还是人工智能领域都同样重要的问题,他们的勇气、方法和视野都令人尊敬。也希望 Demiurge 的创业思路和运作模式能够给从业者带来灵感和启发。
24 0
+关注
玄学酱
这个时候,玄酱是不是应该说点什么...
20709
文章
438
问答
来源圈子
更多
+ 订阅
文章排行榜
最热
最新
相关电子书
更多
OceanBase 入门到实战教程
立即下载
阿里云图数据库GDB,加速开启“图智”未来.ppt
立即下载
实时数仓Hologres技术实战一本通2.0版(下)
立即下载