微信号:programmer_club

介绍:程序员第一自媒体,与你探讨码农人生路上遇到的各类泛技术话题,定期为你推荐码农人生思考、感悟以及启迪!

漫画:什么是机器学习?

2016-10-30 22:07 玻璃猫

在一个风和日丽的周末......

















故事一:瑞雪兆丰年


我们中国有一句关于农业生产的古老谚语:瑞雪兆丰年。

就是说,如果前一年冬天下雪很大很多,那么第二年庄稼丰收的可能性比较大。

这条谚语是怎么来的呢?我们可以想象当时的情景:



第一年冬天






第二年收获时节






第二年冬天






第三年收获时节






第三年冬天






第四年收获时节





年复一年,若干年后的冬天......






这就是瑞雪兆丰年的故事。头年的瑞雪和来年的丰收,本是两个看起来并不相关的现象,但是智慧的农民伯伯通过几十年甚至几代人的经验,总结出了两个现象之间的规律。



故事二:啤酒和尿布


上个世纪90年代,沃尔玛超市已经是美国最大的零售企业,拥有大量的顾客资源。那时候的沃尔玛已经采用了先进的计算机技术,随时记录着每天众多顾客购物车中所挑选的商品明细。





在其中一个普通的日子里:













就这样经年累月,沃尔玛积累了大量的顾客购物数据。直到某一天,沃尔玛的技术专家发现:









于是,这一尝试实行以后......








从此,沃尔玛的销售额得到了显著提升,啤酒尿布的故事也广为流传,成为了销售界和IT界津津乐道的成功典范......



这就是沃尔玛啤酒和尿布的故事。顾客购买啤酒的行为和顾客购买尿布的行为,原本是两个看起来没什么关联的现象。但是沃尔玛的技术专家以大量的用户购物数据为样本,通过先进的算法,最终寻找到了两者之间的重要关联和规律。


为什么购买啤酒的人更有可能同时购买尿布呢?是因为有了小孩的男人比别人更爱喝啤酒?还是因为爱喝啤酒的男人比别人更顾家?这些臆测似乎都有些牵强。


但是沃尔玛不需要关心规律背后的本质。对企业来讲,利用发现的规律,获得实实在在的利益就足够了。










以下是小灰根据个人理解说画的流程图:











以下是大黄基于小灰的流程图所做的补充:





以下是大黄对流程图结果部分作出的调整。其中假设模型可以理解成训练出来的降雪和收获的规律,通过假设模型,从新一年降雪情况推断出下一年收获情况的过程叫做回归。至于啤酒尿布的例子,属于截然不同的机器学习类型,只需要找出关联关系,并不需要进行回归。





机器学习按照方式不同主要分为三大类,有监督学习(Supervised learning)、无监督学习(Unsupervised learning)以及半监督学习(Semi-supervised learning)。


监督学习:通过已有的一部分输入数据与输出数据之间的对应关系,生成一个函数,将输入映射到合适的输出。在瑞雪兆丰年的例子中,头年降雪量就是输入,来年亩产量就是输出。


非监督学习:直接对输入数据集进行建模,寻找关联。例如啤酒尿布的例子,只需要寻找关联性,并不需要什么明确的目标值输出。


半监督学习:综合利用有输入输出的数据,和只有输入的数据来进行训练。可以简单理解成监督学习和非监督学习的综合。











来源于:伯乐在线 - 玻璃猫 

关注作者,获取更多内容

作者个人微信号:13522239721

让大神带你飞!!!


 
程序员之家 更多文章 IT行业的未来,或者说,IT能走多远? 测试员到底担任了什么样的角色? JVM到底是什么? 你会成为下一个猝死的IT悲哀吗? 应届毕业生如何拿到一个好offer?
猜您喜欢 [原]深入对比数据科学工具箱:Python和R 非结构化数据的结构化 游戏关卡设计三原色 【R微课】14天用R做机器学习第二天 正则表达式30分钟入门教程 写反一行代码...日本人就这么把他们19亿的太空望远镜给玩死了...