微信号:shushuojun

介绍:数据分析师之家.旨在为数据人提供一个学习、分享、互帮互助的家园.

【分类战车SVM】第六话:SMO算法(像smoke一样简单!)

2015-03-24 20:38 数说工作室



我有一双神奇的解题小手,不断的化简——代入——化简——代入,不断的迭代——搜索——迭代——搜索,咦,答案出来了!!!


本集大纲:


1.回顾

2.处理奇葩值

3.SMO算法




1. 回顾

2-4话中,我们介绍了如何去拟合一个SVM模型,第5话我们假设把这个SVM模型拟合好了,讨论如何去实现它,前几话的逻辑关系如下图所示:




看到上面的图,你已经明白,本集第六话要讲的,就是SVM模型的拟合过程——SMO序列最小优化算法。


2. 处理奇葩值

第五话中,我们说到,有一些无法用线性分类器分开的情况,其解决办法是映射到高维。映射到高维是可以解决,但是计算要复杂了,所以我们又用核函数简化计算。这是第五话的内容。但是,看看下面这个例子,你建不建议用映射的办法?




我勒个去!!!


如果把它当做非线性问题,那么要用下面左图的办法(映射+核函数),但是不是觉得太亏了,就因为一个点,计算量要复杂很多,而且这个点非常有可能是噪音!

因此,在实际建模中,我们应该考虑到这样的情况,允许个别离群点的存在。把心放宽一点,用下图右边的方法去解决。




当然,把心放多宽,那要你自己把握了,万一你是处女座……



那么具体到数学表达上,怎么个容忍法呢?我用下面的对照图来说明:

下面这幅图一步一步不用去推,这么展示有两个目的:一是想要说明,加了松弛变量的推导其实也就多了那么个小尾巴ξ,在最后要使用的那个对偶问题里,也就是对偶变量a多了一个上线C;二是正好让大家也复习一下前面的推导过程,忘记的同学可以对照着翻看一下前面五话。




3. SMO算法

前面我们用那么多篇幅,一步步推导,把要解决的问题打造成如下形式:




为了方便下面的说明,我们给这个问题起个代号吧,就叫“终极问题”和“终极约束”!


现在我们就用SMO序列最小优化算法来解决这个“终极问题”。


还记得梯度上下降法吗?算了还是不把事情搞复杂了,感兴趣的在公众号“数说工作室”(微信号shushuojun)中回复“得到”查看。

这里我们的解决思路,简单来说,就是固定a1以外的所有参数,然后在a1上求极值。

这样可以吗?不可以,因为我们这题多了一个




也就是说,当我固定a1以外的所有参数时,a1的值也就定下来了:




所以固定一个参数是不行的,我们要一次选取两个参数做优化。那么我们选取a1a2,其他变量ai(i=3,4,…)是固定的。

好了,我们现在开始解,思路如下图:




好了,我们先化简“终极约束”


  • 化简“终极约束”

由于我们是固定除了a1a2所有的参数,因此有:



这里D我们用一个常数表示,是被我们固定了的。我们就可以利用这个来表示a1




其实,y的取值要么是1,要么是-1,所以上式等价于:




这是我们化简得到的第一个信息。别忘了我们还有,




以上是我们直接得到的两个信息,把这两个信息合并,我们还能进一步缩小参数a1a2的取值范围:

1. y1y2异号的时候,有



这个时候两个参数a1a2怎么取值的呢?我们用下面这个图直观的看出来:





此时ai(i=1,2)的取值范围一定是正方形内的紫色线或红色线段。

(1)以a2为例,我们来看一下它的上限:

它的上限要么是点1的C,要么是点2的C-D。这个很明显吧,如果a2<a1,那么上限就是红色线段的点2的C-D,如果a2>a1,那么上限就是紫色线段的点1的C,整理一下(上限用H表示):

如果a2<a1,H=C-D=C+a2-a1

如果a2>a1,H=C;

把这两个总和一下,用一个式子表示就是,H=min(C , C+a2-a1),想一想,是不是这样的?


(2)我们再来看一下a2的下限:

它的下限要么是点3的-D,要么是点4的0。如果a2<a1,那么下限就是红色线段的点4的0,如果a2>a1,那么下限就是紫色线段的点3的-D,整理一下(上限用L表示):

如果a2<a1,L=0;

如果a2>a1,L=-D=a2-a1

把这两个总和一下怎么表示?这个时候我建议你把下面的答案盖着,自己写一下,你写出来的一定是——

L=max(0 , a2-a1)

总结起来,当y1y2异号的时候,有

L=max(0, a2-a1) <= a2 <= H=min(C , C+a2-a1)

2. y1y2同号的时候,有





同与(1)相同的方法,可以推出a2的取值范围是

L=max(0, a2+a1-C) <= a2 <= H=min(C , a1+a2)


这同时也是a1的取值范围,好了,这是我们化简“终极约束”后,得到的三个“究极约束”。

  • 化简“终极问题”

复习一下,终极问题是这样的:


现在我们来化简它,我们把a1a2专门拿出来,给“终极进化”做一个等价变形:




这个式子,不建议推导,知道就好。

我们再接着化简,引用记号:

代入到上式中去,终极问题化简为



=究极问题J(a1,a2)


l “究极约束”代入到“究极问题”中去——解“究极问题”

我们首先将“究极约束”代入到“究极问题”中去,有:


究极问题J(a2)=


a2求导,使其为0,得




另外,,(


,还记得吧,SVM的模型,可别忘了)代入进去,有:




好了,式子出来了,我们下面代入实际值进行迭代求解。


  • 迭代求值

迭代求值不用多说,给定一个初始值,然后进行迭代更新。

给定a2和a1的初始值aold2,aold1,有

D= aold2+ aold1

代入到最终解里去,得到




a2上面的unc是什么?别忘了a2还要满足L<= a2 <= H,我们暂且不考虑这个范围,故用unc表示,考虑了这个范围,再把这个小尾巴unc去掉。

,原式等价于




,迭代得到:




现在把小尾巴unc去掉,





本集完,下一集将介绍如何用软件实现SMO算法,训练出一个俊美的SVM模型。





数说工作室

是由几位数据分析行业的爱好者也是从业者做的交流平台,主要依托微博和微信两个媒介,网站也正在筹备中。


  • 微博“数说工作室网站”:

主要分享一些零碎化的知识,关于数据挖掘理论、方法、电子书、有趣的结果,以及一些相关的行业应用等信息。

没时间刷微博也没关系,数说君每周会把一些精华内容整理一下,在微信上再发一次:


  • 微信公众号“数说工作室”:

主要发布一些原创连载,或者行业精选文章。往期目录:

前面【】内的字母是编号,回复可查看相应文章,也可以直接回复相关术语查看,比如回复“多因子”,则会推送相应的多因子选股模型的文章。



话题汇总:

【T1】统计学毕业之后可以坐什么



《概率论-上帝的赌术》系列

【GLL】第一话:古典概率论,一场赌局引发的血案

【GLL】第二话:大数定律,看不见的神的秩序

【GLL】第三话:正态分布,众生的百态

【GLL】第四话:暴走的假设检验

【GLL】第五话:回归模型,命运的方程

【GLL】番外话:常用分布表

【GLL】局部完结篇



金融模型·量化投资系列

【F1】多因子选股模型

【F2】动量反转

【F3】资本资产定价模型(CAPM)

【F4】盈余管理的测量



算法理论&代码

【A1】金融数据挖掘之朴素贝叶斯

【A2】金融数据挖掘之决策树(ID3)


【MB1】面板数据与Eviews操作指南(上)

【MB2】面板数据与Eviews操作指南(下)


【logistic】logistic回归:从生产到使用(使用篇)

【logistic】logistic回归:从生产到使用(生产篇)

【logistic】logistic回归建模指南


【SVM】分类战车SVM:开题话

【SVM】分类战车SVM:线性分类

【SVM】分类战车SVM:最大间隔分类器

【SVM】分类战车SVM:拉格朗日对偶问题

【SVM】分类战车SVM:核函数

【SVM】分类战车SVM:SMO算法



《统计师的Python日记》系列

【Python】第1天:谁来给我讲讲Python?

【Python】第2天:再接着介绍一下Python呗


《大数据与金融业》资讯系列

【dsj1】P quant与Q quant(转)

【dsj2】P quant的装备之战

【dsj3】银行如何装备Hadoop平台(转)

【dsj4】全面了解大数据在银行业的应用(转)

【dsj5】全面了解大数据在证券业的应用(转)


其他科普文/趣文/资讯:

(注意下面的编号是字母 O,不是数字0,看我的嘴型 → 欧~~)

【O1】P值之死

【O2】争鸣!西方经济学流派图

【O3】数说君的自白:人口数据分析

【O4】独立第三方的困局

【O5】余额宝为什么不该被取缔?

【O6】一位数据分析师的年终总结(行业精选)

【O7】如果有12亿支付宝用户同时向你账户转账一块钱,会发生什么?(行业精选)




 
数说工作室 更多文章 余额宝为什么不该被取缔? 盈余管理的测量 量化投资之多因子选股模型 金融数据挖掘之决策树(ID3) 量化投资之动量反转
猜您喜欢 不知道被谁删了微信好友?用 Python 来帮忙呀! 5个最优秀的Java和C#代码转换工具 夜间模式实践 Flask Signals 入门 情人节涨姿势:IT男如何get女生引力波?