京公网安备 11010802034615号
经营许可证编号:京B2-20210330
在MATLAB中进行基于SVM的数据分析
MATLAB除了可以被用来进行信号处理之外,还可以用来完成一些数据挖掘任务。而说到数据挖掘,你脑海里一定会闪现过许多熟悉的算法,例如决策树、朴素贝叶斯、逻辑回归,以及支持向量机(SVM)等等。下面我们就以SVM为例来看看利用MATLAB进行数据挖掘是一种怎样的体验。
MATLAB中用来进行基于SVM的数据挖掘的核心函数是 svmclassify() 和 svmtrain()。从函数名就能很容易地看出来,后者是用来进行模型训练的,而前者则是用后者训练出来的模型来对数据进行分类。首先我们来看看线性可分的情况,后续我们还会讨论更复杂的线性不可分的例子。
这里所使用的数据是费希尔的鸢尾花数据,我们首先导入数据(数据一共有150行,取前2/3作为训练数据,对应的类别是setosa和versicolor)
[plain] view plain copy
>> load fisheriris
>> xdata = meas(1:100,3:4);
>> group = species(1:100);
函数 svmtrain()的调用格式如下:
SVMStruct = svmtrain(Training,Group,Name,Value)
其中Training是feature向量,Group表示分属之类别。Name和Value是可选参数(也就是可以不写),而且必须成对使用,其中Name表示参数名,而Value则对应相应的参数取值。由于Name-Value的可取参数对非常之多,我们这里不一一列举(有需要的读者可以参阅MATLAB的帮助文档以了解更多),仅仅给出两个例子:比如,如果把Name置为'showplot',就可以通过紧跟其后的Value取值来控制是否将训练模型绘制成图,默认是'False',表示不会图。另外一个有用的参数是'kernel_function',如果你对SVM算法比较了解的话应该知道,核函数主要是通过空间转换来将原本线性不可分的数据,转换到另外一个线性可分的空间上,后续我们还会给出具体例子。
下面的代码就可以训练得到一个分类模型:
[plain] view plain copy
>> svmStruct = svmtrain(xdata,group,'ShowPlot',true);
上述代码的执行结果如下图所示(注意因为我们为参数'showplot'赋值为True,所以系统会绘制出图):

下面我们用svmclassify() 来测试一下模型的分类能力:
[plain] view plain copy
<span style="font-size:18px;">>> testdata = [4 1.5;1.8 0.38];
>> species = svmclassify(svmStruct,testdata,'ShowPlot',true)
species =
'versicolor'
'setosa'</span>
如果觉得文字表述的结果不够形象,还可以用图形来表示:
[plain] view plain copy
<span style="font-size:18px;">>> hold on;
>> plot(testdata(:,1),testdata(:,2),'ro','MarkerSize',12);
>> hold off</span>
上述代码的执行结果如图所示(其中被圆周圈起来的就是我们引入的测试数据):

如果数据是线性不可分的,SVM是否能够应对呢?来看下面的例子,首先,我们生成两组数据data1和data2
[plain] view plain copy
>> rng(1); % For reproducibility
r = sqrt(rand(100,1)); % Radius
t = 2*pi*rand(100,1); % Angle
data1 = [r.*cos(t), r.*sin(t)]; % Points
>> r2 = sqrt(3*rand(100,1)+1); % Radius
t2 = 2*pi*rand(100,1); % Angle
data2 = [r2.*cos(t2), r2.*sin(t2)]; % points
data1和data2是线性不可分的。用图形来表示或许更加一目了然,所以我们来绘图:
[plain] view plain copy
>> figure;
plot(data1(:,1),data1(:,2),'r.','MarkerSize',15)
hold on
plot(data2(:,1),data2(:,2),'b.','MarkerSize',15)
ezpolar(@(x)1);ezpolar(@(x)2);
axis equal
hold off
上述代码的执行结果如下:

然后我们把两组数据组织到一起,并加上分类标签‘+1’和‘-1’。
[plain] view plain copy
>> data3 = [data1;data2];
theclass = ones(200,1);
theclass(1:100) = -1;
然后分别用高斯核函数与多项式核函数来进行空间转换,并在此基础上进行基于SVM的分类:
[plain] view plain copy
>> svmModel = svmtrain(data3, theclass, 'kernel_function','rbf','ShowPlot',true);
>> svmModel = svmtrain(data3, theclass, 'kernel_function','polynomial','ShowPlot',true);
下图基于高斯核函数的SVM分类结果:

下图基于多项式核函数的SVM分类结果:

可见原本不可分的数据,现在已经被成功分类了。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动的精细化运营体系中,指标是业务判断、效果复盘、策略优化的核心依据。随着企业数据化程度提升,指标数量持续膨胀,但 ...
2026-07-23在用户运营与产品增长体系中,留存是衡量产品真实价值与用户粘性的核心标尺,也是决定用户生命周期价值、获客投产比的底层因素。 ...
2026-07-23 很多数据分析师精通Excel、SQL、Python等工具,但当被问到“面对一个具体的业务问题,该用什么分析方法”“描述性分析和诊断 ...
2026-07-23【核心关键词】埋点、产品、互联网、数据库、决策、数据分析、产品经理、商业模式、移动互联网、指标体系、运营模块、大数据平 ...
2026-07-22在高并发、大数据量的业务系统中,单表数据量达到千万级甚至亿级后,会出现查询性能骤降、索引维护成本飙升、存储扩容困难等问题 ...
2026-07-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-22在金融风控、企业运营、行业研究等数据分析场景中,大量数据以面板数据形态存在:例如多家分支机构连续多个季度的风险指标、多位 ...
2026-07-21 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-07-21一、活动介绍 2026暑期CDA备考冲刺季,为想利用假期拿证的你量身打造。考点胶囊内容搭配多重硬核福利,让你在旅行、实习、居家 ...
2026-07-21金融行业的运营风险贯穿业务全流程,涵盖交易欺诈、操作违规、流程漏洞、合规偏差、客户信用异常等多元场景,是银行、保险、证券 ...
2026-07-17财产保险作为金融行业的核心板块,涵盖车险、家财险、责任险、企财险等多元品类,是个人与企业抵御财产风险、经营风险的重要保障 ...
2026-07-17 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-07-17【核心关键词】模块、餐饮、客户、门店、企业、订单、供应链、多样化、产品、生产计划、数据分析、生产管理、物料管理、业务分 ...
2026-07-16在数字化分析时代,原始数据本身不具备业务价值,只有通过科学的统计学方法加工、拆解、验证与解读,才能挖掘数据背后的规律、差 ...
2026-07-16 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-07-16在描述性统计分析、数据预处理、异常值排查与多组数据分布对比工作中,箱线图(Box Plot)是应用最广泛的可视化与统计工具之一。 ...
2026-07-15在企业数据存储、业务统计与数据分析工作中,绝大多数业务数据都带有时间维度属性,例如订单创建时间、用户注册时间、支付完成时 ...
2026-07-15 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-07-15【核心关键词】产品、经营、客户、调研、销售额、宏观、会计行业、客户满意度、发展趋势、经营状况、数据分析、竞争对手、数据 ...
2026-07-14问卷调查是市场调研、用户研究、社会调研与产品分析的核心数据采集方式。问卷数据大多以分类数据为主,例如用户性别、年龄分层、 ...
2026-07-14