京公网安备 11010802034615号
经营许可证编号:京B2-20210330
《数学之美》拾遗—TF-IDF
在学习机器学习的过程中,我写了简单易学的机器学习算法的专题,依然还有很多的算法会陆续写出来。网上已经有很多人分享过类似的材料,我只是通过自己的理解,想尽可能用一种通俗易懂的方式讲出来。在不断学习的过程中,陆陆续续补充了很多的知识点,在学习吴军老师的《数学之美》的过程中,也补充了很多我之前遗漏的知识点,吴军老师已经在《数学之美》上把问题讲得很清楚,我在这里只是再增加一些我对这些问题的认识。专题的顺序与原书不一致,其中的原因是我在学习机器学习的过程中遇到了问题会翻阅一些书,所以,顺序与我学习时遇到的问题是相关的。借此机会,感谢那些默默支持我的人,我会更加努力写出高质量的博文。
一、什么是TF-IDF
首先解释下TF-IDF的全称,TF-IDF全称是Term Frequency / Inverse Document Frequency,全称的意思为词频、逆文本频率。
在我们处理文本时,例如,对于一篇文章,文章是由很多的词组成,通过与我们的词库对比,我们可以很容易的过滤掉一些公认的停止词(Stop Word),只保留一些关键词。停止词是指对文章的主题没有任何帮助却在文章中大量出现的一些词,如“的”、“是”等。剩下的关键词也并不是都是同等重要的,我们要确定关键词在文章中的权重,这样我们才能确定文章的主题,此时,我们就可以使用TF-IDF来计算各个关键词的权重。
TF是指一个词在一篇文章中出现的频率。单纯使用TF将会出现一些问题,问题是一些通用的词对于主题并没有太大的作用,反倒是一些出现频率较少的词才能够表达文章的主题。所以权重的设计必须满足:一个词预测主题的能力越强,权重越大,反之,权重越小。所有统计的文章中,一些词只是在其中很少几篇文章中出现,那么这样的词对文章的主题的作用很大,这些词的权重应该设计的较大。IDF就是在完成这样的工作,如果一个关键词W在
篇文章中出现,那么
越大,关键词W的权重反倒是越小。最后我们将TF的值和IDF的值综合考虑,便能得到关键词的权重:
。
二、如何计算TF-IDF值
对于一个处理好的词项-文档矩阵:

文章有:d1,d2,d3,d4,d5和d6,关键词有:“ship”,“boat”,“ocean”,“wood”和“tree”。矩阵中的数字表示词在对应文章中出现的次数。
1、TF的计算
TF表示词在一篇文章中出现的频率。这里我们假设每篇文章的词的个数为
,。则词“ship”在文章d1中的TF值为:
。其他的可以依次类比。
2、IDF的计算
IDF的公式为:

其中,D表示全部的文章数,
表示关键词w出现的文章数。如关键词“ship”在文章d1和d3中出现,则
,而全部的文章数
。则
。
3、TF-IDF的值
TF-IDF的值即为最终的权重,是将TF值与IDF值相乘,则对于关键词“ship”的TF-IDF值为:

三、实际的例子
选择了9个标题:(参考文献2)
The Neatest Little Guide to Stock Market Investing
Investing For Dummies, 4th Edition
The Little Book of Common Sense Investing: The Only Way to Guarantee Your Fair Share of Stock Market Returns
The Little Book of Value Investing
Value Investing: From Graham to Buffett and Beyond
Rich Dad's Guide to Investing: What the Rich Invest in, That the Poor and the Middle Class Do Not!
Investing in Real Estate, 5th Edition
Stock Investing For Dummies
Rich Dad's Advisors: The ABC's of Real Estate Investing: The Secrets of Finding Hidden Profits Most Investors Miss
去掉了停止词“and”,“edition”,“for”,“in”,“little”,“of”“the”,“to”。我们可以得到以下的词项-文档矩阵:

最终的结果为:

MATLAB源码
TF_IDF函数
[plain] view plain copy 在CODE上查看代码片派生到我的代码片
function [ dataMade ] = TFIDF( dataSet )
[m,n] = size(dataSet);%计算dataSet的大小,m为词的个数,n为标题的个数
%rowSum = sum(dataSet);% 每个标题中关键词的总和
rowSum = [8,6,19,6,8,19,6,4,18];
colSum = sum(dataSet,2);% 每个词在不同标题中出现的总和
dataMade = zeros(m,n);% 构造一个一样大小的矩阵,用于存储TF-IDF值
for i = 1:m
TempIDF = log2(n./colSum(i,:));
for j = 1:n
dataMade(i,j) = (dataSet(i,j)./rowSum(:,j))*TempIDF;
end
end
end
主函数
[plain] view plain copy 在CODE上查看代码片派生到我的代码片
%% TF_IDF
% load data
% 注意每一列为标题,每一行为词
dataSet = [0 0 1 1 0 0 0 0 0
0 0 0 0 0 1 0 0 1
0 1 0 0 0 0 0 1 0
0 0 0 0 0 0 1 0 1
1 0 0 0 0 1 0 0 0
1 1 1 1 1 1 1 1 1
1 0 1 0 0 0 0 0 0
0 0 0 0 0 0 1 0 1
0 0 0 0 0 2 0 0 1
1 0 1 0 0 0 0 1 0
0 0 0 1 1 0 0 0 0
];
% 计算TF-IDF值
data = TFIDF(dataSet);
注意点:在参考文献2中有两个问题:数据分析师培训
1、在求解TF时,TF的分母应该是整个文本的长度,可参见维基百科。
2、在求解IDF时,取对数的时应该是以2为底,而不是以为底。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
指标体系是企业数字化分析、业务监控、经营决策的核心基础框架,是将零散数据转化为可衡量、可对比、可落地业务价值的关键体系。 ...
2026-10-08随着市场竞争日趋饱和,同质化低价竞争逐渐陷入内卷僵局,传统以价格、渠道、促销为核心的营销模式边际效益持续递减。在此背景下 ...
2026-10-08 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-10-08你有没有想过,手机里点外卖、刷社交软件、转一笔账,背后到底是谁在替你"记着账"? 答案其实很简单:数据库,以及跟它对话的那 ...
2026-10-07CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24