
关于情感分析,你不得不知道的11件事
近来,关于情感分析的研究一直被大家所津津乐道,然而关于这项分析方法究竟有多大的实用性,则是众说纷纭。有人认为情感分析堪比打开人类市场研究新世界大门的钥匙,而另一些人则认为,这项技术只是骗人的万灵油,甚至与占卜无异。那么,究竟谁是对的呢?
相较而言,我(笔者)更倾向于站在前者的阵营中。基于文本分析,自动情感分析技术为基于李克特量表的传统分析方法(Likert-reliant methodologies)注入了新的动力,使得研究人员能通过社群倾听技术实时掌控客户反馈的倾向变化,并由此实现了对客户心声的深入挖掘。
对于后者的阵营,我认为他们对情感分析产生质疑的原因可能来自于对这种分析方法实现能力与局限性的认识扭曲。这样的认识扭曲也许是由于某些能力不足的解决方案供应商造成的,不过不管它们究竟来自何方,我都会倾力而为去揭穿它们,还原一个有真正实际意义的情感分析技术。
我们目标是鼓励适当的使用情感分析技术并防止滥用。为了做到这点,对市场教育的呼唤十分重要,我通过会议的形式做了很多这样的事,在今年7月15号到16号的纽约情感分析研讨会上,我特地点明了这样十一件情感分析研究者必须知道的事:
1)在情感分析中,通过直接匹配词典来查找词汇是一种简单明了的方法,也但略显粗俗。词的意思往往会根据句式、语境以及上下文之间的关联而发生变化,进行情感分析时我们需要将语言学与统计学的方法都应用到其中。
2)文档层面的情感分析或许正在面临过时。我们情感分析的目标应该关注于实体(entity)、概念(concept)以及主题(topic)的层面。(例如,一部iPhone6是一个实体,iPhone是一个概念范畴,而智能手机则是它所属的主题)
3)“情感”的一般语言定义包括态度(attitude)、意见(opinion)、感觉(feelings)和情绪(emotion)。最先进的情感分析技术可以让你超越正负面倾向得分的局限,根据情绪——如快乐、惊讶、恐惧、厌恶、愤怒、悲伤等对文本情感进行评价,而不是仅仅是一个表达程度的分数。
4)请将眼界放宽:情感分析是情感计算(Affective computing)大家族的一份子,这个家族涉及到了所有与人类情感相关、来自人类情感或是对人类情感产生影响的现象计算研究。情感分析与家族中的其他伙伴皆有所联系,但在技术和方法上有着较为明显的区别。
5)并非所有的情感都是平等的。不论是情感的倾向还是强度,我们都需要努力去理解。同时,研究情感如何转化为行动也具有同样重要的意义。
6)不论你是否在项目中使用了语言工程、统计模型与机器学习方法,在很多情况下,也许针对特定领域训练合适的模型,才是模型优化的关键。
7)必须注意那些有关于准确率的说法。对于模型的准确性,这世界上不存在绝对的衡量标准,因此在度量模型的准确性时,我们总会遇到各种各样的麻烦。正因如此,有的解决方案供应商们甚至可能在提出分析模型之后对模型准确性的测量过程避而不谈。一种公认可行的准确度测量方法是将模型结果与一份经过完全精准的人工注释/分类的语料进行对比,这也意味着我们需要让人工和机器同时去进行一项庞大的语料分析工作,再进行二者匹配程度的计算。但是当你真的去尝试这样的做法时,所谓人工一方作出的判断究竟是对是错,同样也很难说明清楚。与此同时,面向不同层面的文本分析软件之间也很难进行准确度的对比,例如有些软件只做了文档层面的分析,而另一些则能够对实体和概念进行了解析,我们能说在实体层面具有70%准确率的软件就优于在文档层面具有97%准确率的软件吗?
8)文本是最常见的情感数据来源,但它并不是唯一的一个。针对视频的面部编码技术,针对音频流的语音分析,都可以用于检测人类的情绪反应,而这些也都是更先进的情感状态评估方法。而有关人类情感分析下一个前沿领域也有可能是:神经科学、可穿戴仪器开发和生理学的其他研究手段。
9)语言是人类使用的最有活力和发展最快速的工具之一。计算机技术在社会中普及给了我们前所未有的语言表现能力,众所周知的表情符号(emoji)就是这一进程中的典型例子。表情符号不仅仅是人类语言的扩音器,它在发展过程中逐渐获得了自己的语法和特殊语义,从而自然而然地如潮水般涌入广大的网络社交媒体中。对于情感分析研究者来说,我们也应该紧跟时代发展的脚步,去针对各种新诞生的语言表达形式进行相关的挖掘与研究。
10)通过将行为表现与情感分析模型进行联系,或是根据人口与文化范畴对语料进行分类,能够帮助你提升分析与预测的能力。当你面对庞杂的大规模数据时,请毫不犹豫地运用这个方法。
11)一些先进的概念,如动机、影响、维护和催化,都是建立在对人类情感和行为进行建模以及社群网络分析的基础上的。在数据咨询行业,研究的最主要目标是对市场以及消费者进行解析,而这种解析的最终目标则是创造使消费者“行动起来”的条件。作为情感分析研究者,你需要面向上述概念开展你的工作。
好了,上面便是我个人(笔者)对情感分析这些事的理解,当你在开始设计下一项有关的调查研究时,或是当你不知道如何将社交媒体挖掘应用到你的研究中时,不妨考虑一下使用情感分析。多思考一些实际可行的情感算法也许会对你有所帮助,将它结合于行为分析或是其他先进的市场细分技术,可能会使你找到洞悉潜在客户行为的方法。总而言之,情感分析值得重视,它是绝对能够为你的市场研究带来一些令人眼前一亮的新东西的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
Excel 数据聚类分析:从操作实践到业务价值挖掘 在数据分析场景中,聚类分析作为 “无监督分组” 的核心工具,能从杂乱数据中挖 ...
2025-09-10统计模型的核心目的:从数据解读到决策支撑的价值导向 统计模型作为数据分析的核心工具,并非简单的 “公式堆砌”,而是围绕特定 ...
2025-09-10CDA 数据分析师:商业数据分析实践的落地者与价值创造者 商业数据分析的价值,最终要在 “实践” 中体现 —— 脱离业务场景的分 ...
2025-09-10机器学习解决实际问题的核心关键:从业务到落地的全流程解析 在人工智能技术落地的浪潮中,机器学习作为核心工具,已广泛应用于 ...
2025-09-09SPSS 编码状态区域中 Unicode 的功能与价值解析 在 SPSS(Statistical Product and Service Solutions,统计产品与服务解决方案 ...
2025-09-09CDA 数据分析师:驾驭商业数据分析流程的核心力量 在商业决策从 “经验驱动” 向 “数据驱动” 转型的过程中,商业数据分析总体 ...
2025-09-09R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02