京公网安备 11010802034615号
经营许可证编号:京B2-20210330
作者 | 秦泽宇、曹培信
来源 | 大数据文摘
不知道大家有没有去看鹿晗和舒淇主演的科幻片《上海堡垒》,整体讲述的是外星人入侵地球的故事,上海成为最后的根据地,而黄浦江里的上海大炮成为翻盘的唯一希望,当然了,还有鹿晗和舒淇的爱情故事。
不过上映以来,这部电影就被各种骂,导演、编剧都接连出来道歉。不过这一切的一切都已经无力回天,《上海堡垒》3.6亿的投资成本,最终票房只攀登到1.2亿多,可以说是亏得血本无归啊!
尽管豆瓣评分目前只剩下3.2分,但是评价中还是有人试图客观的分析电影失败的原因,其中一个就是故事太过烂俗。
然而随着自然语言处理(Natural Language Processing,简称NLP)的不断发展,是否在电影拍摄前就根据电影的脚本摘要预测这部电影会不会受到大众喜爱呢?
来自韩国的几名研究人员就尝试了这个方法。
四万多部电影数据,训练可预测电影好坏的AI
研究人员试图训练出一个机器学习模型,可以通过电影摘要,分辨哪些哪些电影会成功或者失败。如果人们可以进一步完善这个模型,有朝一日,制片人可以在电影制作前就能预测出这部电影在票房上是会大卖或者扑街。
为了训练这个模型,研究员使用了来自世界各地,总共42306个电影情节作为数据集,大部分来自CMU电影摘要语料库。
数据集
模型先将摘要划分成句子,并用情感分析来分析每个句子。模型将认为是“积极”的句子,譬如“Thor喜欢他的锤子”,打分更接近1。模型将认为是“消极”的句子,譬如“Thor打架了”,打分更接近-1。
最后综合两个输出进行分类,从而得出一个电影是否会成功。
模型分类架构
情节越起伏,观众越买账
通常,成功的电影,比如1951年的《爱丽丝梦游仙境》,在Rotten Tomatoes电影评价网上获得了80%的分数,情绪波动频繁;不成功的电影,比如2009年的《控制限制》情绪波动较小。研究员说,电影开头或结尾是否皆大欢喜并不重要。重要的是情绪变化频繁。
电影中的“波动性”衡量标准是将每个摘要的情绪打分压缩成一个分数,来反映情绪的变化。研究人员测试了三种不同获得最终分数的方法。这三个方法都可以准确地预测一部电影是否会受欢迎。
上面两张图中,第一张里面的电影《爱丽丝梦游仙境(Alice in Wonderland)》的开头和结尾都很积极,电影《靴子(Das Boot)》和《一个男人(A Man for All Seasons)》每一季的开头和结尾都是消极的。电影《葛底斯堡(Gettysburg)》展示了命运的逆转,开始时是消极的,结束时是积极的。人们普遍注意到,这些成功的电影有频繁的情绪波动。
而第二张则是不成功的电影的情感分析,它表现出较少的情感波动。电影《控制的极限(The Limits of Control)》和《迷失的刀锋战士(Lost Bladesman)》都有消极的开头和结尾。电影《大锅(Tai-Pan)》以消极的开头,以积极的结尾。电影《蓝舌和尚(Bluetproof Monk)》的开头和结尾都是正面的,但是在故事发展的过程中,大多数人的情绪得分都是负面的。因此,这表明情绪变化的频率可能预示着电影的成功。然而,情绪的两极对预测一部电影的成功影响甚微。
现在只能分好坏,希望将来能预测票房
研究人员在8月1日意大利佛罗伦萨举办的2019Storytelling Workshop上指出:尽管这些方法在猜测电影是否成功上表现并不出色,但是它们依旧比随机预测更加准确。
研究人员说,在未来,他们的方法会进行改进,希望能够预测一部电影的票房值,并帮助制片人决定这部电影是否值得投资。
在这个模型的应用方面,研究人员补充说,这个系统公平的评价机制对于不知名的作家来说是好事,不会因为名气小而被埋没。
同时也能潜在的帮助公众,烂片被扼杀在摇篮里,观众们也就不必浪费时间看完像《大白鲨:复仇》这样票房和口碑双扑街的烂片了。
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Excel数据透视表的日常办公中,单纯的字段求和汇总往往无法满足深度分析需求——我们常常需要用“单个分组的字段值”与“整体/ ...
2026-05-07 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-05-07在数字化时代,商业竞争的核心已从“经验驱动”转向“数据驱动”,越来越多的企业意识到,商业分析不是简单的数据统计与报表呈现 ...
2026-05-06在Excel数据透视表的实操中,“引用”是连接透视表与公式、辅助数据的核心操作,而相对引用作为最基础、最常用的引用方式,其设 ...
2026-05-06 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-05-06在Excel数据分析中,数据透视表是汇总、整理海量数据的高效工具,而公式则是实现数据二次计算、逻辑判断的核心功能。实际操作中 ...
2026-04-30Excel透视图是数据分析中不可或缺的工具,它能将透视表中的数据快速可视化,帮助我们直观捕捉数据规律、呈现分析结果。但在实际 ...
2026-04-30 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-04-30在中介效应分析中,人口统计学变量(如年龄、性别、学历、收入、职业等)是常见的控制变量或调节变量,其处理方式直接影响分析结 ...
2026-04-29在SQL数据库实操中,日期数据的存储与显示是高频需求,而“数字日期”(如20240520、20241231、45321)是很多开发者、数据分析师 ...
2026-04-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-04-29在手游行业竞争日趋白热化的当下,“流量为王”早已升级为“留存为王”,而付费用户留存率更是衡量一款手游盈利能力、运营质量的 ...
2026-04-28在日常MySQL数据库运维与开发中,经常会遇到“同一台服务器上,两个不同数据库(以下简称“源库”“目标库”)的表数据需要保持 ...
2026-04-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-04-28箱线图(Box Plot)作为一种经典的数据可视化工具,广泛应用于统计学、数据分析、科研实证等领域,核心价值在于直观呈现数据的集 ...
2026-04-27实证分析是社会科学、自然科学、经济管理等领域开展研究的核心范式,其核心逻辑是通过对多维度数据的收集、分析与解读,揭示变量 ...
2026-04-27 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-04-27在大数据技术飞速迭代、数字营销竞争日趋激烈的今天,“精准触达、高效转化、成本可控”已成为企业营销的核心诉求。传统广告投放 ...
2026-04-24在游戏行业竞争白热化的当下,用户流失已成为制约游戏生命周期、影响营收增长的核心痛点。据行业报告显示,2024年移动游戏平均次 ...
2026-04-24 很多业务负责人开会常说“我们要数据驱动”,最后却变成“看哪张报表数据多就用哪个”,往往因为缺乏一套结构性的方法去搭建 ...
2026-04-24