京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代:数据就是生产力_数据分析师
在信息社会,数据将成为核心资源,就像农业时代的土地、工业时代的能源。
中国正在朝着那个时代奔跑,但还有些距离。
《纸牌屋》背后的秘密
在这个网站上,用户每天产生高达三千多万个行为,如收藏、推荐、回放、暂停等。随着数据挖掘技术日渐成熟,Netflix开始用这些数据倒推来生产影片。
时下最火的一部美剧,毫无疑问当数《纸牌屋》。
这部被中国网友们戏称为“白宫甄嬛传”的美国政治悬疑剧,正在全球四十多个国家热播。严肃媒体们——无论是《纽约时报》、《洛杉矶时报》还是最近一期的《经济学人》,都在重要版面研究它的成功之道。
该剧的制作方,既不是电视台,也不是传统的电影公司,而是一家类似于中国的土豆和优酷的在线视频播放网站Netflix。
早期,Netflix是北美家喻户晓的在线影片租赁提供商,主营业务是通过邮寄方式租赁DVD来赚钱。然而,在互联网时代,这个盈利模式逐渐式微。于是,Netflix转向在线流媒体播放,但转型并不成功,一直被资本市场唱空。
和中国视频网站一样,Netflix也在寻求突围之道,2012年开始向上游进军,准备推出自己的自制剧。
不过,在决定拍什么、怎么拍上,Netflix却一反常规,祭出自己的秘密武器——大数据。
原来,Netflix从创立开始,就意识到数据的重要性。在这个网站上,用户每天产生高达三千多万个行为,如收藏、推荐、回放、暂停等;Netflix的订阅用户每天还会给出400万个评分,300万次搜索请求,询问剧集播放时间和设备等。这些都被Netflix转化成代码,当作内容生产的元素记录下来。早些年,这些数据被Netflix用来进行精准推荐,随着数据挖掘技术的日渐成熟,Netflix开始将其用于倒推前台的影片生产。
这次,Netflix的工程师们发现,喜欢BBC剧、导演大卫·芬奇(David Fincher)和老戏骨凯文·史派西(Kevin Spacey)的用户存在交集,一部影片如果同时满足这几个要素,就可能大卖。
Netflix决定赌一把,他们花1亿美元买下了一部早在1990年就播出的BBC电视剧《纸牌屋》的版权(几乎是美国一般电视剧价钱的两倍),并请来大卫·芬奇担任导演,凯文·史派西担当男主角。
事实证明,他们赌对了——《纸牌屋》不仅是Netflix网站上有史以来观看量最高的剧集,也在美国及四十多个国家大热。尝到甜头的Netflix,2013年将继续推出4部自制剧。
聆听数据的声音
微博、微信等社交媒体上的“只言片语”,从某种程度上也是数据的声音——社交媒体上数据的声音。
Netflix只是掘金数据的先行者之一,中国的跟随者们正在纷纷出现。
2013年3月,搜狐买下《纸牌屋》的中国独家网络播放权。而这个过程,本身就是一个觉醒的故事。
据负责采购的搜狐视频版权影视中心高级总监马可对媒体透露,早在2012年5月份,他们就在美国的一个看片会上看到了《纸牌屋》的信息,当时只有这部剧的题材和阵容,并没有确定播出平台。搜狐当时也没有拍板要买,只是留下了一个印象。
到2013年春节前,看完样片,马可们犹豫了:这么高端的片子,市场会不会不接受?他有一个感性理由:一些内部高管说,自己很喜欢看,但他太太完全看不下去。
但春节期间,马可就发现,这部剧在微博、微信朋友圈的一些相对有话语权的圈子里口碑不错,而且开始发酵了。他还注意到,一些字幕组甚至加班加点启动了盗版。
一些网络上的主流精英人群为这部片子背书,增加了搜狐的信心。马可判断,这部剧的用户群特征应该是:有阅历和话语权,高收入。
在诸多视频网站里,搜狐视频一直力推的自我定位是优质美剧引进平台。如果引进这部剧,一方面会给搜狐“优质美剧品牌”定位加分;另一方面,也可以借此吸引广告主以更高价格为贴片广告埋单。
权衡之下,搜狐决定立即引进。春节之后,他们就决定新增一个临时性采购,只用了两周时间,便完成了全部流程。
2013年3月2日,《纸牌屋》在搜狐上线,接下来的10天里,这部剧便不负众望,迅速冲到了排行榜前几名。
马可们也赌赢了。他们的决策并不像Netflix一样依靠的是多年来的数据挖掘成果,而仅仅只是微博、微信等社交媒体上的“只言片语”,但从某种程度上,也是在聆听数据的声音——社交媒体上数据的声音。
聚焦社交媒体
社交媒体上留下了海量的数据,这些痕迹的拼图,显影出不同事物之间隐秘甚至是莫名其妙的联系,比如罗大佑演唱会和大众车之间的关系。
社交媒体上的数据,正是目前许多中国的数据公司致力挖掘的领域。
清华大学毕业的鄂威从事广告精准营销已经有6年的时间,他观察到,社会化媒体对用户行为改变的影响力,正在逐渐增加。不管是买车买房等大宗消费,还是吃饭喝茶等日常消费,消费者更倾向于在微博等社会化媒体上寻求朋友的建议。鄂威判断,企业在社会化媒体上的传播,将来有可能成为跟搜索一样大的市场。于是,在2009年一次北京地下车库的聊天当中,鄂威与朋友一拍即合,创建了孔明社交管理。
鄂威提供的,是一个类似于“社交管家”的软件,帮助企业对微博、人人网等社会化媒体进行管理。比如说,在孔明社交的后台,粉丝们一旦评论、转发,信息都会分类显示,管理员可以根据不同的级别回复和处理,提升效率。如果有负面评论,其负面关键词抓取和监控的技术便会发挥作用,提醒管理员优先回复处理,进行引导。对一些企业大号来说,这项技术非常实用,因为如果单纯靠人力来做此种监控,成本高不说,反应也很可能不及时,让负面舆论发酵从而影响企业品牌。
不过,这些都只是低层次的应用。“我们最终的工作,是希望能帮企业去找到他潜在的客户,分析他们有什么样的特点,什么样的喜好和生活方式,根据这些再去做针对性的营销方案,促进实质交易。”鄂威说。
鄂威给南方周末记者举了个例子,比如说买车,有的人可能会在微博上直接发个信息,说要买车,抓取这个数据之后,就可以直接给对方推送汽车广告。但大多数人可能不会直接说,那就要去找,“信息实际上有很多维度,我们要知道的,是什么样的维度跟我们想明确的问题——比如买车——是有关的”。
鄂威透露,他们在做数据挖掘时就有一个惊奇的发现:去听过罗大佑现场演唱会的人,对上海大众的车兴趣度会提高30%,“为什么这样?分析起来也是有道理的,比如这款车的受众是35岁左右的,居家型的,希望提高生活品质的男性,和罗大佑的受众非常一致。”
不过,这并不一定是真的原因,真的原因其实也不那么重要。在风靡业界的《大数据时代》一书中,被称为“大数据时代预言家”的维克托·迈尔·舍恩伯格提出的一个重要洞见就是,放弃对因果关系的渴求而关注相关关系。也就是说,很多时候,只要知道“是什么”,而不需要知道“为什么”,只要知道某些事物之间有关系就够了。
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在大数据技术飞速迭代、数字营销竞争日趋激烈的今天,“精准触达、高效转化、成本可控”已成为企业营销的核心诉求。传统广告投放 ...
2026-04-24在游戏行业竞争白热化的当下,用户流失已成为制约游戏生命周期、影响营收增长的核心痛点。据行业报告显示,2024年移动游戏平均次 ...
2026-04-24 很多业务负责人开会常说“我们要数据驱动”,最后却变成“看哪张报表数据多就用哪个”,往往因为缺乏一套结构性的方法去搭建 ...
2026-04-24在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16