京公网安备 11010802034615号
经营许可证编号:京B2-20210330
如果说最近最热门的综艺,那《乘风破浪的姐姐》(下文简称《姐姐》)可谓实至名归。30位出道多年的姐姐辈女艺人,一个个风格各异、个性鲜明。她们将通过合宿生活与舞台竞演,最终选出5位组成逆龄女团。
《乘风破浪的姐姐》就这样突然定档、突然播出、播出前无宣发的情况下爆了,一经播出就抢占各大热搜榜。
今天,我们带大家就用
来盘一盘这些
主要从以下几点展开:
乘风破浪的姐姐?NO!是兴风作浪的姑奶奶
出道时长十年起,这些姐姐们都有谁?
豆瓣8.3分,姐姐们的实力妥妥的
Python分析9万条弹幕,谁才是真正的C位?
01乘风破浪的姐姐?
NO!是兴风作浪的姑奶奶
既然是选最特别的女团,哪些人参加自然是关注的焦点。宁静、伊能静、钟丽缇、张雨绮、万茜、黄圣依…光是听到这些选手的名字就让人太期待了!
姐姐们很“任性”
不同于一般的女团选秀,漂亮妹妹们都得听从节目组的安排,而这次的姐姐们普遍很“不服管教”,毕竟都是在自己领域出道多年的资深前辈,她们非常有底气,知道自己想要什么。
节目组让做自我介绍,宁静霸气的回复:“还要介绍我是谁?那我这几十年不是白干了?”
节目组导演让伊能静挡一下膝盖,伊能静说:“这是裤子,我挡不了。你配合我一下,别让我配合你们”。
问万茜为何来参加节目,万茜回答:“经纪人逼我来的”。这也太真性情了吧,简直不是乘风破浪的姐姐,而是兴风作浪的姑奶奶们呀。
端水大师——黄晓明
这些姐姐们,也让在中餐厅里“我不要你觉得 我要我觉得”的霸道总裁黄教主秒变暖心的小明同学——“我不要你觉得,我要您觉得”人送称号端水大师,满满的求生欲。
凭实力挨骂——杜华
在点评环节中,作为评审之一杜华也是各种凭实力挨骂。依然以评选20多岁女团的刻板标准评价姐姐们,让不少观众都看得满头问号,越看越气。
02出道时长十年起,唱跳演样样精通
姐姐们到底有多强?
下面让我们看到数据部分。我们搜集了百度百科和维基百科的选手数据。
姐姐们年龄分布
先看到年龄分布,可以看到29-33这个年龄段的姐姐最多共有11位,占比36.67%。其次是34-37岁,共10位,占比33.33%。
姐姐们都来自哪儿?
然后是地区分布,姐姐们都来自哪里呢?其中来自湖南和上海的最多,各有五位。阿朵、万茜、刘芸、沈梦辰、孟佳都是我们湖南湘妹子。然后四川、辽宁、山东的各两位。
姐姐们都是哪些职业
在职业方面呢,我们可以看到,她们大多数演员和歌手出身,艺人中身兼数职的情况比较普遍,30人中至少有17人身兼多职,其中13人既是演员、也是歌手。
初舞台得分的关键因素
《乘风破浪的姐姐》初评分数由个人特质、成团潜力、声乐表现力和舞台表现构成,每项25分,总分100分。
我们通过Python计算数值型变量之间的pearson相关系数。对于系数r的取值,根据经验可将相关程度分为以下几种情况,|r|>=0.8时,可视为高相关,0.5<=|r|<0.8.可视为中度相关,0.3<=|r|<0.5时,可视为低度相关,|r|<0.3.可视为不相关。根据相关系数数值,在95%的置信程度水平情况下:
控制其他影响因素的情况下,个人特质打分对初舞台分数的影响最大。
初评舞台分数和年龄、出道年数没有显著相关关系。
年龄和个人特质、成团潜力的分数间存在低度负相关关系,年龄越大,个人特质和成团潜力的得分也就越低;
个人特质和成团潜力的打分之间存在高度正相关,即两者得分存在高则同高,低则同低的情况。
03豆瓣8.3分,姐姐们的实力妥妥的
目前这部综艺在豆瓣的评分为8.3分,很不错的成绩,已有7万2千余人进行评价。
豆瓣总体评分分布
看到具体评分分布,给出四星的最多,为38.2%;其次是5星 占比25%。看来观众普遍还是十分认可姐姐们的表现的。
短评词云图
可以看到词云主要围绕的是"姐姐"、"节目"、"女团"展开。其中在需选手中宁静、万茜被提到的频率最高。
当然也有不少吐槽的点,大家的吐槽主要集中在:
评委杜华:不公平;30+的女性岁月积淀了魅力,评审却按照20岁女团的标准来;给丁当打分真是要气炸。
黄晓明:从霸道总裁秒怂变小明,让人感觉尴尬不已
节目组:场景布置令人寒酸,摄影差,灯光差,布景差。
也有吐槽选手的
黄圣依:等黄圣依淘汰了我再改成五星,谢谢。
04Python分析9万条弹幕
谁才是真正的C位一姐?
我们统计了芒果tv第一期的弹幕数据,共94575条。
下面展示芒果Tv弹幕爬虫部分代码,分析部分代码暂略。数据获取的具体思路如下:
分析网页,弹幕数据是动态加载的,因此通过Chrome浏览器进行抓包分析并获取真实的URL请求地址;
使用selenium请求网页数据;
使用正则表达式re将文本中的HTML提取出来,使用json进行解析;
使用pandas进行数据的保存。
1. 弹幕在哪里找?
打开《乘风破浪的姐姐》选取一集,观看我们要抓取的弹幕,可以看出弹幕是在视频播放之后才滚动加载的,所以我们可以判断视频是通过JS异步加载的。
按照经验,我们切换到network-XHR下面查看,如下图所示,很容易发现了弹幕请求的地址:
https://bullet-ws.hitv.com/bullet/2020/06/21/104556/8337559/0.json
其中:2020/06/21代表日期,104556和8337559参数每集不一样,通过抓包获取即可。
2. 获取并解析数据
具体代码如下:
# 导入包
import pandas as pd
import time
import re
import json
from selenium import webdriver
# 打开Chrome(需配置webdriver)
browser = webdriver.Chrome()
def get_mgtv_danmu(month_num, day_num, num1. num2):
step = 1
df_all = pd.DataFrame()
while True:
try:
# 第一集URL
danmu_url = 'https://bullet-ws.hitv.com/bullet/2020/{}/{}/{}/{}/{}.json'.format(month_num, day_num, num1. num2. step)
# 打印进度
print('正在获取第{}页的信息'.format(step))
step += 1
# 获取弹幕
browser.get(danmu_url)
# 休眠3秒
time.sleep(3)
# 提取数据
pattern1 = re.compile(r'
')
pattern2 = re.compile(r'')
data1 = re.sub(pattern1. '', browser.page_source)
data2 = re.sub(pattern2. '', data1)
# 解析数据
js_data = json.loads(data2)
# 获取数据
all_data = js_data['data']['items']
# id
danmu_id = [i.get('id') for i in all_data]
# uname
uname = [i.get('uname') for i in all_data]
# 内容
content = [i.get('content') for i in all_data]
# 时间
danmu_time = [i.get('time') for i in all_data]
# 点赞
up_count = [i.get('v2_up_count') for i in all_data]
# 分钟
danmu_minites = step-1
# 保存数据
df_one = pd.DataFrame({
'danmu_id': danmu_id,
'uname': uname,
'content': content,
'danmu_time': danmu_time,
'up_count': up_count,
'danmu_minites': danmu_minites
})
# 循环追加
df_all = df_all.append(df_one, ignore_index=True)
except Exception as e:
print(e)
print('没有此页面, 爬虫结束')
break
return df_all
if __name__ == '__main__':
#
df_1 = get_mgtv_danmu(month_num='06', day_num='21', num1=104556. num2=8337559)
获取的数据以数据表的形式存储,如下所示:
df.head()
03 结论部分
选手弹幕热度排名
在排名数据上,占据前四位的分别是宁静、万茜、吴昕和张雨绮。
下面,分别看到她们的个人弹幕词云图。
宁静-弹幕词云
喜欢宁静的,都喜欢她那种强大的大姐大气场,感觉静姐这哪里是来出道当女团的,明明是来选妃的。
万茜-弹幕词云
再看到万茜,淡雅的性格配上努力勤奋换来的过硬实力,在节目里,万茜也堪称人气王,除了观众爱她,姐姐们也都爱她。关于她的弹幕都是各种"喜欢"、"可爱"、"性格圈粉"等等。
吴昕-弹幕词云
吴昕这次在节目中给了人眼前一亮的感觉,不再是快乐家族中没啥台词的小透明,从用心准备的节目,到谈吐性格都让人感觉十分舒服,非常圈粉。
张雨绮-弹幕词云
最后再看到张雨绮,她真的是反差萌担当了,以为是高冷霸总,结果却是个可爱憨憨,从赛前采访就开始搞笑。带来的节目是《粉红色的回忆》,理由是这是自己唯一能唱完的歌,也是十分可爱了。
结语:
这么多个性十足的姐姐们真是让人爱了爱了,特别是《乘风破浪的姐姐》的开场旁白,非常让人印象深刻:
三十而励!三十而立!三十而骊!
30岁以后,人生的见证者越来越少,但还可以自我见证!
30岁以后,所有的可能性不断褪却,但还可以越过时间,越过自己!
不要轻易用年龄定义自己,只要有追逐梦想的心,无论什么年龄段都有属于自己的精彩!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28