京公网安备 11010802034615号
经营许可证编号:京B2-20210330
清华大学用大数据分析了9000条微博谣言,还在研究自动辟谣
社交媒体上的谣言总是让人猝不及防,有些甚至能在短时间造成不小的危害。比如,几天前,微信怎么也不会想到,因为一个年终回顾的HTML5页面被提前泄露,带来大量用户点击导致服务器瘫痪,然后引发了盗号的谣言。最后的结果是,短短的几个小时内,数百万人从微信提现,解绑银行卡。
社交媒体上都流传着哪些谣言?这些谣言都是谁发布的?为什么会有人相信并主动参与传播这些谣言?社交网络上的信息是海量的,这些问题似乎很难回答。不过最近,清华大学智能技术与系统国家重点实验室的研究人员借用了自然语言处理的帮助,对新浪微博上的谣言大数据进行了全面的分析,试图找出答案。
2012年5月,新浪微博设立了举报处理大厅,谣言占了不良信息中的一大部分。研究人员利用微博举报大厅公布的实时数据收集谣言信息。
他们收集了从2011年8月到2015年5月期间出现的9079条谣言,用函数模型对这些数据进行了预处理,发现了一些有趣的现象。
大部分微博谣言会在其发布的一个周内被举报并辟谣
第一,大多数微博谣言的影响力都比较小, 转发和评论数在500次以下的微博占到整体的84%。只有极少量的微博谣言具有极广的传播范围和强大的影响力 。
第二,谣言通常要传播一段时间后,才有可能遭到举报;同时, 由于传播速度快,大部分微博谣言会在其发布的一个周内被举报并辟谣 (88.9%)。
第三,大量举报谣言的用户, 所举报的谣言往往与自己相关. 例如, 微博用户 “美汁源饮料” 举报了 大量关于 “美汁源果粒橙” 饮料含有农药的谣言, 张家界纪委书记汪业元举报了大量关于 “汪业元发表 ‘对网络暴民杀无赦’ 的言论” 的谣言。
第四,大量发布谣言的用户,往往带有网络水军的性质,例如,有微博用户仅在几分钟的时间里发布了几十条微博, 其中大部分是谣言, 之后该用户就再未发过微博。
常识类谣言经常反复出现转发高峰
研究人员还根据谣言内容将其分成了5个分类:政治类谣言,例如钓鱼岛海域中日两国爆发海战;
经济类谣言,例如三星赔偿苹果几十车硬币;
欺诈类谣言,例如“四川藏区儿童需要御寒冬衣”,然后留下了一个虚假的联系电话;
社会生活类谣言,社会各界人物的花边新闻,例如六小龄童去世;
常识类谣言,例如阿司匹林能治疗心脏病。
这些谣言中,大部分属于社会生活类和政治类谣言 (约占70%)。而结合微博谣言发布、传播、高峰和消亡的过程还可以发现,不同的谣言出线转发峰值的情况也各部相同。
70%的谣言话题只有一个较大转发峰值,也就是说,被辟谣后,它们就会逐渐消亡。
另外,谣言的内容也和其转发峰值有关系:例如,常识类谣言由于受众广,辟谣难度较大,往往会反复被人们提及,出现多次爆发,约70%的常识类谣言通常有多个转发峰值。而关于名人或知名机构的谣言,由于关注人数众多,辟谣难度较小,因此发布之初就会出现较大转发峰值,但很快会被辟谣,约60%的此类谣言会在一个周内消亡。
人们为什么相信谣言
人们为什么会相信这些谣言呢?研究人员分析后将原因归结为两类:(1)知识受限,即缺乏专业知识而导致误信或无法辨认的谣言。例如,阿司匹林可以治疗急性心脏病;(2)时空受限谣言,即由于地域和时间限制无法辨认的谣言。例如, 有谣言称“杭州上城区一妇女喝了3罐可乐,两天后离开了这个世界。验尸结果是她死于细螺旋体病, 发病原因是直接用嘴对可乐罐饮用”。
自动辟谣框架
在对谣言进行分析之后,研究人员还试图建立一个自动辟谣机制。当然,在目前的技术条件下,自然语言处理技术还无法根据微博内容自动判断其是否为谣言。所以,研究人员的思路通过语义分析,自动根据谣言主题对其进行分类,然后发现最有可能判定该谣言的专家,推荐专家对疑似谣言进行鉴别。
研究人员的框架主要包括3个阶段的工作:
1. 谣言发布早期,通过用户举报和对可疑用户的监控建立疑似谣言的集合。一方面,将疑似谣言和谣言库中进行比对;另一方面, 对于在谣言库中没有匹配内容的谣言,通过查询该领域的专家库,推荐若干专家对该疑似谣言进行鉴别。
2. 谣言发布中期,通过自然语言处理技术分析疑似谣言的评论信息,通过社会网络分析技术分析疑似谣言的传播模式,判定该信息是否为谣言。
3. 谣言发布后期,对于判定为谣言的信息, 将其加入谣言库;对信息发布人进行可信性分析,确定其信用等级,将信用等级低于一定阈值的用户加入可疑用户库,在一段时间内对其发布的微博内容进行监控;对信息举报人和评论人进行专家发现,充实和更新该信息相关的知识领域的专家库。
当然,目前这一切还处于理论研究阶段,而建立可以用户库也需要以网站更严格地执行实名制为前提。用大数据、人工智能去对付谣言,前提是需要很多人交出更多的隐私,你愿意吗?
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在机器学习建模、数据预处理、抽样划分、模型初始化训练的全流程中,随机种子是控制实验随机性、保证结果可复现、提升模型稳定性 ...
2026-08-04Python作为面向对象的主流编程语言,核心编程体系由变量、方法、类三大基础要素构成。三者层层递进、相互协作,支撑起所有基础代 ...
2026-08-04 很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问 ...
2026-08-04为什么学习数据分析? 当下,我们已然步入数据要素价值全面释放的智能时代。数据不再只是零散的数字记录,更是驱动新质生产力运 ...
2026-08-03CDA等级认证证书有效期为三年,三年进行一次年审,主要考察CDA持证人的职业发展情况;学历、工作单位及职业变更情况;继续教育 ...
2026-08-03【核心关键词】金融、岗位、企业、算法、知识、专业、理论、课程、软件、数据分析、业务类型、应用场景、经营管理、大型企业、 ...
2026-08-03在日常数据分析、业务报表复盘、业绩预测工作中,平均增长率是衡量数据长期变化趋势的核心指标,广泛用于营收增长、用户增长、销 ...
2026-08-03很多人把统计学理解为“一堆公式和计算”,却忽略了它的本质——一门让数据“开口说话”的科学。真正的数据分析高手,不是会算平 ...
2026-08-03在数据指标体系搭建工作中,从业者常困惑于指标搭建的核心逻辑:究竟是依托一线零散数据自下而上汇总指标,还是基于战略目标自上 ...
2026-07-31在数据分析、问卷研究、实验复盘、业务建模的工作中,大多数人最关注的是“用什么统计方法”:是做T检验、方差分析、卡方检验, ...
2026-07-31 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-07-31在问卷调研的数据分析流程中,“先检验信效度,再开展进阶统计分析”是通用的规范逻辑。很多从业者会听到“问卷效度高,后续可以 ...
2026-07-30【核心关键词】大数据、统计学、专业、毕业生、论文、课程、计算机、建模、知识、数据分析、机器学习、数据科学、大数据技术、 ...
2026-07-30 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-07-30在业务数据分析中,按天拆分统计夜间时段的数据是高频需求——比如电商夜间订单监测、平台夜间用户活跃度分析、运维系统夜间异常 ...
2026-07-29在机器学习建模与特征工程实践中,判断不同特征对模型预测效果的贡献度,是特征筛选、模型解释、业务归因的核心环节。特征置换重 ...
2026-07-29 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-07-29【核心关键词】岗位、数字化、经验、课程、方法论、决策、企业、大方向、数据分析、销售管理、理论知识、思维方式、分析销售、 ...
2026-07-28在问卷调研、用户分群、效果对比等业务数据分析中,分类变量的关联性与差异性验证是高频需求。卡方检验作为针对离散分类数据的经 ...
2026-07-28 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-07-28