京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代带来喜忧参半,数据发展正面临转折点
近年来,大数据已经覆盖了许多领域,包括互联网领域。许多应用和平台热衷于搜集用户的信息。而在近日举行的SXSW(South by Southwest,西南偏南)大会上,专家们却表达了对于数据会歧视用户的担忧。
会上,独立隐私安全专家Ashkan Soldani提及了IBM的一款能够计算“恐怖主义得分”的软件。这款软件的目的是通过用户数据,计算从叙利亚来到欧洲的人们参与恐怖活动的概率。
大数据(bigdata)一词越来越多地被提及,人们用它来描述和定义信息爆炸时代产生的海量数据,并命名与之相关的技术发展与创新。但是,在大数据发挥重要作用的同时,也产生了一系列问题,给人们造成了困扰。
一、许多软件因数据歧视用户,造成诸多问题
目前,许多企业都会通过软件或应用搜集用户信息。在大数据时代,这种做法是无可厚非甚至是必要的,但是,用户数据可能会使用户遭到歧视,甚至造成滥用。
比如,电脑投放求职广告时,就会产生歧视行为。去年,卡耐基梅隆大学的研究人员通过一款名叫AdFisher的工具,对其第三方网站上的广告定向投放过程进行了追踪。结果表明,当谷歌判定求职者为男性时,为其推送高新主管职位消息的概率远大于同等条件的女性求职者。
记者Julia Angwin说:“你可能并不知道你为什么没有得到那份工作,你或许永远不会知道,其实是因为数据歧视了你”。
对此,AdFisher的开发者表示:“我认为,我们的发现揭露了目前广告生态中开始浮现的诸多歧视和不透明现象。从社会的角度来看,它很值得担忧”。
不仅是在工作方面,就连社交软件都会因为数据歧视用户。美国约会应用Tinder的付费版Tinder Plus推出后,其定价的差异化引发了争议。在美国的用户,18岁到29岁只需9.99美元,但是超过30岁的用户则需支付19.99美元。而处在英国地区的用户,18岁至27岁只需支付3.99英镑,而超过28岁就必须支付14.99英镑。
由于这样的定价,关于Tinder歧视“大龄未婚青年”的言论一时蔓延开来。对此,Tinder副总裁的解释是,年轻用户是高频使用者,但缺乏金钱,定价较低是为了刺激其购买欲。而大龄用户对价格或许敏感度更低,所以愿意购买服务。因此,定价差异化是基于公司测算,并非年龄歧视。
不管这些应用是出于怎样的目的,都或多或少地带有歧视色彩,并且大数据有泄露用户隐私之嫌。一份研究大数据影响的白宫报告中写道:“我们长期坚持的公民权利保护政策对居民信息如何在住房、信用卡、雇佣、健康、教育和交易市场等方面使用有严格的限制,而数据分析技术有可能会击溃这一防线”。
研究者指出,对于企业追踪用户的过程以及投放广告的算法有一定的了解,对人权组织及监管机构来说,是相当重要的。当然,企业也应该采取一些相关的措施,消除数据对用户带来的歧视。
大数据是在互联网时代不可避免的发展趋势,但同时,它产生的问题也让人们有些恐慌。
二、大数据发展正面临转折点,需努力趋利避害
大数据的意义就在于,从庞杂的数据背后挖掘并分析用户的行为习惯与喜好,从而找出更符合用户“口味”的产品和服务,并结合用户需求有针对性地调整和优化自身。
这种作用对于当今企业来说,是极其重要的,其商业价值大致体现在四个方面。
大数据可以实现客户群体细分,并为每个群体量身定制特别的服务;大数据可以对现实环境进行模拟,发掘出新的需求并使投资回报率有所提升;大数据可以加强部门之间的联系,提高生产链条与管理链条的效率;大数据可以使服务成本降低,找出隐藏线索,对产品和服务进行创新。
对于社会来说,大数据的发展也是有诸多好处的。大数据定理表明,在试验不变的条件下,重复试验过程多次。在大量重复中,会呈现出几乎必然的统计特性。
随着计算机处理能力的增强,获得的数据量越大,挖掘出的价值就越多。如果银行能够及时发现风险,社会经济将越发强大;如果医院能够及时发现疾病,我们的身体会更加健康;如果通信公司能够降低成本,我们的话费将更加实惠……
以上情况,都可以通过大数据的不断积累和不断分析实现。通过这一过程,我们可以发现规律,从而实现更好的未来。
但是,任何事物都有两面性,大数据时代所产生的问题也同样不少。
第一,数据不够安全。无论是企业还是个人,在实践过程中都会或多或少地产生数据。这些数据在当今时代并不安全,会有很多方法使它们泄露。
第二,数据泄露产生不平等。对于用户来讲,数据是一笔财富,但是遭到了别人的窃取,而自己并未得到任何收益,这对于用户来说是不公平的。
第三,用户隐私问题。当用户在网上注册信息后,这些信息很有可能已经被扩散,当用户收到一些莫名其妙的邮件、电话、短信时,其实用户的各种信息早已被非法的商业机构贱卖了。
无意中拍的照片,可能会使人一夜成名。用户的想法、行为、都可能被商家记录在案。人们担心身份被盗用,担心数据造假,害怕数据框定,反感数据的不公平造成的歧视。
要解决这些问题,需要克服许多困难,面临巨大的挑战。虽然企业可以更加细致地去检验他们的系统和流程,但是依然不能完全解决问题。通常数据驱动的决策都比较隐蔽,即使产生威胁,也不会被轻易发现。
任何的领域都需要统一,但是大数据行业尚不能立法,因为大数据趋势变化多端,无法掌握立法所面临的全部背景。
业内专家认为,有必要在计算机课程中增加数据伦理教育,并且更改有歧视倾向的计算机程序。尽管不能完全解决问题,但也能起到一定的作用。
马云说:“很多人还没搞清楚什么是PC互联网,移动互联网来了,我们还没搞清楚移动互联的时候,大数据时代又来了”。不管是喜是忧,大数据时代已经降临。
哈佛大学社会学教授加里•金说:“这是一场革命,庞大的数据资源使得各个领域开始了量化进程,无论学术界、商界还是政府,所有领域都将开始这种进程”。现在的大数据领域正面临一个转折点,努力的方向决定着其属性的发展。我们应该尽量消减其负面影响,让大数据发挥其正面作用,从而更好地为人类服务。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、市场研究、用户画像构建、学术研究等场景中,我们常常会遇到多维度、多指标的数据难题:比如调研用户消费行为时,收 ...
2026-03-25在流量红利见顶、获客成本持续攀升的当下,营销正从“广撒网”的经验主义,转向“精耕细作”的数据驱动主义。数据不再是营销的辅 ...
2026-03-25在CDA(Certified Data Analyst)数据分析师的全流程工作中,无论是前期的数据探索、影响因素排查,还是中期的特征筛选、模型搭 ...
2026-03-25在当下数据驱动决策的职场环境中,A/B测试早已成为互联网产品、运营、营销乃至产品迭代优化的核心手段,小到一个按钮的颜色、文 ...
2026-03-24在统计学数据分析中,尤其是分类数据的分析场景里,卡方检验和显著性检验是两个高频出现的概念,很多初学者甚至有一定统计基础的 ...
2026-03-24在CDA(Certified Data Analyst)数据分析师的日常业务分析与统计建模工作中,多组数据差异对比是高频且核心的分析场景。比如验 ...
2026-03-24日常用Excel做数据管理、台账维护、报表整理时,添加备注列是高频操作——用来标注异常、说明业务背景、记录处理进度、补充关键 ...
2026-03-23作为业内主流的自助式数据可视化工具,Tableau凭借拖拽式操作、强大的数据联动能力、灵活的仪表板搭建,成为数据分析师、业务人 ...
2026-03-23在CDA(Certified Data Analyst)数据分析师的日常工作与认证考核中,分类变量的关联分析是高频核心场景。用户性别是否影响商品 ...
2026-03-23在数据工作的全流程中,数据清洗是最基础、最耗时,同时也是最关键的核心环节,无论后续是做常规数据分析、可视化报表,还是开展 ...
2026-03-20在大数据与数据驱动决策的当下,“数据分析”与“数据挖掘”是高频出现的两个核心概念,也是很多职场人、入门学习者容易混淆的术 ...
2026-03-20在CDA(Certified Data Analyst)数据分析师的全流程工作闭环中,统计制图是连接严谨统计分析与高效业务沟通的关键纽带,更是CDA ...
2026-03-20在MySQL数据库优化中,分区表是处理海量数据的核心手段——通过将大表按分区键(如时间、地域、ID范围)分割为多个独立的小分区 ...
2026-03-19在商业智能与数据可视化领域,同比、环比增长率是分析数据变化趋势的核心指标——同比(YoY)聚焦“长期趋势”,通过当前周期与 ...
2026-03-19在数据分析与建模领域,流传着一句行业共识:“数据决定上限,特征决定下限”。对CDA(Certified Data Analyst)数据分析师而言 ...
2026-03-19机器学习算法工程的核心价值,在于将理论算法转化为可落地、可复用、高可靠的工程化解决方案,解决实际业务中的痛点问题。不同于 ...
2026-03-18在动态系统状态估计与目标跟踪领域,高精度、高鲁棒性的状态感知是机器人导航、自动驾驶、工业控制、目标检测等场景的核心需求。 ...
2026-03-18“垃圾数据进,垃圾结果出”,这是数据分析领域的黄金法则,更是CDA(Certified Data Analyst)数据分析师日常工作中时刻恪守的 ...
2026-03-18在机器学习建模中,决策树模型因其结构直观、易于理解、无需复杂数据预处理等优势,成为分类与回归任务的首选工具之一。而变量重 ...
2026-03-17在数据分析中,卡方检验是一类基于卡方分布的假设检验方法,核心用于分析分类变量之间的关联关系或实际观测分布与理论期望分布的 ...
2026-03-17