京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代 我们还有隐私吗
大数据对个人隐私权的影响。怎样保护网络隐私权?
随着数字信息技术的不断发展,“网络匿名”有可能会变成“数学上不可能”的事。
1995年,欧盟出台的隐私法例将“个人资料”定义为可以直接或间接识别一个人的信息。很显然,当时立法者考虑的是那些带有身份标识号的文件资料之类的东西,这些标识号就好像人的姓名,而立法者们希望它们可以得到保护。
如今,“个人资料”这一定义所包含的内容已经远远超出当年那些立法官员的想象,甚至可以轻易地超过18年前他们通过这项法例时整个世界的数据量。
来看看到底发生了什么。首先,这个世界每年所创造的数据量在以指数形式增长,去年,这一数字则达到了2.8ZB(1ZB =10244GB),听起来就很可怕的数字,而且据知名信息行业咨询服务商IDC称,这一数字将在2015年翻一番。此外,这些数据中的3/4是由个体人在创造或移动数字文件时贡献的。举例来说,一个标准的美国上班族每年可以贡献180万MB的数据量,平均每天则有约5000MB,这其中包括下载的电影、文档、电邮以及这些数据通过移动或非移动互联网传播时所产生的附加数据量。
尽管这其中的大部分数据都是不可见的,似乎也并不携带任何个人信息,但事实并非如此。现代数据科学已经发现几乎任何类型的数据都能用来识别创造它的人,就好比指纹一样。比如说你在网上下载的电影、你的手机发出的定位信息,甚至是你被监控摄像机所拍下来的步态都可以用来识别你。实际上,数据越多,其中可以称得上隐私的就越少。普林斯顿大学的计算机科学家阿尔文德·纳拉亚南(Arvind Narayanan)称,只要有合理的商业动机来推动数据挖掘的进程,任何形式的隐私都是“算法上不可能”(algorithmically impossible)的。
可以说,我们已经在这条不归路上越走越远。那些以往被我们认为是个人资料的信息——姓名或者信用卡号——如今都已经被安客诚(Acxiom)公司这样的数据代理商用作交易,它拥有500多万名分布在世界各地的消费者的个人信息。人们在填写了某些调查表或者注册了一些服务后,相应的数据就进入了公共领域。这也是这些代理商的数据来源。
安客诚可以利用一些信息来推测你的生活方式、兴趣爱好和日常活动,比如你的汽车品牌和使用时间、你的收入和投资状况、你的年龄、受教育程度以及邮政编码。所有这些信息可以将你归类为70种不同的“PersonicX”集群中的一个。除此之外,你最近有离过婚吗,或者你刚刚变成了一名空巢老人?这些“人生大事”更可以将一个人从一个消费阶层转移到另一个,而这正是安客诚及其广告客户的关键兴趣所在。安客诚称其可以通过分析数据来预测3000种不同的行为及心理倾向,比如说一个人会在某两个品牌间做出怎样的选择。
虽说听起来很厉害,但这些数据代理商如今已经被认为是过时的了,尤其是跟Facebook这样的互联网公司相比。Facebook已经可以实现对个人信息收集的自动化与实时化,其首次公开募股时的财务档案显示,Facebook上每位用户的图片和视频资料数据量约为111MB,而Facebook的用户数如今已经超过了10亿,这可是整整100PB(1 PB = 10242 GB)的个人信息数据!在一些法律案件中,Facebook所记录的数据也派上了用场,其中包括涉案人发过的文字信息、点过“赞”的东西以及所用过的电脑的IP地址等,这些资料加起来足有800页,这800页就又给每位用户增加了几MB的数据量。
线上和线下的数据如今正在逐步融合,进而帮助营销人员更精准地进行广告投放,这也是众多“数字隐私”拥护者的烦心事。今年二月,Facebook宣布与包括安客诚在内的多家数据代理商展开合作,通过整合各自的数据资源来构造现实世界与虚拟网络之间的联系。一个月后,安客诚的首席科学官在一次投资者会议上称他们的数据已经与全美90%的社会档案建立了链接。
这些数据往往被描述为“在某种程度上具有匿名性”,但是牵涉到的信息越多,这样的说法就越显站不住脚。就拿移动通信运营商来说,他们会记录用户的位置和手机号码,然后再将这些综合数据卖给商家。尽管位置数据的匿名化是可以实现的,但是来自MIT的伊夫·亚历山大(Yves-Alexandre de Montjoye)和塞萨尔·A·伊达尔戈(César A. Hidalgo)却发现只要通过同一手机的四个不同的位置数据点就可以精确定位其拥有者。不光是移动通信运营商,你所用的浏览器也会“出卖”你的个人信息,就连最近刚刚兴起的可穿戴设备(如Google Glass)也被认为会引起隐私担忧。
毫无疑问,可以获得的个人大数据量越多,其中的信息量就越大。只要拥有了足够多的数据,我们甚至可能发现有关于一个人的未来信息。去年,来自美国罗彻斯特大学的亚当·萨迪克(Adam Sadilek)和来自微软实验室的工程师约翰·克拉姆(John Krumm)发现他们可以大致预测一个人未来可能到达的位置,最多可以预测到80周后,其准确度高达80%。为此,他们收集了32000天里307个人和396辆车的GPS数据并建造了一个“大规模数据集”。
两人想象了一下这一研究成果的商业应用,他们说到时候会出现这样的广告:“需要理发吗?四天后你就会在这家发廊周围100米内,届时它将会有优惠活动哦!”
这两人还为他们的系统起了一个名字——“遥远未来”(Far Out),没错,这也正是大数据时代下的个人信息将带我们去的地方。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在互联网产品运营、用户增长的实战场景中,很多从业者都会陷入一个误区:盲目投入资源做推广、拉新,却忽视了“拉新后的用户激活 ...
2026-02-06在机器学习建模过程中,特征选择是决定模型性能的关键环节——面对动辄几十、上百个特征的数据(如用户画像的几十项维度、企业经 ...
2026-02-06在CDA(Certified Data Analyst)数据分析师的日常实操中,表格结构数据是贯穿全流程的核心载体,而对表格数据类型的精准识别、 ...
2026-02-06在日常办公数据分析中,我们经常会面对杂乱无章的批量数据——比如员工月度绩效、产品销售数据、客户消费金额、月度运营指标等。 ...
2026-02-05在分类模型(如风控反欺诈、医疗疾病诊断、客户流失预警)的实操落地中,ROC曲线是评估模型区分能力的核心工具,而阈值则是连接 ...
2026-02-05对CDA(Certified Data Analyst)数据分析师而言,数据分析的价值不仅在于挖掘数据背后的规律与洞察,更在于通过专业的报告呈现 ...
2026-02-05在数据分析实战中,我们经常会遇到“多指标冗余”的问题——比如分析企业经营状况时,需同时关注营收、利润、负债率、周转率等十 ...
2026-02-04在数据分析场景中,基准比是衡量指标表现、评估业务成效、对比个体/群体差异的核心工具,广泛应用于绩效评估、业务监控、竞品对 ...
2026-02-04业务数据分析是企业日常运营的核心支撑,其核心价值在于将零散的业务数据转化为可落地的业务洞察,破解运营痛点、优化业务流程、 ...
2026-02-04在信贷业务中,违约率是衡量信贷资产质量、把控信用风险、制定风控策略的核心指标,其统计分布特征直接决定了风险定价的合理性、 ...
2026-02-03在数字化业务迭代中,AB测试已成为验证产品优化、策略调整、运营活动效果的核心工具。但多数业务场景中,单纯的“AB组差异对比” ...
2026-02-03企业战略决策的科学性,决定了其长远发展的格局与竞争力。战略分析方法作为一套系统化、专业化的思维工具,为企业研判行业趋势、 ...
2026-02-03在统计调查与数据分析中,抽样方法分为简单随机抽样与复杂抽样两大类。简单随机抽样因样本均匀、计算简便,是基础的抽样方式,但 ...
2026-02-02在数据驱动企业发展的今天,“数据分析”已成为企业经营决策的核心支撑,但实践中,战略数据分析与业务数据分析两个概念常被混淆 ...
2026-02-02在数据驱动企业发展的今天,“数据分析”已成为企业经营决策的核心支撑,但实践中,战略数据分析与业务数据分析两个概念常被混淆 ...
2026-02-02B+树作为数据库索引的核心数据结构,其高效的查询、插入、删除性能,离不开节点间指针的合理设计。在日常学习和数据库开发中,很 ...
2026-01-30在数据库开发中,UUID(通用唯一识别码)是生成唯一主键、唯一标识的常用方式,其标准格式包含4个短横线(如550e8400-e29b-41d4- ...
2026-01-30商业数据分析的价值落地,离不开标准化、系统化的总体流程作为支撑;而CDA(Certified Data Analyst)数据分析师,作为经过系统 ...
2026-01-30在数据分析、质量控制、科研实验等场景中,数据波动性(离散程度)的精准衡量是判断数据可靠性、稳定性的核心环节。标准差(Stan ...
2026-01-29在数据分析、质量检测、科研实验等领域,判断数据间是否存在本质差异是核心需求,而t检验、F检验是实现这一目标的经典统计方法。 ...
2026-01-29