该对大数据立规矩了吗？-CDA数据分析师官网

热线电话：13121318867

该对大数据立规矩了吗？

2016-05-24

该对大数据立规矩了吗？

随着移动互联网的普及，社交生活网络化的泛滥，我们每个人在享受信息技术带来的便利时，每分每秒也在留下自己的数字足迹（digital footprint），包括现在或过去任何一个时点所在的位置、移动轨迹等等，平台、应用等商品和服务提供者有能力搜集并分析利用，以了解我们的活动范围、生活习惯、各种偏好，并最终描绘出我们每个人的“数字画像”（digital profiling）。正如法官Alsup所担心的，互联网公司把基于大数据的精准定位和营销，“创造性”地用到庭审诉讼双方的辩论中，很可能会左右陪审团的判断，控制庭审的结果。

事实上，描绘出个人的数字画像进而“投其所好”，还是大数据一种“相对保守”的利用方式。毕竟在微信朋友圈中，是看到豪车还是饮料的广告，顶多成为我们吹牛或自嘲的谈资。但随着基于大数据的自动化决策科技（automated decision-making）在个人对健康、教育、工作、信用、商品和服务的取得上，扮演着逐渐重要的角色，甚至是“生杀予夺”的权重时，我们就应该对大数据、自动化决策过程的影响高度重视起来。

例如，当大数据和算法判断求职者为男性时，为其推送高薪主管职位消息的概率远大于同等条件的女性求职者；利用大数据计算参与恐怖主义活动的概率，并采取各种不同程度限制出行或监控的措施；在缺乏直接信用记录和数据的情况下，基于其他信息（如电话账单、教育背景、社交网络等）预估信用评分，最终导致特定群体的人无法申请小额贷款；信用卡发卡银行降低某人信用额度的原因并非基于该持卡人的消费与还款记录，而是基于该持卡人被归为“同一类型”之消费者所共同拥有的记录与特征等等。

2016年1月6日，美国联邦交易委员会公布报告《大数据：吸纳或排他的工具？》(Big Data: A Tool for Inclusion or Exclusion? Understanding the Issues)中还举了这样一个例子：

2012年，当桑迪飓风肆虐美国时，短短时间，推特上产生了超过2000万条相关的消息，其中包含了大量关于飓风和受灾人群的信息。为了做到救灾资源的有效配置，美国当局决定对推特上的消息进行实时分析，以此判断哪些地区、哪些人群最需要帮助。可是事后分析回顾发现，因为电力供应受到严重影响，导致重灾区人群无法发出大量的网络消息，所以恰恰是受灾最重地区的推特消息最少。对推特消息的分析形成了不准确的数据视图，无法正确指向受灾最重的地区以及最需要帮助的人群。

被大数据歧视了怎么办？

为避免大数据可能带来的歧视或偏差，美国政府从2014年开始发布了多份报告，希望引起社会各界对此问题的重视。2014年5月1日，美国白宫发表报告《大数据：抓住机会、保存价值》（Big Data: Seizing Opportunities, Preserving Values）。报告建议：“联邦政府主要的公民权利和消费者保护机构，包括司法部、联邦贸易委员会、消费者金融保护局和公平就业机会委员会，应当主动研究有可能对特定阶级带来歧视性影响的大数据分析的做法和结果，并制定计划调查和解决违反法律的此类事件。”

上文提到的美国联邦交易委员会的报告建议，在进行分析之前，首先要确保数据具有代表性；企业必须谨防数据模型中隐藏的偏差，厘清统计关联性和因果性之间的区别；企业需要详尽审视相关模型所依赖的因子，把握好预测分析与公平性之间的平衡关系；在流程建设上，允许消费者能访问自身数据并就错误或遗漏提出异议。

2016年5月4日，美国白宫发布报告《大数据：关于算法系统、机会、公民权利的报告》（Big Data: A Report on Algorithmic Systems, Opportunity, and Civil Rights）。报告提出通过算法和系统的设计来实现平等权利（a principle of “equal opportunity by design”），并建议研究机构和行业一起，开展算法审计和对大数据系统的外部测试以保证人们被公平对待。

欧洲在这方面走在了其他国家的前面。将于2018年5月25日正式生效的欧盟《一般数据保护条例》，在第22条明确规定了对于仅仅以自动化方式（包括数字画像）做出的、对个人能够产生法律效果的或其他类似的显著影响的决定，个人有权免受这样决定的制约。

在我国，大数据和自动化算法高歌猛进，与此同时，我们是不是也应该放慢下脚步，仔细想想如何将其可能的负面影响降到最低？

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；