京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据算法的困境
2013年,美国有一起充满争议的案子,一个因为偷窃罪被判刑的男人把威斯康星法院告了。原因是他被判整整8年有期徒刑,不是因为他的罪行,也不是因为法官的判断,而是因为一个AI(人工智能)认为,他对社会具有“高危险性”。大数据时代,我们关注最多的是数据的安全和隐私,然而,数据加上算法所带来的问题,或许要比安全和隐私重要得多。
大数据让算法前所未有的强大
机器学习和深度神经网络,克服了算法设计中人的局限;只要有数据,只要数据中有统计规律,算法就能找到这些规律。人工智能技术近几年的火热,主要得益于机器学习、深度神经网络方面的技术突破,以及大数据技术的成熟。这些技术的突破使得从前很多被认为机器不可能解决的问题,变得可以解决。过去技术人员开发信息系统,需要将领域知识在头脑中转换为算法和程序。这些技术突破改变了这一现状,消除了对领域知识的依赖。算法可以通过机器学习的方法,从大量数据中自动提取出来,不再需要人来编写。这不仅减少了错误遗漏、降低了开发成本,并且可以随着数据的变化自动更新,而不会因为现实的变化而落伍。
算法存在的问题
算法没有价值判断,最终是人给计算结果加上了价值判断。但是一旦人们把算法给出的结果,用在处理社会关系上,这些结果就对相关的每个人产生了意义。
算法让一部分人掌握了过大的权力。虽然技术突破和大数据让算法开发变得容易,但是获取到足够的数据和计算资源,开发并利用算法,仍然是一件具有相当门槛的事情。能够掌握利用算法的仍限于少数人,这就使得这些少数人在社会生活中相对于其他人占有了极大的优势。为了社会公平,我们对拥有财产优势的人征收更多的税负,对掌握权力的人施加种种制衡,但是我们对拥有算法优势的人如何限制,仍然没有可行的思路。
对算法的迷信。技术突破让算法不需要人编写,虽然减轻了人开发算法的负担,但也让人更难以理解算法。大多数深度学习产生的算法都让人无法理解,但是由于大多数情况下算法是有效的,人们即使不理解,也乐于利用算法。这就产生了一个风险:没人知道算法的边界和失效条件,因此也就不能判断算法何时会出错。由于不理解,使用者往往倾向于忽视这种风险,于是形成了对算法的迷信。威斯康星州的判案系统就是这种情况。
相应的社会约束机制难以跟上。新技术只要有效,很快就会在社会生活中广泛应用,但是新技术往往深刻地改变了人们的生活方式,而与这些改变相适应的社会约束机制,只能在新技术的社会影响日益明确之后,才能逐渐建立起来。社会规范总是滞后于社会现实,在技术快速发展的当今,这种滞后造成的问题尤为显著。今天人工智能对人们日常生活的影响,恰如一百年前汽车普及造成的影响。当美国普通家庭开始拥有汽车很多年之后,道路信号、交通规则、驾照考试等设施和机制才逐渐完善,跟上技术变革的脚步。
在变化中探索秩序。人工智能技术仍在快速发展过程中,对社会生活的种种影响才刚刚开始显现。对此我们既不能因噎废食,阻碍技术发展,也不能放任自流,任由丛林法则支配,而是必须因应技术发展的潮流和社会现实的变化,不断探索调整,兴利除弊,让技术发展始终作为推动社会进步的动力。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-06-10在MySQL数据库日常查询、数据统计、后台接口开发、数据导出等场景中,开发者经常需要查询数据表除某几列之外的所有字段。例如查 ...
2026-06-09在Python网络请求、爬虫开发、接口测试、数据抓取等实操场景中,requests库是最常用的第三方请求工具,而content属性是requests ...
2026-06-09 数据分析正在重塑每一个行业。CDA认证的三本官方教材,分别对应Level I、Level II、Level III,为你铺就从业务数据分析到数 ...
2026-06-09在数字财务、智慧财税、业财融合深度推进的当下,传统财务模式下数据标准混乱、业务流程碎片化、知识无法沉淀、系统互通性差等问 ...
2026-06-08随着数字经济深度渗透各行各业,数据正式成为继土地、劳动力、资本、技术之后的第五大生产要素,是企业数字化转型、精细化运营、 ...
2026-06-08 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-06-08【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04