京公网安备 11010802034615号
经营许可证编号:京B2-20210330
三个应用案例—大数据挖掘潜在的威胁
大数据、大城市。世界已有不少大都会运用数据分析与算法建立智能城市,改善交通、例如日本东京就把每辆车子都变成精准的「行动数据」,缓解交通堵塞甚至降低死亡车祸的数量。在欧美,从纽约、旧金山、芝加哥到伦敦、阿姆斯特丹,各种藉由搜集大量数据、发现模式、预测未来的项目不断带领城市前进。其中有从正面改善城市风貌的,也有提前一步,遏止未来可能发生的罪行甚至惨案。今天就让我们来看看三种应用案例:
纽约地铁出现大量神秘 DNA
就算没去过纽约,也应该都听说过拥有百年历史的纽约地铁,又脏又臭又阴暗,但是纽约客以及自世界各地来的旅客又都离不开地铁,每天 550 万人搭乘,想必每一座地铁、每一层阶梯、每一列车厢,到处沾满人类陈年积淀的汗渍与污垢。不过,真实情况可能要你大吃一惊,不是没那么脏,而是比我们想象得更奇幻。
康乃尔大学 Weill 医学院的研究者们,花了 18 个月的时间执行了一项大数据项目。他们用鉴识科学常用的棉花棒,在 486 个纽约地铁站搜集目标样本,车厢门、楼梯扶手、座椅、灯杆、垃圾桶都不放过,最后总共发现 1 万 5 千多种微生物,将近一半的样本是人类未知的有机生物,27% 是活性并俱有抗药性的细菌,虽然所有细菌仅有 12% 与疾病相关,还发现了三个与腺鼠疫、炭疽相关样本,但幸而这些样本都没有活性。而与人类的基因组相匹配的只占了不到 2%。
这项研究的主要作者康乃尔医学院遗传学家 Christopher E. Mason 说:「人们望着地铁上的手扶梯时,从来不会有『这上面充满生命』的念头,但是知道这项研究之后,他们可能会开始这么想。不过我想让他们以看待热带雨林的眼光看待地铁,这里有那么多物种,但并没有影响到你的健康,简直让人敬畏和赞叹。」
关于地铁细菌的研究,不只是有趣,也不只是满足了科学家的好奇心,研究者们将把这些物种分门别类,未来就能把它们当作对照样本,确定某些疾病、甚至也可预测未来若恐怖份子把某些细菌当做生物武器攻击的物质,是否已经扩散。
洛杉矶警察的关键报告
电影《关键报告》中,主角靠着拥有预知犯罪者的系统,在罪行真正发生之前,就先把人逮捕到案。
预测性警务软件「PredPol」当然没有科幻到「人」的地步,但也有达成遏止犯罪率的效果了。该团队花了五年时间,收集过去十年的警方数据,并且运用算法分析,预测下一次可能产生犯罪情况的地点。共同创办人 Jeffrey Brantingham 指出,他们基于三个因素测定发生案件的机率:容易滋养犯罪事件的场所(比如过去对斗殴事件睁一只眼闭一只眼的酒吧)、多次受害地区(repeat victimization,比如曾被闯入的门户容易再次被闯入)、受害地区的邻近地区(曾被闯入的门户周遭区域也容易成为下次被下手的目标),计算出 10-20 个最有可能在警察下一次执勤时发生犯罪的地点。PredPol 宣称,只要警察花 5%-15% 的巡逻时间在划定的红色区域,就能只比依靠自身经验阻止更多犯罪活动。
目前全美共有将近 60 间警局使用 Predpol,每年每间警局必须支付大约 10 万 — 15 万美金的服务费。虽然公部门预算拮据,但投资 PredPol 的第一年,加州 Santa Cruz 闯空门的窃盗案就下降了 11%、抢劫案更减少了 27%。2011 年洛杉矶 Foothill 区开始使用 PredPol,四个月之后犯罪率降低了 13%,其他未未使用 PredPol 的区域微幅多出 0.4%。
洛杉矶警局 Foothill 的警官 Sean Malinowski 说,「我们一直持续使用这套软件,Foothills 也一直都是洛杉矶犯罪率下降最高的区域。我不认为两者之间毫无关联。」
伦敦打击「恶棍交易员」
交易员诈欺导致银行或个人严重损失的新闻时有所闻。过去非法交易只能透过「关键词监测(key word surveillance)」来判断交易员是否涉及渎职,但是 Market Practitioner Panel (MPP)指出,这种方式是有缺陷的。想要揭露失职的交易员,运用大数据技术会是揭露会是更长期而有效的方案。
MPP 建议英国金融机构采取「预测编码(predictive codeing)」的方式,不只能够侦测关键词,还能辨识出交易员非比寻常的行为,像是从非正式的管道如私人信箱、实时通讯、聊天论坛沟通,或者在奇怪的时间离开办公室、强制休假却搞失踪、在组织中所扮演的角色与责任等等。
大数据技术能够非常细微的观测个别交易员的活动,精确建立每位交易员的个人资料与实际操作模式,一有异常就能提前预防,而且能够大规模且实时的分析。除了交易员之外,一般个人当然也得提防。金融诈欺者愈来愈精明、愈来愈猖狂,金融业者势必得施加更大的力道,应用最新的技术,全面整合分析数据,从个人开办帐户开始,就要建立档案并针对交易监控与客户管理保持追踪,检测异常的帐户活动,从而趋吉避凶。
不过,品诚梅森(Pinsent Masons)律师事务所信息保护专家 Kathryn Wynn 提醒,机构需注意别滥用大数据破坏隐私,未审先判。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12很多小伙伴都在问CDA考试的问题,以下是结合 2025 年最新政策与行业动态更新的 CDA 数据分析师认证考试 Q&A,覆盖考试内容、报考 ...
2025-12-11在Excel数据可视化中,柱形图因直观展示数据差异的优势被广泛使用,而背景色设置绝非简单的“换颜色”——合理的背景色能突出核 ...
2025-12-11在科研实验、商业分析或医学研究中,我们常需要判断“两组数据的差异是真实存在,还是偶然波动”——比如“新降压药的效果是否优 ...
2025-12-11在CDA(Certified Data Analyst)数据分析师的工作体系中,数据库就像“数据仓库的核心骨架”——所有业务数据的存储、组织与提 ...
2025-12-11在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05在CDA(Certified Data Analyst)数据分析师的能力模型中,“指标计算”是基础技能,而“指标体系搭建”则是区分新手与资深分析 ...
2025-12-05在回归分析的结果解读中,R方(决定系数)是衡量模型拟合效果的核心指标——它代表因变量的变异中能被自变量解释的比例,取值通 ...
2025-12-04在城市规划、物流配送、文旅分析等场景中,经纬度热力图是解读空间数据的核心工具——它能将零散的GPS坐标(如外卖订单地址、景 ...
2025-12-04在CDA(Certified Data Analyst)数据分析师的指标体系中,“通用指标”与“场景指标”并非相互割裂的两个部分,而是支撑业务分 ...
2025-12-04每到“双十一”,电商平台的销售额会迎来爆发式增长;每逢冬季,北方的天然气消耗量会显著上升;每月的10号左右,工资发放会带动 ...
2025-12-03随着数字化转型的深入,企业面临的数据量呈指数级增长——电商的用户行为日志、物联网的传感器数据、社交平台的图文视频等,这些 ...
2025-12-03在CDA(Certified Data Analyst)数据分析师的工作体系中,“指标”是贯穿始终的核心载体——从“销售额环比增长15%”的业务结论 ...
2025-12-03在神经网络训练中,损失函数的数值变化常被视为模型训练效果的“核心仪表盘”——初学者盯着屏幕上不断下降的损失值满心欢喜,却 ...
2025-12-02在CDA(Certified Data Analyst)数据分析师的日常工作中,“用部分数据推断整体情况”是高频需求——从10万条订单样本中判断全 ...
2025-12-02在数据预处理的纲量统一环节,标准化是消除量纲影响的核心手段——它将不同量级的特征(如“用户年龄”“消费金额”)转化为同一 ...
2025-12-02在数据驱动决策成为企业核心竞争力的今天,A/B测试已从“可选优化工具”升级为“必选验证体系”。它通过控制变量法构建“平行实 ...
2025-12-01