京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代的结构和解构_数据分析师
很多人都知道,数字世界的发展和黑客非常有关系。比如微软的比尔·盖茨就做过黑客,最新的标志性人物Facebook的扎克伯格也干过这个事儿。Facebook早期的版本Facemash.com就偷偷地接入了哈佛大学的学生数据库,获取了学生证件照。扎克伯格让同学们根据这些照片投票选美,很是热闹了一阵子。
来自华中科技大学的几个学生也是很彻底地模仿了扎克伯格一回:他们设置了一个名为hust-facemash.com的网站,同样是偷偷摸摸地侵入学校的HUB(华中科技大学公共信息服务平台),把一大堆的女同学照片放到网上让人“选美”。与当年的Facemash所引发的舆论抨击一样,华中科大的这个Facemash同样引来了不少的担忧和批评。
核心问题就是“隐私”。担忧者认为,在学生档案里,不仅有照片,还有各种其他信息,比如电话住址之类。今天这个Facemash只是公布了照片,但其他信息在这些年轻人侵入系统后必然被一览无遗。这又怎不让人担心呢?而那几个学生声称,他们做这个东西的动机只是想提醒一下校方:嘿,你们的网络系统安全弱爆了!
动机论是很不靠谱的,因为谁也不知道他们在倒腾这玩意儿时究竟是抱着善意提醒的目的呢,还是恶搞玩上一玩,抑或想成为中国的扎克伯格?但结果是很明显的,不仅侵犯到了人家的隐私,而且对那些女孩来讲,自家照片在自家从未首肯的情况下被别人拿去和其他女孩子放在一起评头论足,总不是件令人愉快的事。
如果说中外两个Facemash的后果还不算太严重的话,那么,另外几起用户数据库被侵入就很严重了。韩国最大的社交网站Cyworld遭入侵,成为韩国取消实名制的动因之一。不久前,美国最大的职业社交网站Linkedin遭入侵,600万用户密码被公布在一个论坛上。中国亦有类似事件,据称波及千万用户之巨。我们把很多东西放在网上,而这些东西的安全性,看来很值得担忧。
这已经不再是隐私那么简单了。数字经济的高速发展,使得很多事的效率都在提高,当然也会带来一些负面效应。而在这诸多负面效应中,在我看来,最大的莫过于,其实系统是很脆弱的。
我们必须承认,依托于网络,每个人之间的“距离”变得更近了,我们越来越成其为一个整体。但重点就是这个“依托网络”。服务器记载着我们太多的东西,这个整体变得越来越结构化,只要攻破其中一点,其整体就会出现剧烈的动荡,受侵害人口动辄数十乃至数百万。过去的一个银行体系的被侵入和今天(假定的)Facebook被侵入,后果简直是天壤之别。
互联网诞生之初,走的就是“去中心化”道路,免费的网络服务器系统阿帕奇的构想,就是在美国遭受斩首式攻击时,有其他节点可以迅速补上成为中心控制。但这个互联网从web1.0、web2.0一路走来,进入大数据时代后,大量的用户数据被储存在服务器端。是的,节点越来越趋去中心化,但数据却越来越中心化。我们已经“让渡”了一些很重要的东西给机器,但机器,却并不牢靠。
加强安全性是一个方法。但正如福尔摩斯的创造者柯南道尔在《跳舞的小人》里写道:有人发明,就有人看懂。再强的安全体系,都有被侵入的可能。而之所以很多看似松松垮垮的系统没有被侵入的原因其实很简单:不值得。解密是有成本的,但如果标的物诱惑足够,成本便会相对变得小很多。又有什么样的系统是100%的安全呢。数据越来越集中化,使得这个标的物的诱惑,变得越来越大。
加强对黑客行为的处罚也是一个方法。华中科技大学的那几个学生会面临什么样的惩处尚不知晓,扎克伯格可是因为Facemash领了哈佛的留校察看处分的。一些后果并不严重的行为,小小惩戒一下即可。但类似Cyworld和Linkedin的被入侵,一个警告是完全没有用的。
不过,话也要说回来。数据集中化加强了整个社会的结构化,体系会变得越来越有利于既得利益者、掌权者和有钱人。漏洞的存在,对当事人是一种不幸,但对整个社会而言,或许又是一种不幸中的大幸:反抗成为一种可能。哈维尔所谓“无权势者的权力”,在今天这个社会,大抵就会具象成如此吧。
波澜壮阔的基于数据的结构和反抗(或又可称之为解构)在大数据时代已经悄然登场。人类社会,终归是在矛盾中一路前行的。但这种结构或者反抗,最终是否会彻底失控,谁也不知道。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21在实际业务数据分析中,单一数据表往往无法满足需求——用户信息存储在用户表、消费记录在订单表、商品详情在商品表,想要挖掘“ ...
2026-01-21在数字化转型浪潮中,企业数据已从“辅助资源”升级为“核心资产”,而高效的数据管理则是释放数据价值的前提。企业数据管理方法 ...
2026-01-21在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19数据清洗是数据分析的“前置必修课”,其核心目标是剔除无效信息、修正错误数据,让原始数据具备准确性、一致性与可用性。在实际 ...
2026-01-19在CDA(Certified Data Analyst)数据分析师的日常工作中,常面临“无标签高维数据难以归类、群体规律模糊”的痛点——比如海量 ...
2026-01-19在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16