京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据技术面临各方面的挑战
一、大数据信息有效性不足
虽然信息时代使得人们面对的信息规模扩大和沟通效率提高, 但是这并不意味着有价值的数据信息获取就变得更加迅捷和容易。
首先,有价值的数据信息获取面临挑战。网络信息资源在扩大人们信息来源渠道和提高信息获取效率的同时,也不可避免的会促使人们遭受大量虚假、无用数据信息的困扰。信息大爆炸造成的信息环境污染和“噪音信息”的蔓延增加了人们识别、判定和利用有效信息的困难。
其次,有价值的数据信息整合面临挑战。使用大数据面临的一大挑战就是如何将社会经济各个主体之间的数据信息能够方便和有效地整合在一起。要想让大数据更有效地服务于人类社会,就必须将存在于社会各个主体中多种格式的海量数据通过统一的数据格式构建融合人、机、物三元世界的统一信息系统。最后,有价值的数据信息生成存在算法演化问题。在现实中,大数据往往是根据各个社会经济主体行为被动产生的,但是数据生成者的商业模式等行为会影响大数据的生成机制,导致其提供的信息不具有时间前后的可比性。以谷歌公司为例,其商业模式的主要目标是更快速地为使用者提供准确的信息。为此,谷歌不断改进搜索算法,使用者可以通过后续谷歌推荐的相关词快捷地获得有用信息。这一模式改变了数据生成机制,容易出现数据使用者搜索的关键词并非其本意的现象。
二、大数据样本选择困难
人们希望通过海量数据信息的收集减少信息不对称,但是这些庞大的数据可能对我们解决问题并不会起到正面的作用。当前,大数据使企业或者机构获取每一个客户的信息、构建客户群的总体数据成为可能。但是,这种大数据并不一定就是我们所要研究对象的全部数据总体。如果我们误将掌握的海量数据当作所要研究对象的数据总体,那么基于大数据分析得出的结论就很有可能是错误的。因此,在分析和研究某个问题时,我们不能迷信大数据的作用。
以“谷歌流感趋势”(GFT) 项目为例,2008 年11 月谷歌公司启动该项目,目标是预测美国疾控中心(CDC) 报告的流感发病率。2009 年,GFT 团队在《自然》杂志发表文章报告,只需分析数十亿搜索中45 个与流感相关的关键词,GFT 就能比CDC 提前两周预报2007-2008 季流感的发病率。但是,2014 年美国《科学》杂志报道,2009 年GFT 没有能预测到非季节性流感A-H1N1;从2011 年8 月到2013 年8 月的108 周里,GFT 有100 周高估了CDC 报告的流感发病率。其中,2011-2012 季期间,GFT 预测的发病率是CDC 报告值的1.5 倍多;2012-2013 季期间,GFT 流感发病率是CDC 报告值的2 倍多。另外,2007 年美国爆发的次贷危机也是一个例证。自20 世纪90 年代起, 美国无论是抵押贷款和信用卡的申请还是资产证券化产品的定价和评级,都是建立在较为成熟的大数据基础上的。但是,金融机构仍然做出了系统性错误的金融决策,成为金融危机爆发的导火索。
三、大数据数据处理技术更新缓慢
大数据虽然可以通过扩大数据样本规模和提升数据处理能力来管理日常经营性的风险,但是代表金融创新风险等未来事件是无法用历史数据进行预测和分析的。
首先,大数据处理技术面临数据生成者学习行为的挑战。大数据处理技术和评估标准影响数据生成者行为,同样数据生成者行为也会影响大数据处理技术和评估标准。以我国大数据重要来源之一的社交媒体为例,这种大数据来源的有效性是有前提条件的,即人们在社交媒体分享的信息都是真实的、自发的、不受大数据处理技术和各种评估标准的影响。但是,人们在互联网时代运用网络学习的能力是不断提高的。如果人们通过学习大数据处理技术和各种评估标准而相应改变社交媒体的信息,就会导致大数据生成机制发生质变。因此,在对大数据进行技术处理时,简单地认为数据生成者都是无意识地生产大数据,忽略了数据生产者行为背后趋利避害的动机,可能就会得出错误的判断和结论。
其次,大数据处理技术面临去冗降噪挑战。在现实中,大数据一般来自于不同的社会主体,以动态数据流的形式产生,人们在方便获取数据的同时,也会使得虚假数据、无效数据等噪声数据的生产成本降低。面对大数据中包含众多不同形态的噪声数据,如何通过数据处理技术的革新来挖掘有价值的信息是我们自始至终都要面临的一项技术挑战。这如同人类社会医学技术创新与病毒变异之间的“竞赛”一样是长期存在的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在机器学习分析、数据决策的全流程中,“数据质量决定分析价值”早已成为行业共识—— 正如我们此前在运用机器学习进行分析时强 ...
2026-02-25在数字化时代,数据已成为企业决策、行业升级的核心资产,但海量杂乱的原始数据本身不具备价值—— 只有通过科学的分析方法,挖 ...
2026-02-25在数字化时代,数据已成为企业核心资产,而“数据存储有序化、数据分析专业化、数据价值可落地”,则是企业实现数据驱动的三大核 ...
2026-02-25在数据分析、机器学习的实操场景中,聚类分析与主成分分析(PCA)是两种高频使用的统计与数据处理方法。二者常被用于数据预处理 ...
2026-02-24在聚类分析的实操场景中,K-Means算法因其简单高效、易落地的特点,成为处理无监督分类问题的首选工具——无论是用户画像分层、 ...
2026-02-24数字化浪潮下,数据已成为企业核心竞争力,“用数据说话、用数据决策”成为企业发展的核心逻辑。CDA(Certified Data Analyst) ...
2026-02-24CDA一级知识点汇总手册 第五章 业务数据的特征、处理与透视分析考点52:业务数据分析基础考点53:输入和资源需求考点54:业务数 ...
2026-02-23CDA一级知识点汇总手册 第四章 战略与业务数据分析考点43:战略数据分析基础考点44:表格结构数据的使用考点45:输入数据和资源 ...
2026-02-22CDA一级知识点汇总手册 第三章 商业数据分析框架考点27:商业数据分析体系的核心逻辑——BSC五视角框架考点28:战略视角考点29: ...
2026-02-20CDA一级知识点汇总手册 第二章 数据分析方法考点7:基础范式的核心逻辑(本体论与流程化)考点8:分类分析(本体论核心应用)考 ...
2026-02-18第一章:数据分析思维考点1:UVCA时代的特点考点2:数据分析背后的逻辑思维方法论考点3:流程化企业的数据分析需求考点4:企业数 ...
2026-02-16在数据分析、业务决策、科学研究等领域,统计模型是连接原始数据与业务价值的核心工具——它通过对数据的规律提炼、变量关联分析 ...
2026-02-14在SQL查询实操中,SELECT * 与 SELECT 字段1, 字段2,...(指定个别字段)是最常用的两种查询方式。很多开发者在日常开发中,为了 ...
2026-02-14对CDA(Certified Data Analyst)数据分析师而言,数据分析的核心不是孤立解读单个指标数值,而是构建一套科学、完整、贴合业务 ...
2026-02-14在Power BI实操中,函数是实现数据清洗、建模计算、可视化呈现的核心工具——无论是简单的数据筛选、异常值处理,还是复杂的度量 ...
2026-02-13在互联网运营、产品迭代、用户增长等工作中,“留存率”是衡量产品核心价值、用户粘性的核心指标——而次日留存率,作为留存率体 ...
2026-02-13对CDA(Certified Data Analyst)数据分析师而言,指标是贯穿工作全流程的核心载体,更是连接原始数据与业务洞察的关键桥梁。CDA ...
2026-02-13在机器学习建模实操中,“特征选择”是提升模型性能、简化模型复杂度、解读数据逻辑的核心步骤——而随机森林(Random Forest) ...
2026-02-12在MySQL数据查询实操中,按日期分组统计是高频需求——比如统计每日用户登录量、每日订单量、每日销售额,需要按日期分组展示, ...
2026-02-12对CDA(Certified Data Analyst)数据分析师而言,描述性统计是贯穿实操全流程的核心基础,更是从“原始数据”到“初步洞察”的 ...
2026-02-12