京公网安备 11010802034615号
经营许可证编号:京B2-20210330
新年伊始 大数据仍面临重重考验
大数据从“概念”走向“价值”,基于大数据的推荐与预测逐步流行,数据科学将兴起,安全与隐私成为重要问题,大数据产业成为战略性产业——这是中国计算机学会大数据专家委员会对“大数据”2018年十大趋势预测中的内容。在这份预测中,还包括数据商品化与数据共享联盟化,大数据生态环境逐步发展等。“大数据”从2012年预热,到被各行各业所提及,各种舆论声音纷杂,有人认为这是一个机遇,也有人认为这会是一场“泡沫”。2018年,大数据将面临的问题有哪些?
数据开放仍是大问题
数据应用的前提是数据开放,这已经是共识。中国工程院院士、中国互联网协会理事长邬贺铨指出,中国人口居世界首位,但2010年中国新存储的数据为250PB,仅为日本的60%和北美的7%。目前我国一些部门和机构拥有大量数据但宁愿自己不用也不愿提供给有关部门共享,导致信息不完整或重复投资。2012年中国的数据存储量达到64EB,其中55%的数据需要一定程度的保护,然而目前只有不到一半的数据得到保护。
孙九林介绍了美国在数据开放方面的做法。美国政府提供政策和经费保障,使数据信息中心群成为国家信息生产和服务基地,保障数据信息供给不断,利用网络把数据和信息最便捷、及时地送到包括科学家、政府职员、公司职员、学校师生在内所有公民的桌上和家庭中,把全社会带进了信息化时代。
“让每一位公民在数据、信息、知识、理论、决策、效益的各个环节上发挥才华,让民众把数据信息流动过程中和应用过程中的各种价值充分挖掘出来,国家为他们才华的发挥和价值的挖掘带好路、服务好、创造好环境。”孙九林认为这就是美国政府选择的数据信息共享的“大循环”道路。该思路在利益分配上的基本点就是让全社会受益,让整个国家受益。
目前,我国还没有国家层面的专门适合数据共享的国家法律,只有相关的条例、法规、章程、意见等。
针对于大数据利用的前端——数据共享的问题,孙九林认为,十多年的数据共享取得了很大的成效,特别是全社会的共享理念得到共识,但存在的问题仍然很突出:缺少国家层面的政策,已有分散的若干意见约束力不够,高层管理人员对数据开放共享的深刻意义的认识有待提高;现有国家数据共享平台难以满足国家发展和科技创新对数据资源的需求;缺少数据开放共享的专职队伍和相应的数据专家以及管理人才;缺少对专职数据共享服务人员的合理评价机制和标准等等。
急需“国家大数据战略”宏观统筹
“不要被大数据(Big Data)的 Big 误导,大数据更强调的不是数据大,而是数据挖掘。”在第十届国家信息化专家论坛上,邬贺铨院士指出,大数据需要更强调数据挖掘利用,关键的是要有国家大数据战略。
邬贺铨提出,需要制定国家大数据发展战略,大数据是一个应用驱动性很强的服务,其标准和产业格局尚未形成,这是我国跨越发展的机会,但切忌一哄而起在目的不明的情况下到处建设大数据中心,到处搞“数据房地产”,而是需要从战略上重视大数据的开发利用,将它作为转变经济增长方式的有效抓手。同时,我国需要尽快制定“信息保护法”和“信息公开法”,既要鼓励面向群体而且服务于社会的数据挖掘,又要防止针对个体侵犯隐私的行为,提倡数据共享又要防止数据被滥用。
中国计算机学会专家委员会指出:大数据时代有两点非常有利于中国信息产业的发展,第一是大数据技术发开源为主,迄今为止没有形成技术垄断;第二点,中国的人口和经济规模决定了中国的数据资产规模全球最大。因此,政府、学界、产业界和资本市场应该通力合作,在确保国家数据安全的前提下,最大程度地开放数据资产,释放大数据的巨大价值。
目前已经有一批企业开始用数据创业。在国外已经有不少用数据提供服务、做数据分析、进行可视化研究的公司,有些已经取得不错的业绩,甚至有很好的前景而拒绝大公司收购。有人预测,如果国内互联网创业者,能从海量的“垃圾”信息中嗅出些端倪,找到某个切入点,没准能成为行业的佼佼者。不过,现在在国内找出个像样的“大数据”初创公司并非易事;但也有人认为,正是有这样的空白存在,才让人看到机遇
各国大数据人才紧缺
大数据人才无疑是紧缺人才。Gartner咨询公司预测,大数据将为全球带来440万个IT新岗位和上千万个非IT岗位。麦肯锡公司预计,美国到2018年深度数据分析人才缺口将达14万~19万人,能够分析数据帮助公司获得经济效益的技术及管理人才有150万人的缺口。中国能理解与应用大数据的创新人才更是稀缺资源。
大数据专家委员会认为,从目前各国的人才培养来看,数据科学家应掌握数学、统计学、数据分析、商业分析和自然语言处理等学科技能,具有较宽的知识面,具有独立获取知识的能力。复旦大学的课程设置强调了数据科学家是研究数据的科学家,而不仅仅是一个数据工程师或者数据分析师。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在分类变量关联分析中(如 “吸烟与肺癌的关系”“性别与疾病发病率的关联”),卡方检验 P 值与 OR 值(比值比,Odds Ratio)是 ...
2025-11-05CDA 数据分析师的核心价值,不在于复杂的模型公式,而在于将数据转化为可落地的商业行动。脱离业务场景的分析只是 “纸上谈兵” ...
2025-11-05教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-05教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-04【2025最新版】CDA考试教材:CDA教材一级:商业数据分析(2025)__商业数据分析_cda教材_考试教材 (cdaglobal.com) ...
2025-11-04在数字化时代,数据挖掘不再是实验室里的技术探索,而是驱动商业决策的核心能力 —— 它能从海量数据中挖掘出 “降低成本、提升 ...
2025-11-04在 DDPM(Denoising Diffusion Probabilistic Models)训练过程中,开发者最常困惑的问题莫过于:“我的模型 loss 降到多少才算 ...
2025-11-04在 CDA(Certified Data Analyst)数据分析师的工作中,“无监督样本分组” 是高频需求 —— 例如 “将用户按行为特征分为高价值 ...
2025-11-04当沃尔玛数据分析师首次发现 “啤酒与尿布” 的高频共现规律时,他们揭开了数据挖掘最迷人的面纱 —— 那些隐藏在消费行为背后 ...
2025-11-03这个问题精准切中了配对样本统计检验的核心差异点,理解二者区别是避免统计方法误用的关键。核心结论是:stats.ttest_rel(配对 ...
2025-11-03在 CDA(Certified Data Analyst)数据分析师的工作中,“高维数据的潜在规律挖掘” 是进阶需求 —— 例如用户行为包含 “浏览次 ...
2025-11-03在 MySQL 数据查询中,“按顺序计数” 是高频需求 —— 例如 “统计近 7 天每日订单量”“按用户 ID 顺序展示消费记录”“按产品 ...
2025-10-31在数据分析中,“累计百分比” 是衡量 “部分与整体关系” 的核心指标 —— 它通过 “逐步累加的占比”,直观呈现数据的分布特征 ...
2025-10-31在 CDA(Certified Data Analyst)数据分析师的工作中,“二分类预测” 是高频需求 —— 例如 “预测用户是否会流失”“判断客户 ...
2025-10-31在 MySQL 实际应用中,“频繁写入同一表” 是常见场景 —— 如实时日志存储(用户操作日志、系统运行日志)、高频交易记录(支付 ...
2025-10-30为帮助教育工作者、研究者科学分析 “班级规模” 与 “平均成绩” 的关联关系,我将从相关系数的核心定义与类型切入,详解 “数 ...
2025-10-30对 CDA(Certified Data Analyst)数据分析师而言,“相关系数” 不是简单的数字计算,而是 “从业务问题出发,量化变量间关联强 ...
2025-10-30在构建前向神经网络(Feedforward Neural Network,简称 FNN)时,“隐藏层数目设多少?每个隐藏层该放多少个神经元?” 是每个 ...
2025-10-29这个问题切中了 Excel 用户的常见困惑 —— 将 “数据可视化工具” 与 “数据挖掘算法” 的功能边界混淆。核心结论是:Excel 透 ...
2025-10-29在 CDA(Certified Data Analyst)数据分析师的工作中,“多组数据差异验证” 是高频需求 —— 例如 “3 家门店的销售额是否有显 ...
2025-10-29