
大数据大热知易行难 企业必须充分积累各类数据
日前,国务院印发《促进大数据发展行动纲要》(下称《纲要》)。《纲要》指出,2018年底前,建成国家政府数据统一开放平台。2020年底前,逐步实现信用、交通、医疗、卫生、就业、社保、地理、文化、教育、科技、资源、农业、环境、安监、金融、质量、统计、气象、海洋、企业登记监管等民生保障服务相关领域的政府数据集向社会开放。同时,强化中央财政资金引导,集中力量支持大数据核心关键技术攻关、产业链构建、重大应用示范和公共服务平台建设等。
海通证券表示,此次《纲要》的下发,促进政府数据开放、共享有望使得各行各业真正迎来大数据时代。同时,大数据全产业链的培育有望搭建中国大数据新生态,而大数据在新的垂直领域的应用将助力商业模式和变现渠道的创新和探索,有望重构产业链的价值体系。
在打破“信息孤岛”实现数据互联互通的道路上,数据的采集是需要突破的第一道关卡。北京腾云天下科技有限公司首席金融行业专家鲍忠铁对《第一财经日报》记者表示,数据采集面临数据现有存在形式的非电子化和分散度较广两大难题。
“目前,公共机构大量的数据还是以纸质化的形式存在着,特别是医疗数据、教育数据和农业数据。”鲍忠铁表示,未来如何将这些存留在纸张里的数据电子化将面临较大的挑战。
数据想要集中在统一平台上,就要实现数据的集中,但是目前大量的数据分散在省、市、乡、镇等不同的政府层级中,并不完全集中在国家层面。“数据不集中直接影响对数据背后规模发现的程度。”鲍忠铁进一步告诉《第一财经日报》,数据分散之外,在集中的过程中,数据格式不统一也是需要攻克的难题。例如,同样一条信息,A乡用6个数据来诠释,B乡用10个数据诠释,而C乡却用12个。现在距离2018年还有三年的时间,想要在三年时间做到数据标准和格式的统一化并非易事。
任何事件的发展都需要循序渐进。从政府数据的开放来看,目前政府数据可以分为三类,可以向公众公开的数据、不宜公开的敏感数据和不能公开的国家机密数据。海通证券表示,未来数据开放应该遵循分级、分层、分类逐步开放的步骤。短期来看,涉及到民生的交通、医疗、信用、社保等行业有望较早实现开放。
前海征信总经理邱寒对《第一财经日报》记者表示,大数据要产生价值存在诸多关键点,积累和整合就是其中之一。“大数据之所以不同于以往的常规数据分析,其核心在其大。只有数据够大,大到突破一定的临界点,才有可能从量变转化为质变。”邱寒表示,大包含几层意思,第一,数据的维度够丰富;第二,数据的频度够高;第三,数据的时间跨度够长。而要实现这些,企业必须充分积累各类数据。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在大模型从实验室走向生产环境的过程中,“稳定性” 是决定其能否实用的关键 —— 一个在单轮测试中表现优异的模型,若在高并发 ...
2025-10-15在机器学习入门领域,“鸢尾花数据集(Iris Dataset)” 是理解 “特征值” 与 “目标值” 的最佳案例 —— 它结构清晰、维度适 ...
2025-10-15在数据驱动的业务场景中,零散的指标(如 “GMV”“复购率”)就像 “散落的零件”,无法支撑系统性决策;而科学的指标体系,则 ...
2025-10-15在神经网络模型设计中,“隐藏层层数” 是决定模型能力与效率的核心参数之一 —— 层数过少,模型可能 “欠拟合”(无法捕捉数据 ...
2025-10-14在数字化浪潮中,数据分析师已成为企业 “从数据中挖掘价值” 的核心角色 —— 他们既要能从海量数据中提取有效信息,又要能将分 ...
2025-10-14在企业数据驱动的实践中,“指标混乱” 是最常见的痛点:运营部门说 “复购率 15%”,产品部门说 “复购率 8%”,实则是两者对 ...
2025-10-14在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10在企业数据量从 “GB 级” 迈向 “PB 级” 的过程中,“数据混乱” 的痛点逐渐从 “隐性问题” 变为 “显性瓶颈”:各部门数据口 ...
2025-10-10在深度学习中,“模型如何从错误中学习” 是最关键的问题 —— 而损失函数与反向传播正是回答这一问题的核心技术:损失函数负责 ...
2025-10-09本文将从 “检验本质” 切入,拆解两种方法的核心适用条件、场景边界与实战选择逻辑,结合医学、工业、教育领域的案例,让你明确 ...
2025-10-09在 CDA 数据分析师的日常工作中,常会遇到这样的困惑:某电商平台 11 月 GMV 同比增长 20%,但究竟是 “长期趋势自然增长”,还 ...
2025-10-09Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30