
大数据的是与不是
在时下的流行语中,很难找出一个比“大数据”更吸引眼球的术语了。1980年,阿尔文 托夫勒在《第三次浪潮》中预言了信息时代的到来会带来数据爆发,约翰 梅西在1998年的美国高等计算机系统协会大会上首次提出“大数据(big data)”一词。什么是大数据?这一概念目前尚未形成统一的定义。几种代表性的观点如下:麦肯锡认为“大数据是指无法在一定时间内用传统数据库软件工具对其内容进行抓取、管理和处理的数据集合”;维基百科认为“大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集”;全球最具权威的 IT研究与顾问咨询公司——高德纳公司认为“大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产”。
大数据时代已经来临,它将在众多领域掀起变革的巨浪,这是勿庸置疑的事实,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值,而对于电网企业来说,大数据的应用同样会促进企业的跨越发展。
大数据的本质是事物的时域、空域记录,并非事物的描述数据
对于大数据的特点,IT界通常用Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)这4个 V来概括。Volume,指数据体量巨大,从TB级别跃升到PB乃至EB级别;Variety,指数据类型繁多。除了传统的结构化数据,大量非结构化、半结构化数据如网络日志、音频、视频、图片等;Value,指价值密度低,但大数据分析的价值高。价值密度的高低与数据总量的大小成反比,以视频为例,一部一小时的视频,在连续不间断监控过程中,可能有用的数据仅仅只有一两秒;Velocity,指变化速度快。大数据不仅量大,而且变化快,大数据的应用依赖于对数据的快速处理。但在笔者看来,对大数据作4V特点的概括是现象而非本质总结。
其实人类文明就是大数据的记录与应用积累,当今社会进入了信息时代,信息化的本质是用 IT技术和方法描述世界,描述事物的内在本质、过程规律和业务规则,信息化的应用过程就是在描述好事物的软件系统中实现人工和 /或机器记录,大数据的本质是事物的时域、空域记录,并非事物的描述数据,大数据成为热门是因为信息化、互联网、终端的普及和应用让我们进入了一个机器自动记录的时代,爆炸性增长的记录数据使传统的人工、单机 /单节点的机器处理能力无法完成记录的分析、挖掘,由此催生了云计算和大数据概念并推动人工智能的工程应用,机器学习等人工智能技术就是机器处理大数据及大数据应用高级模式。
大数据应用的本质是推导规律、预知未来,并非简单的统计分析
在信息化时代以前,人类就有典型的大数据应用,如视觉美学总结的黄金分割(0.618),社会学中的在特定时空范围内存在的“二八”理论。大数据应用的本质是推导规律、预知未来,并非简单的统计分析。在信息化时代,大数据极大依赖信息化及其应用,开展大数据分析也必须应用信息化方法与手段,符合信息化业务驱动、目标导向等原则,没有目标的大数据平台建设或挂大数据“羊头”不利于信息化建设和大数据应用。
而互联网大数据与企业大数据是有区别的,互联网本质是跨区域的信息化网络基础设施,其大量的内容服务和居于互联网社交软件并不存在描述事物的过程即没有对象模型,人们应用互联网留下了应用记录(大量的非结构化数据),分析这些大数据记录的前提是重新构建记录的对象,对记录标识特征。企业信息化一般经过业务标准化和业务流程梳理过程,所以企业的大数据是存在对象描述,但企业应用的困难是我们建设的系统在对象描述上不统一、对象上的记录不完整。所以互联网大数据与企业大数据应用尽管原理与方法一致,但分析工作的重点是有区别的。互联网公司在开展大数据分析的工具、技术方法不完全适用于企业,更不能把互联网大数据的平台建设当做企业大数据应用工作的全部。
区别好对象模型数据与记录数据是大数据分析的基础,尽管描述事物对象的数据也可以达到 PB级,如人类的基因图谱、地球大气层流动模型、电网的网络结构模型等,这些数据不是大数据,在这些对象模型上构建软件并记录的业务变化是大数据。所以在大数据应用方面存在两类数据的预处理,一类是模型数据预处理,另一类是记录数据预处理。模型层面的预处理本质是信息化建设方案的科学性、合理性。记录的完整性很大程度上也是取决于信息化方案,同时也取决于信息系统的应用过程。一旦软件上线,再作数据治理来解决模型之间的不一致性或对记录的二次“模型化”加工是一种方法论上的误导,正确的方法应该是依据企业架构和行业解决方案完善信息化架构,实现企业信息化架构规范和引导下的信息系统建设和应用,在企业层面统筹企业模型、统筹系统结构和功能界面、统一业务系统应用规范。企业的数据治理必须在建设方案中完成,系统建成系统后的数据治理是无效的,当然在系统运行过程中数据库的技术数据治理是必须的。
大数据应用在电网领域大有可为
在电网企业中,电量数据是一组典型的大数据。客户和客户的电表台账是电量数据的宿主对象,采集系统中对客户和电表台账进行建模,各用户电表的时序记录就是电量大数据。下面结合国网江苏电力开展的负荷预测大数据应用简述大数据应用方法。
首先是数据预处理。对象模型的预处理,依托营配调一体化,建立客户和电表台账与电网供电逻辑关系,构建电网各电压层级直至各台区到用户的关联模型;记录数据的预处理,对电量记录电度值进行年度节假日除权回原,去除电量的节假日因素,去除记录奇点和内插补全个别记录缺点等。
其次是分行业回归建立日电量与气温、湿度等因素用电模型,依据实时运行方式累计各台区日电量、日负荷,完成各区域、各电压等级的电量和负荷预测模型的构建,并构建模型机器学习,保持模型的时效性。
最后,由大数据平台给预测模型导入实时气温与前一时段的电量和负荷,实现短期、超短期的全网负荷预测。同样原理,关联宏观GDP与电量指数,结合业扩包装量变化,实现中长期负荷预测。
2015年 ,江苏电网以全样本的用户每日实时采集用电数据,结合十多年用电、业扩、气象等历史数据,建立起涵盖全省各地区、分行业以及25万专变用户和40万台公用变压器的包括温度、湿度、节假日、周末等要素的多维度用电影响模型,模型包含的数据关联关系超过110亿项,开展负荷中长期、短期、超短期预测工作,有效指导了生产工作。
此外,电量大数据的应用在行业内外还有大量的可应用价值,如从用电设备节能潜力分析全社会节能潜力、大用户用电特征分析行业产能利用情况、居民用户家庭活动特征等,大数据应用在电网领域大有可为。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
2025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-06-052025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-05-27CDA数据分析师证书考试体系(更新于2025年05月22日)
2025-05-26解码数据基因:从数字敏感度到逻辑思维 每当看到超市货架上商品的排列变化,你是否会联想到背后的销售数据波动?三年前在零售行 ...
2025-05-23在本文中,我们将探讨 AI 为何能够加速数据分析、如何在每个步骤中实现数据分析自动化以及使用哪些工具。 数据分析中的AI是什么 ...
2025-05-20当数据遇见人生:我的第一个分析项目 记得三年前接手第一个数据分析项目时,我面对Excel里密密麻麻的销售数据手足无措。那些跳动 ...
2025-05-20在数字化运营的时代,企业每天都在产生海量数据:用户点击行为、商品销售记录、广告投放反馈…… 这些数据就像散落的拼图,而相 ...
2025-05-19在当今数字化营销时代,小红书作为国内领先的社交电商平台,其销售数据蕴含着巨大的商业价值。通过对小红书销售数据的深入分析, ...
2025-05-16Excel作为最常用的数据分析工具,有没有什么工具可以帮助我们快速地使用excel表格,只要轻松几步甚至输入几项指令就能搞定呢? ...
2025-05-15数据,如同无形的燃料,驱动着现代社会的运转。从全球互联网用户每天产生的2.5亿TB数据,到制造业的传感器、金融交易 ...
2025-05-15大数据是什么_数据分析师培训 其实,现在的大数据指的并不仅仅是海量数据,更准确而言是对大数据分析的方法。传统的数 ...
2025-05-14CDA持证人简介: 万木,CDA L1持证人,某电商中厂BI工程师 ,5年数据经验1年BI内训师,高级数据分析师,拥有丰富的行业经验。 ...
2025-05-13CDA持证人简介: 王明月 ,CDA 数据分析师二级持证人,2年数据产品工作经验,管理学博士在读。 学习入口:https://edu.cda.cn/g ...
2025-05-12CDA持证人简介: 杨贞玺 ,CDA一级持证人,郑州大学情报学硕士研究生,某上市公司数据分析师。 学习入口:https://edu.cda.cn/g ...
2025-05-09CDA持证人简介 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度、美团、阿里等 ...
2025-05-07相信很多做数据分析的小伙伴,都接到过一些高阶的数据分析需求,实现的过程需要用到一些数据获取,数据清洗转换,建模方法等,这 ...
2025-05-06以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/g ...
2025-04-30CDA持证人简介: 邱立峰 CDA 数据分析师二级持证人,数字化转型专家,数据治理专家,高级数据分析师,拥有丰富的行业经验。 ...
2025-04-29CDA持证人简介: 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度,美团,阿里等 ...
2025-04-28CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-27