京公网安备 11010802034615号
经营许可证编号:京B2-20210330
非互联网从业者:大数据给我工作与思维带来的变革
第一次听到Big Data/大数据还是在欧洲念商学院的时候,有一门课叫做《管理咨询》。教授看了2012年10月的《哈佛商业评论》,兴致勃勃的对我们说,小组期末作业(当时我们的是一个市场预测项目)所有的分析都必须基于更多的数据。用他的话说:“只有你无情的虐数据,它才会乖乖的告诉你,你想了解的信息”。同时他也提到,利用部分信息的不可获得性来进行信息倒卖的生意,在以后会越来难做。
这些天读了维克托•迈尔•舍恩伯格(Viktor Mayer-Schönberger)的《大数据时代》有一些感触。我现在的工作虽然不在咨询公司,但也涉及对企业行业的判断与预期,因此从管理/商业的角度来说说这一趋势对我的工作与思维带来的影响:
1、数据的意义:
举最贴近我的例子,我研究生是学“项目管理”的,这门学科中有一个技术或者说方法叫做 Earned Value(EV)/挣值,通过项目经理制定收集和发亏信息的范围、方式和频率,由项目中具体操作人员进行数据采集、粗加工和反馈。基于这些被初步加工过的数据,项目经理可以了解到诸如项目是否超支、是否延期等信息。除了与利益相关人交流外,这些信息本身是没有作用的,它们的作用于价值是体现在“应该触发/不触发相应的行动进行干预和调整”上,也就是用这些数据进行预测从而实现干预以获得理想的结果。
从企业管理的角度看,虽然不同的利益相关人(比如股东、管理者、监管部门、公司员工)对企业有不同的期待与要求,审计对他们的作用是相似的:财务数据是否真实可靠?能否利用这些数据进行决策? 市场数据、人力数据、科研数据等也是类似——我们关注数据的真实性最终还是希望能用这些数据进行预测与决策,而不是数据本身。
我们关注企业领导者对其企业战略、组织架构和流程的描述最终是需要相应的数据进行支持,从而判断这个企业能否构筑一条“路”通向其所期待的终点。因此战略决策、投资决策和管理改进的决策都将基于这些预测。
2、我们对数据的态度:
作为一个非财务学生/工作者,在我接触这类学科时,了解到会计/财务使用的数据应满足:相关性、可靠性、可比性和可理解性。考虑到财务数据的特殊性,其他数据还应考虑透明性(并非所有数据都是一手的)和准确性(并非所有数据都有明确的获取和储存标准与流程)。
用作者的话说,对数据的衡量标准为:正确性、准确性、严格度和纯洁性。
在目前的趋势下,数据透明性有较大的提高(由于互联网的作用,很多信息变得可以获得了)那么我们对数据其他方面的容忍度也会下降或者说也不得不下降。这体现在我们被暴露在更多的数据下,会发现很多以前所没有关注和思考过的问题,而处理和解决这些问题方法也许也是我们之前所没有的。比如我们为了在A和B两个方面进行论证而收集数据,而为了A方面而收集的数据又揭示了B方面可能存在的问题。这部分数据相对B方面而言是不准确或者说不严格的(从数据来源与采集方式等角度来看),但其意义又是不容忽视的。
因此创新精神(如何发现新问题、展开新思考和采用新办法)以及相应的知识管理(如果再次遇到,我们应当如何处理),又显得尤为重要了。这也是我对舍恩伯格提到的三个趋势的理解:
3、在这一趋势下,我们能做什么?
回国后参加过一家在地产咨询界赫赫有名的咨询公司的面试,最后决定我放弃这个offer的原因只是那个经理人的一句话。当时我问他,他们公司拥有怎样的数据库,他们在项目中会用怎样的方法对数据本身进行加工。他给到我的回答是:在大环境下,很多信息是非公开的,因此不需要拥有很多的信息或对信息进行加工,它们本身就是可以卖钱的。而我的理解是作者认为大数据价值链将有三类角色,即掌握海量数据的公司、提供数据分析能力的技术公司以及提供思维的公司和个人。目前看来应该是掌握数据的公司,因为现阶段很多数据还是不可得的或者不能有效收集的,因此这类公司可以授权相关的公司来分析数据。而技术分析公司虽有可转移的的技术,可却很难再进行海量数据的收集。
而从我的角度来看,最重要的是第三类公司,因为前两者只是资源的储备者,而第三类公司才是资源与价值的转化者。在信息透明度仍在提高的进程中,我们更加关注的应当是如何利用好已有数据进行认知、预测、判断与决策。
引用作者的话,“正在发生的未来”,“更好地方法和答案还在不久的将来”。以上是我一些粗浅的见解。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12在数据分析日常工作中,Excel数据筛选是数据清洗、数据提取、样本筛选的核心基础操作。传统Excel手动筛选、函数筛选方式,面对多 ...
2026-08-12 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-08-12在数据分析、统计建模、数据挖掘与商业调研过程中,原始数据往往无法做到绝对干净规整。受系统故障、人工录入失误、设备误差、突 ...
2026-08-11在数据分析工作中,聚类分析是典型的无监督学习方法,核心作用是依据数据自身的多维特征,将相似样本自动划分为若干类别,实现“ ...
2026-08-11 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-11AB实验是互联网产品迭代、营销优化、功能升级的核心科学验证手段,通过流量随机分组、对照组与实验组对比,科学验证策略、功能、 ...
2026-08-10在MySQL数据库优化中,索引是提升查询效率、降低数据库IO开销、优化系统性能的核心手段。普通单列索引仅适配简单查询场景,面对 ...
2026-08-10