
进入大数据行业的公司必须了解这六个问题
之前参加了IC咖啡举办的Italk活动,听取的有关大数据公司和产业机构的讲座,因此萌生出一个写文章的冲动,想对目前大数据产业中的一些错误现象进行讨论.
陈宇认为大数据是哲学层面上的问题,属于统计学范畴,部分揭示了大数据产业的本质,但是实际上大数据这个概念自身就有着不同的诠释。利用数据进行军事分析,产品定位,交通管理,风险管理,精准营销等等,其实在几十年前就有了。最早的保险产品就是来源于偶然事件的概率分析,其参考历史数据分析,依据计算出的概率来,来对保险产品进行定价。中国古代的军事学家孙膑在战争中,通过逐步减少行军灶坑来迷惑对手,利用其师弟庞涓对数据信任,制造其带领军队溃败的假象,最后在对方轻敌冒进的前提下,突袭了对手,赢得了战争胜利。因此数据分析其实在很久远的古代就存在了。为什么过去的数据分析换成了时髦的名称大数据了呢?
相对于过去的数据,我们来讨论大数据的含义:
1)过于一些记录是以模拟形式出现的,或者以数据形式出现但是存贮在本地,不是公开数据资源,没有开放给互联网用户,例如音乐、照片、视频、监控录像等影音资料。现在这些数据不但数据量巨大,并且放到了互联网上,开放给整个互联网用户,其数量之大是前所未有了。举个例子Facebook每天有18亿张照片上传或被传播,形成了海量的开放数据。
2)移动互联网出现后,移动设备的很多传感器收集了大量的用户点击行为数据,已知iphone有3个传感器,三星有6个传感器。它们每天产生了大量的点击数据,这些数据被某些公司所有拥有,形成用户大量行为数据。
3)移动地图出现后,例如高德、百度、google地图,其产生了大量的数据流数据,这些数据不同于传统数据,传统数据代表一个属性或一个度量值,但是这些地图产生的流数据代表着一种行为、一种习惯,这些流数据经频率分析后会产生巨大的商业价值。基于地图产生的数据流是一种新型的数据类型,在过去是不存在的。
4)进入了社交网络的年代后,互联网行为主要由用户参与创造,因此有大量的互联网用户创造出大量的社交行为数据。这些数据是过去不曾想像的,是海量的。某些数据代表特定人群的特点和个性。
5)电子商户崛起带来了大量网上交易行为,其产生了大量的交易数据,包含支付行为,查询行为,物流运输、购买行为等等,产生了海量的信息流和资金流数据。
6)传统的互联网入口转向搜索引擎之后,用户的搜索行为和提问行为产生了海量数据。单位存贮价格的下降也为存储这些数据提供了技术上的可能。
现在我们所指的大数据不同与过去传统的数据,其产生方式、存储载体、访问方式、表现形式、来源特点等都同传统的数据不同。简单的讲大数据范围更接近于某个群体行为特点数据,全面的数据。移动互联网和社交网络创造出来了大量的行为数据。
大数据产业是朝阳产业,任何一个想进入此产业的公司和个人向先要思考好以下几个问题。
1数据在哪里?
2哪些是有用的数据?
3如何分析这些数据?(如何将非结构化数据变成结构化数据)
4需要用数据解决的问题是什么?或者是分析后数据后提出的观点是什么?
5如何展现你的数据和推理?(图形、图表、曲线、分值、评价、归类、等级、概率、模型等等,大数据要么解决目前的问题,要么支持你的假设,要们引导出另一个未知观点)
6重新审核数据分析的逻辑和数据来源,是否可以展现一份可以经过推敲的数据分析报告?
如果以上的问题都可以解决,这时你可以进入正产业。中国的大数据产业近几年来逐渐升温,政府有投入了大量的资金。目前正在困扰很多大数据公司的问题是数据在哪里?目前我们了解的大数据来源主要有以下几个方面;
1)电信运行商(由于其提供互联网接入服务,互联网行为记录数据)
2)第三方支付(支付行为产生的资金流和信息流数据)
3)电商平台(阿里为代表,几亿的淘宝用户和2万亿的网络购买行为的数据)
4)社交平台(微信和微博为代表的社区网络产生的互联网行为数据)
5)电子游戏平台(大量用户产生的数据)
6)移动入口产生大量数据(包含移动APP,导航,地图等)
7)搜索引擎上产生的数据
除了这些新兴的大数据来源,其实在传统行业,由于很多数据是不能公开和共享的,还有很多大数据来源没有被重点关注。例如:
1)政府掌握的经济社会的统计数据
2)金融行业内部交易和支付数据
3)医疗行业的病历数据
4)教育行业的考试数据
5)交通运输行业物流数据
6)科学研究方面大量重复的论文、专利、科研实验的数据
7)生物工程、农林牧渔等方面的数据
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据清洗是 “数据价值挖掘的前置关卡”—— 其核心目标是 “去除噪声、修正错误、规范格式”,但前提是不破坏数据的真实业务含 ...
2025-10-17在数据汇总分析中,透视表凭借灵活的字段重组能力成为核心工具,但原始透视表仅能呈现数值结果,缺乏对数据背景、异常原因或业务 ...
2025-10-17在企业管理中,“凭经验定策略” 的传统模式正逐渐失效 —— 金融机构靠 “研究员主观判断” 选股可能错失收益,电商靠 “运营拍 ...
2025-10-17在数据库日常操作中,INSERT INTO SELECT是实现 “批量数据迁移” 的核心 SQL 语句 —— 它能直接将一个表(或查询结果集)的数 ...
2025-10-16在机器学习建模中,“参数” 是决定模型效果的关键变量 —— 无论是线性回归的系数、随机森林的树深度,还是神经网络的权重,这 ...
2025-10-16在数字化浪潮中,“数据” 已从 “辅助决策的工具” 升级为 “驱动业务的核心资产”—— 电商平台靠用户行为数据优化推荐算法, ...
2025-10-16在大模型从实验室走向生产环境的过程中,“稳定性” 是决定其能否实用的关键 —— 一个在单轮测试中表现优异的模型,若在高并发 ...
2025-10-15在机器学习入门领域,“鸢尾花数据集(Iris Dataset)” 是理解 “特征值” 与 “目标值” 的最佳案例 —— 它结构清晰、维度适 ...
2025-10-15在数据驱动的业务场景中,零散的指标(如 “GMV”“复购率”)就像 “散落的零件”,无法支撑系统性决策;而科学的指标体系,则 ...
2025-10-15在神经网络模型设计中,“隐藏层层数” 是决定模型能力与效率的核心参数之一 —— 层数过少,模型可能 “欠拟合”(无法捕捉数据 ...
2025-10-14在数字化浪潮中,数据分析师已成为企业 “从数据中挖掘价值” 的核心角色 —— 他们既要能从海量数据中提取有效信息,又要能将分 ...
2025-10-14在企业数据驱动的实践中,“指标混乱” 是最常见的痛点:运营部门说 “复购率 15%”,产品部门说 “复购率 8%”,实则是两者对 ...
2025-10-14在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10