京公网安备 11010802034615号
经营许可证编号:京B2-20210330
想学数据分析?先来看看基础入门吧
谁说菜鸟不会数据分析的读书笔记,读完这本书的第一感觉是,excel已经够喝一壶了,不要急着想学SPSS、SAS,还是先从基础的看起吧。
做数据分析切忌为了分析而分析,要有明确的分析目的,一般会借助于一些理论模型来知道分析,比如:
营销方面的理论模型:4P、用户使用行为、STP理论、SWOT等,管理方面的理论模型:PEST、5W2H、时间管理、生命周期、逻辑树、金字塔、SMART原则。
书中列举的这些理论模型很多都听说过,只是平时处理问题很少用到,或者说没有人带着去切实的拿这些理论解决过实际问题,所以也就在平时很少想起了。不过在看这些方法的原理时,还是觉得蛮牛的。
数据收集常见的就是网络、数据库、调研等。
数据处理有数据清洗以去除垃圾数据,并且进行相应的转化计算。
后面花了很大的篇幅讲数据展现,还是比较全面的,见识了各种数据图表是如何做出来的。
其中讲了平均数、绝对数、百分数等几个以前小学学的概念,捡个现在用的比较多的说下:
倍数是一个数除以另一个数的商。
番数是指原来数量的2的N次方。N是几,就是现在的数据较原来的数据翻了几番。
以月为栗子来说明
2016年8月的数据较2015年8月的数据为同比。
2016年8月的数据较2016年7月的数据为环比。
书中有一个有意思的表格说明了方法论在数据分析中的位置:
作者用数据分析与服装师设计做类比,来说明方法论就像服装的设计图纸一样从整体上指导数据分析按照一定的规则体系完成,而不是抓到一块分析一块。
下面讲讲都有哪些方法论:
这个方法的名字其实就是四个分析因素的首字母缩写,分别是政治(political)、经济(economic)、技术(technological)和社会(social)。
一般用于从宏观层面分析企业或行业所处的环境。
也是英文首字母,何时(When)、何地(Where)、何人(Who)、何因(Why)、何事(What)、如何(How)、何价(How much)。
这个分析方法用途还是蛮大的,可以用于很多场景的分析,比如用户画像、用户的购买行为等等。
这个分析方法,如果你会用思维导图工具的话,一看就明白,其实就是将一个大问题一层层拆分成一个小问题,以便更好地分析问题,查找解决办法。
这个理论还真的是用于营销的,4P分别是产品(Product)、价格(Price)、促销(Promotion)、渠道(Place)。主要用于产品的营销分析。
强烈建议看到本文的小伙伴随便找一组数据在excel的“表格-条件格式”中的各种条件格式试一遍,你会发现,真的很好玩,原来一些看起来很炫酷的功能其实excel是可以轻松实现的。
挺实用的功能,用于多个不连续的空白单元格一次性填充相同内容。具体操作步骤如下:
1、按住ctrl不放,用鼠标左键一个个选中所有空白单元格。
2、选好后,放开ctrl,输入要填充的内容,这时,填充的内容会显示在最后一个选中的单元格中。
3、关键一步,按住ctrl不放,再按enter,这时,所有之前选中的单元格都会被填充上相同的内容。
函数比较难在博客中讲清楚,几个重要的函数,同学们可以自行百度一下具体用法:
取左部字符——left();
取右部字符——right();
字符合并——concatenate();
在表格的首列查找指定数据,并返回表格中需要的其他数据,用于两个表格匹配合并——vlookup();
跟上一个类似,是在表格的首行查找指定数据——hlookup();
年、月、日提取——date();
计算时间间隔长度,常用于工龄计算——dateif();
数据随机抽样——rand();
这也是比这之前一直很苦恼的一个问题,书中讲的方法不错,这里沿用书中的人才评价的例子说明:
如上表,将所有指标建立一个矩阵,一一进行对比重要性,行比列重要,交叉单元格写1,反之写0,比如人品对比动手能力,人品没有动手能力重要,则写0。注意,各指标不与自己做对比。
完成表格后,每一个指标都会有一个自己的得分,得分越高,权重越大:
某指标权重=(某指标重要性合计得分/所有指标的重要性合计得分)*100%
单独列出来,是因为这个excel的这个功能真的很好用,不过在博客也很难讲清楚,还请同学们自行百度一下,“数据透视表”,好用的不能再好用的功能。
书中这部分展示了各种炫酷的图表样式,适合浏览一下,以后用的上可以查阅,这里也做简单罗列:
柱状图、雷达图、条件格式(这个不是图形,是在第4点提到的功能,很强大,可以实现一些炫酷的效果,比如数据条、图标集、迷你图)、平均线图、双坐标图、竖形折线图、矩阵图、气泡图。
总体来看,这本书对我这种只会用excel最最基础功能的小白来说,还是蛮多惊喜的,至少有了一个全局观。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在大数据时代背景下,海量行业数据亟需通过专业化工具挖掘潜在价值,辅助企业业务决策、优化运营模式、规避经营风险。Python凭借 ...
2026-08-28SQL是数据分析领域最基础、最核心的工具,承担着取数、清洗、统计、分层、归因的全流程工作。不同于单纯的语法练习,实战化SQL数 ...
2026-08-28 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-28随着新零售模式的快速普及,零售行业从传统的“货品驱动”全面转向“用户驱动”。门店交易数据、线上消费记录、浏览轨迹、复购频 ...
2026-08-27在数据分析、爬虫采集、接口开发、数据归档等场景中,JSON与CSV是两种使用率最高的数据存储格式。JSON为键值对结构化格式,适配 ...
2026-08-27 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-08-27在数据分析工作中,时间序列是最常见的数据类型之一,订单时间、日志时间、交易时段、统计周期等数据均离不开时间处理。原始数据 ...
2026-08-26在数据分析与数据预处理工作中,原始数据普遍存在录入错误、系统故障、偶然极值等问题,极易产生异常数据。异常数据会严重干扰数 ...
2026-08-26 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-08-26在数理统计与数据分析领域,多因素方差分析与线性回归模型是研究变量关系、因素影响、数据差异规律的两大核心工具。二者均属于经 ...
2026-08-25数据分析的核心价值不在于数据计算与图表制作,而在于清晰、精准、有逻辑地输出结论、支撑业务决策。日常数据分析报告普遍存在结 ...
2026-08-25 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-08-25平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-08-24 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19