京公网安备 11010802034615号
经营许可证编号:京B2-20210330
在Springboard,我们的学生经常问我们这样的问题“数据科学家是做什么?”或者“数据科学家每天的工作是什么样子?”这些问题很棘手。答案因角色和公司不同而不同。
因此,我们咨询了Raj Bandyopadhyay, Springboard数据科学教育主管,看看他是否有一个更好的答案。Raj提供了下图中的框架,它既可以帮助你了解数据科学家的日常工作,也可以帮你理解数据科学解决问题的流程,Raj称之为“数据科学工作流程”。
在解决问题之前,首先要做的是把问题界定清楚,去定义它到底是什么。你必须能够将数据问题转化为可操作的东西。
你经常会从持有问题的人那里得到模糊的描述。你必须培养直觉:通过问一些别人不会问的问题,把这些模糊描述转换成可操作的问题。
假设您正在为公司的销售人员解决问题,你应该了解他们的目标是什么以及数据问题背后真正的本质是什么?在你开始考虑问题之前,你必须与他们合作,明确界定问题。正确地提问是这一步骤的关键。你应该弄清楚销售过程是什么样子,谁是客户。你需要尽可能了解背景知识以便将数据转换为洞察力。为此,你应该问类似下面的问题:
(1)谁是顾客?
(2)他们为什么买我们的产品?
(3)我们如何预测,一个客户是否会买我们的产品?
(4)表现好和差客户细分群体之间的区别在哪里?
(5)如果我们不能把产品卖给目标客户,我们的损失有多大?
在回答你的问题时候,销售人员可能会发现他们想知道为什么产品在部分细分客户群体中的销售不及预期。他们的最终目标可能是确定是否继续投资于这些群体,或是降低它们的优先级。这样你进一步细化了问题,针对细化后的问题发掘答案。在这个阶段的最后,你应该有了所有你需要解决问题的背景知识。
一旦定义好了问题,你需要通过数据来寻找解决方案。这一进程中要想清楚需要什么样的数据?通过什么渠道可以获取这些数据?是要内部数据库数据还是需要购买外部数据?
或许你可能会发现,你要数据都存储在公司的客户关系管理CRM系统中,那么就可以将数据用CSV文件的形式导出。
现在,你有了原始数据,但是还需要为后续的分析做数据预处理。通常情况下,数据都是杂乱无章的,特别是没有很好地存储的情况下。很多东西都可以导致后续分析的错误:null值,重复值和缺失值。对数据的精心核查才能保障从数据中得到有价值的见解。
你要检查以下常见错误:
(1)缺失值,例如客户没有初次接触日期
(2)损坏值,如无效输入项
(3)时区差异,也许你的数据库没有考虑到用户处在不同的时区
(4)日期范围错误,也许你会有没有任何意义日期数据,比如销售开始前的注册数据。
你需要对数据文件的行和列进行统计,并对某些值进行测试,看看它们是不是有意义。如果您发现没有意义,你需要删除数据,或者使用默认值替换它。这里,你需要利用你直觉:如果客户没有初次接触日期,是否就真没有初次接触日期?或者你可以询问销售人员,是否是把初次接触日期的数据弄丢了?一旦你完成数据清理工作,你就可以开始准备探索性数据分析。
当你的数据是干净的,你就应该开始使用它!这里的困难在于如何对真正有见解的想法进行测试。你必须为数据科学项目设定最后期限(销售人员可能正等待的分析),所以你必须对问题进行优先级划分。“你必须先看看最有趣的模式:帮助解释为什么某些客户群体的销量减少了。您可能会注意到,他们在社交媒体上不是非常活跃,只有少数人有Twitter或Facebook帐户。您可能还注意到,其中大部分人的年龄偏大,你可以开始跟踪这些模式进行更深入分析。
这一步你要应用统计学、数学和数据科学工具,围绕有趣的模型进行详细分析。
在这种情况下,你可能需要创建预测模型比较业绩不佳组客户与客户平均。你可能会发现,年龄和社交媒体活跃度是影响购买产品的显著因素。
如果你在问题界定阶段就已经了解了很多背景信息,你可能会意识到该公司营销活动集中在社交媒体上与年轻受众进行互动。但是某些客户却喜欢电话的交流,而不是社交媒体。你开始看到该产品的营销方式对销售的影响,也许那部分客户是不应该流失的群体。公司应该从过分依赖社会化媒体营销策略向更加个性化的策略转变。
现在,您可以将所有数据定量分析得到的定性见解,通过讲故事的方式说服相关人员采取行动。
让销售人员理解你们的发现很重要。沟通交流的有效性决定了你的方案是否被采纳。
你应该撰写一个有令人信服的故事,将自己的知识与数据恰当嵌入其中。你可以从解释老年人中销售业绩不佳背后的原因开始;你可以巧妙地将销售人员给你信息和数据中发现见解结合起来;然后你转到解决问题的具体办法:可以将部分资源从社会化媒体转移到私人电话推销中。
了解以上步骤,对于系统思考数据科学有极大的帮助。
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在大数据技术飞速迭代、数字营销竞争日趋激烈的今天,“精准触达、高效转化、成本可控”已成为企业营销的核心诉求。传统广告投放 ...
2026-04-24在游戏行业竞争白热化的当下,用户流失已成为制约游戏生命周期、影响营收增长的核心痛点。据行业报告显示,2024年移动游戏平均次 ...
2026-04-24 很多业务负责人开会常说“我们要数据驱动”,最后却变成“看哪张报表数据多就用哪个”,往往因为缺乏一套结构性的方法去搭建 ...
2026-04-24在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16