京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据分析我做主 程序设计工具成科学家得力帮手
多年来,遗传学家Helene Royo使用商业软件分析自己的研究数据。她将DNA从发育中的小鼠精子里提取出来,送去分析,然后利用名为GeneSpring的软件研究结论。“作为一个科学家,我希望能理解自己做的任何东西。”她说,“但这类分析不允许这样:我只是按个按钮,并得到答案。”但随着Royo比较不同染色体基因活性的研究日益复杂,她意识到商业工具已无法满足她的数据处理需求。
之后,Royo有了一个选择:将基因序列发给专家或自己学着分析数据。她决定冒险一试,并开始学习如何用免费的开源软件包R解析数据。它帮助Royo所在的瑞士巴塞尔弗雷德里希米歇尔研究所生物医学研究中心在软件上运行了常规课程。但她还沿行着一个更宽广的趋势:对于那些尝试放弃使用商业软件的学者而言,R是可供选择的数据分析工具。
除了免费外,R受欢迎的部分原因是它对不同使用者呈现不同面貌。首先,它是一种编程语言,要求经由命令行输入,这似乎禁止非编码者使用。但初学者能够调用预先设置的软件包,其中包含了已经做好的统计分析和数据可视化命令。“R非常简单,它能为我做任何事。”Royo说。
而这也是R的开发者在上世纪90年代研发该软件包的初衷。新西兰奥克兰大学统计学家Ross Ihaka和Robert Gentleman对计算机十分感兴趣,但是缺乏需要的实际软件。因此,他们开发了一种能执行自己需要的数据分析的编程语言。R正是取自开发者名字的首字母。
在互联网兴起之初,R迅速吸引了全世界需要统计软件和乐于贡献点子的科学家的兴趣。Gentleman和Ihaka决定公开他们的源代码,而编码专家迅速开发出针对特定领域的预编程程序和命令。“我能写出天文学领域的人适合使用的软件。但如果是天文学者为同领域的其他人写软件会更好。”Gentleman说。
荷兰皇家海洋研究所海洋学家Karline Soetaert也同意该观点。2008年,她计划检查斯凯尔特河河口附近浮游生物的健康情况。Soetaert想要使用沿河收集的数据计算浮游动物的死亡速度,但R无法做到。为了解决该问题,她与两位生态学家开发了deSolve——写入R的首个程序包,以解决微分方程。她提到:“其他软件也能计算,但却昂贵且是闭源的。”现在,流行病学家也使用deSolve模拟传染性疾病,基因学家用它研究基因调控网络,药物开发者则将其用于药物代谢动力学。
到2003年,R首次发布10年之后,科学家已经开发出超过200个程序包,而且有关“R项目”的首个引用出现。现在,已经出现了针对各种专业的近6000个数据包。它们帮助科学家比较人类和尼安德特人基因组、建模人口增长、预言股票价格等。专家能使用R绘制手稿,他们可以嵌入源代码,通过knitr编译直接生成一份报告。2013年,在爱思唯尔的斯高帕斯数据库索引的科学文章里,有近1%援引了R或其中一个数据包,而在农业和环境科学领域,这个比例更高。
对于许多使用者而言,R作为统计学软件的质量十分引人注目。美国田纳西州大学统计学家Robert Muenchen表示,该工具与SPSS和SAS等商业数据包一样。在过去10年中,R已经赶上并超过了市场领导者。“大概在2014年夏天,R已经变成了使用量首屈一指的统计学程序包。”他说。
在基因组学和分子生物学领域,一个名为Bioconductor的软件项目紧随R之后。它能帮科学家处理和比较庞大的基因序列,利用基因表达综合数据库等数据库查询结果以及上传数据到数据库。它包含近1000个程序包,其中一些能帮助将新一代测序实验得出的数百万DNA片段与有注解的基因相连。
随着对R的钻研,Royo接受了密集训练:在弗雷德里希米歇尔研究所生物信息学部负责人Michael Stadler的监督下,她花费了约半年时间研究R和Bioconductor。伯克利数据科学研究所生态学家Karthik Ram表示,现在有足够的机会去学习R。Ram主动帮助科学家学习和开发R。他和同事免费提供培训课程,不需要任何现有编程技巧,并能针对科学家的特殊问题。
加州圣地亚哥州立大学生态学家Megan Jennings接受了相关培训。她追踪山猫、美洲狮和其他野生动物,以理解它们的行为。最终,36台相机在1年时间里拍摄了40多万张时间标记照片。最初,她手动选择出想要的照片,并将它们输入一个名为PRESENCE的黑匣子程序。但在Ram的帮助下,她写出了一个能够读出标记照片的R程序包,并对照片进行精简,然后将自定义数据子合集发送到R预先存在的模型程序包中。“之前我要动手挑拣1个小时的照片,而现在只需要做5分钟。”Jennings说。
另外,R的一个最伟大之处就是它的在线服务。Muenchen表示,有关R的讨论区远超针对其他商业统计软件的在线提问。“这种情况十分常见,一个人发布了一个问题,然后其他人在半小时内开发出程序包来回答。”他说。这样的快速反应对基础研究领域的科学家非常重要。“我几乎能在线找到任何问题的答案。” Royo说。
但与其他技能一样,学习R并非一夕之功。但Jennings表示,它值得学习。“将它作为一种投入:为了之后的节省时间和构建解决多种问题的技巧。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21在实际业务数据分析中,单一数据表往往无法满足需求——用户信息存储在用户表、消费记录在订单表、商品详情在商品表,想要挖掘“ ...
2026-01-21在数字化转型浪潮中,企业数据已从“辅助资源”升级为“核心资产”,而高效的数据管理则是释放数据价值的前提。企业数据管理方法 ...
2026-01-21在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19数据清洗是数据分析的“前置必修课”,其核心目标是剔除无效信息、修正错误数据,让原始数据具备准确性、一致性与可用性。在实际 ...
2026-01-19在CDA(Certified Data Analyst)数据分析师的日常工作中,常面临“无标签高维数据难以归类、群体规律模糊”的痛点——比如海量 ...
2026-01-19在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14