技能 | R 家族又添新丁，5个数据科学专用包-CDA数据分析师官网

热线电话：13121318867

技能 | R 家族又添新丁，5个数据科学专用包

2015-09-02

李垠序编译

来自雪晴数据网

R生态体系有其非常之美，在于它的新包贡献系统，而这也可能是R使用者显著增加的根本原因。这一特点与坚如磐石的基础包版本库（CRAN）结合，给了R一个非常优越的条件。任何有足够专业技术的人，通过合适的方法都可以为CRAN贡献包。

仅仅关注CRAN可能无法发现其优秀的地方：事实上，对R的初学者而言，开源会让他们遇到很多麻烦。怎样通过一个有机的包系统来构造高质量的集成软件？学习这些需要花费许多时间和精力。不过即使是相对新手的人来说，发现那些支撑R语言发展的基础包并不难。那些可靠地为R语言增加价值的包已经出现在CRAN’s package dependency network。发现一个新包，并且最终有用是另一件重要的事情。出于探索精神，这里有5个可靠的新包，我认为数据科学家会对其感兴趣。在CRAN上，这些包都没有经过长时间的检验，因此请以合作的心态去探索他们吧。

AzureML V0.1.1

云计算对每个实践数据科学家都很重要（或者即将变得很重要）。微软的AzureML为R（和Python）程序员提供了一个非常丰富的机器学习环境。如果你还不是一个Azure的使用者，这个包花了大工夫来克服上手这一环境的困难。它提供了函数来将R代码从你的本地环境推送到Azure云端，并将函数和模型发布为web服务.图文教程会一步一步地教你，从获得试用账号和必要的证书到发布你的第一个简单的实例。

distcomp V0.25.1

对大数据集的分布式计算是非常棘手的，尤其是在不能或很难共享集群间数据的环境当中。Distcomp聪明地包执行了一个局部似然算法（详见：paper by Narasimham et al）使得在非聚合的数据集上建立一个复杂的统计模型成为可能。更多详细的信息可以参考早期博文。

rotationForest V0.1

介于其在多种数据集上稳定良好的表现，森林算法对许多数据科学家来说是一个必选的组合方法。它的一个新变种，基于特征空间随机子集的主成分分析有着非常好的应用前景。paper by Rodriguez et. al解释了PCA对特征空间旋转的意义，并将旋转森林算法与标准随机森林、Adaboost算法进行了比较。