京公网安备 11010802034615号
经营许可证编号:京B2-20210330
这10家创业公司将大数据分析推向全新高度
有结构、无结构数据的崛起创造了一个蓬勃发展的市场,其价值预计将在 2018 年达到415亿美元左右。大数据市场的快速增长造就了大量的供应商的出现,他们都希望能从中获利。在众多竞争市场地位的供应商中,有许多旨在帮助组织收集和分析数据的创业公司。CBR(计算机商业评论) 从中选出了10个值得被关注的公司。
1. Confluent
Confluent 公司成立于 2014,已经获得超过 3000 万美元的投资,这些投资来自于 LinkedIn、Index Ventures、Benchmark Capital 和 The Data Collective 等投资者。
该公司由 Apache Kafka 的开发者们创立(Apache Kafka是一个实时通讯和大数据流引擎)。其最初创立于 LinkedIn 内部,而后归入 Apache 软件基金会旗下,最后分离出来作为一个独立的公司。Confluent 本质上是 Apache Kafka 软件的商业提供者和技术支持者。当还在 LinkedIn 的时候,Confluent 已经开始帮助 LinkedIn 全面检测公司里发生的一切,作为一个实时的 Kafka feed,为 Hadoop、Search、Newsfeed 等数据系统填入数据。
Confluent 专注于构建一个数据流平台,从而帮助企业获得实时的企业数据。Confluent 提供的编程语言包括 Java、C 语言和C++,通过其 REST 服务器,可以使用任何网络连接工具来生成信息、实现通讯。
2. H2O.ai
H2O.ai (曾用名 0xdata)公司成立于 2011,已经获得了 3360 万美元的投资,这些投资来自于 Nexus Venture Partners、Paxion Capital Partners 和 Transamerica Ventures 等投资者。
该公司由 Platfora 和 Cliff Click 的联合创始人 SriSatish Ambati 创立,他还是 Java 虚拟机的领头开发者。公司创立之初的想法是,让开发人员和数据学家更简单轻松地应用机器学习算法。
该公司提供一个开源的机器学习平台,其设计是为了在使用 Web UI 或者不同的编程环境(如 R、java、python、Scala 、JSON)的同时,也能使用 Hadoop 和 Spark。该平台支持的数据库和文件类型包括微软 Excel、R Studio、和Tableau。H2O可以帮助开发模型培养机器学习能力,从而可以对数据进行解析、获取和模拟。
最基础的是,该技术有助于快速创建和应用机器学习算法。
3. AtScale
Atscale 成立于 2013,至今已募集了900万美元的投资,这些投资来自于 AME Cloud Ventures、Storm Ventures 和 UMC Capital 等投资者。该公司的想法是使用熟悉的商业智能(BI)工具和界面(如 SQL、Tableau)和 Hadoop这样的技术解决问题,也就是,它们在商业用户、可视化工具和基础 Hadoop 平台间建立桥梁。
其目标是帮助企业对现有数据进行数据分析,而且不需要将数据移入专门的分析工具,因为移入专门的分析工具有时间和金钱成本。
Atscale 由 Hadoop 和 BI 的前员工创立,他们具备把 Hadoop 集群转变成规模化 OLAP 服务器的能力。另外,Atscale 支持 BI 工具,可以和 SQL 或 MDX 进行信息交流。
4. Interana
把提供事件数据的行为分析作为自己招牌的 Interana 公司帮助企业做数据主导的决策。该公司成立于 2013 年,由首席执行官 Ann Johnson 和首席技术官 Bobby Johnson 联合创办,目前完成了 2820 万美元的融资,其中在由 Index Ventures 领投的 B 轮融资中获得了 2000 万美元。
Interana 专注于提供互动分析,帮助企业了解他们客户的行为和产品使用情况。该公司使用一个专有的数据库,能让它快速处理数十亿的事件。例如像 Tinder 这样的公司用它来进行网络连接故障检修,测量社交媒体的有效性,以及监测用户的刷机方式。Tinder 在全公司广泛使用 Interana,从而改善自己的服务和操作。
5. Tamr
Tamr 结合了机器学习软件和数据科学。该公司由 Andy Palmer、Mike Stonebrake 等人共同创立,他们都是数据研发的老兵。
Tamr 使用一个可扩展的数据统一平台,通过机器学习和人工输入的方式,帮助客户使用被孤立在不同的数据库、电子表格、记录数据、和合作伙伴资源里的数据。
Tamr 一种获得 4240 万美元融资,其中在最近的 B 轮融资中得到 2520 万美元。主要投资者包括 Hewlett-Packard Ventures、Thomson Reuters 和 MassMutual Ventures。简单来说,Tamr 是一个数据清理的创业公司,旨在清理来自不同资源的数据,从而让数据更容易被使用。
6. Wavefront
Wavefront 成立于 2013 年,总部设在加利福尼亚的帕洛奥图,至今已获得 2050 万美元投资,这些投资来自于 Sequoia Capital、Sutter Hill Ventures 和 Webb Investment Network 等投资者。
该公司提供一个实时的分析平台,可以把一个 IT 公司所有系统中的数据抽离出来,通过识别和诊断以预防崩溃。Wavefront 使用了一种查询语言,从而可以对时间序列数据进行处理,它也允许用户通过下拉菜单、过滤器和自动生成表格来手工查询。该技术最初是在 Google 和 Twitter 内部开发,现在正在被 Box、First Data 和 Workday 等公司使用。
7. BlueTalon
BlueTalon 是另一家成立于 2013、总部在加利福尼亚的公司,只不过它位于 Redwood。该公司至今已筹集了 1140 万美元的投资,这些投资来自于 Data Collective、Signia、Venture Partners 和 Bloomberg Data 等投资者。
BlueTalon 为大数据提供数据中心安全保障,例如 Hadoop、SQL,它主要是对 Hadoop 分布式文件系统使用访问控制和动态掩蔽实现这一点的。
除了在 Hadoop 上有效,它也能在微软 Azure 和亚马逊网络服务上工作。据 BlueTalon 所言,它允许用户自定义数据配置设定,这意味着企业用户和开发人员可以只访问他们所需要的数据。该公司还提供审核服务,让用户知道什么人在什么时候,因为什么原因访问了什么数据。
8. Cazena
Cazena 虽然只是成立于 2014,但已经从诸如 North Bridge Venture Partners、Growth Equity、Andreessen Horowitz 和 Formation 8 等投资那里筹集了 2800 万美元。在 2015 七月重新回归之后,Cazena 带来了一项叫做 Big Data-as-a-Service 的大数据服务。据该公司表示,将大数据处理转移到云端的过程只需要轻轻点击三次。
该公司专注于通过 Data-As-A-Service 大数据服务实现在加密的云端进行大数据处理。它的产品分为 Data Lake、Data Mart 和 Sandbox 三个版本。
为了智能工作,该公司供应和优化了云端基础设施,其中也包含 Hadoop、Spark、MPP SQL、Search 这样的数据技术。
另外,Cazena 提供端到端的数据加密技术,企业掌控着静态和动态秘钥。
9. DataTorrent
DataTorrent 成立于 2012 年,是这 10 家公司中的老创业公司之一。到目前为止它已募集到 2380 万美元,其中包括由 Singtel Innov8 领投的1500 万美元的 B 轮融资 。
该公司专注于实时大数据分析技术,其技术基础是一个开源的数据流和处理引擎,该公司表示此引擎在 Hadoop 集群中,每秒可以处理数十亿的事件。
DataTorrent 支持摄入的数据来源有 Kafka、AWS S3n、HDFS、NFS、JMS等等。
DataTorrent RTS Core 是一个开源的企业级统一的数据流和批量处理引擎。它提供了一整套系统服务,可以帮助开发人员专注于 Business Logic。该公司还提供一个完整的 Hadoop 集成应用的管理控制台,为熄灯管理提供图形界面。
10. Databricks
Apache Spark 这项技术如今已经在数据分析界非常流行。而这家公司正是由 Apache Spark 的开发者们在加州大学伯克利分校的 AMPLab 实验室创立。Databricks 是 Spark 的商业服务和支持提供商。
这几位开发者想要借助 Spark 在整个社区和众多厂商(IBM)那里的影响成立 Databricks 。 Databricks 本身也为交互分析、可视化、管理数据,以及协作与集成提供工具。
在 2013 年成立后,它开始用 Spark 帮助客户进行基于云端的大数据处理。Databricks 已经在两轮融资里筹集到 4700 万美元,其中 2014 年 6 月 B 轮融资获得 3300 万美元。
该公司与 Spark 的发展紧密联系在一起,而在最近也公布了三个特征变化。其中一个是开始执行 Tungsten 项目的下一阶段从而加速 Spark,他们是通过解决 Java 的记忆处理限制、改善实时数据流系统、将其使用的多种数据结构 API 整合为一个 API 实现加速目的的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据处理的全流程中,数据呈现与数据分析是两个紧密关联却截然不同的核心环节。无论是科研数据整理、企业业务复盘,还是日常数 ...
2026-03-06在数据分析、数据预处理场景中,dat文件是一种常见的二进制或文本格式数据文件,广泛应用于科研数据、工程数据、传感器数据等领 ...
2026-03-06在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越单纯的数据清洗与统计分析,而是通过数据 ...
2026-03-06在教学管理、培训数据统计、课程体系搭建等场景中,经常需要对课时数据进行排序并实现累加计算——比如,按课程章节排序,累加各 ...
2026-03-05在数据分析场景中,环比是衡量数据短期波动的核心指标——它通过对比“当前周期与上一个相邻周期”的数据,直观反映指标的月度、 ...
2026-03-05数据治理是数字化时代企业实现数据价值最大化的核心前提,而CDA(Certified Data Analyst)数据分析师作为数据全生命周期的核心 ...
2026-03-05在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27