京公网安备 11010802034615号
经营许可证编号:京B2-20210330
编译 | Harris来源 | 机房360
如今,大数据越来越重要,因为企业需要处理来自多个来源的不断增长的存储数据。
采用大数据可以称之为一场完美风暴。廉价的存储和大量的结构化和非结构化数据的大量涌入,导致了诸多的大型数据工具得以开发,帮助企业“解锁”他们积累的数据,从客户记录到产品性能的结果等更多的数据。
像传统的商业智能(BI),这些新的大数据工具可以分析过去的趋势,并帮助企业识别重要模式,如特定的销售趋势。许多大数据工具现在提供了一个新一代预测和规范性的见解,以及深埋在企业数据中心的所有数据。
对于人们面临的挑战,调查机构Gartner公司分析师道格·兰尼表示,人们还是不要用扩展的基础设施来处理所有这些数据,而是从各种数据本身进行处理。
“对于真正的挑战,企业对自己和客户的交易数据进行处理、整合,并共同构建和理解输入,加上来自合作伙伴和供应商的数据,还有一些外源性数据,如社会媒体的开放数据和聚合数据等等,而这些只是触及了表面。”兰尼在一封电子邮件中说表示。
大数据是一个大问题:您的网络准备好了吗?
尽管Gartner的客户端通过一个2比1的比例说明各种数据是一个更大的问题,对他们来说数据增长的速度越来越快,而数据处理供应商将会继续提供资金更大、更快的解决方案。
ConstellationResearch公司分析师道格·亨森特表示,大数据解决方案肯定是不断发展变化的。
“在我的书中,2014年是发布SQLHadoop公告的一年,但今年企业和销售商开始认识到大数据的机会不只是扩大传统的BI和数据库。”亨森特说,“因此,ApacheSpark开源框架和其他的分析方案已在2015年超越了SQL。2015年,数百家供应商和大公司开始采用ApacheSpark开源框架,IIBM公司拥抱是倡导其他分析选项最明显的厂商,而其他致力于数据集成和大数据平台的很多企业加入这个行列。”
事实上,大数据浪潮似乎来临,每天都会供应商推出的各种解决方案,其中也包括一些相对全面的设计。尽管很难得到一个全面的名单,这四个工具应该出在用户的应用清单中。
(1)数据科学家的H2O.ai
H2O.ai是初创公司Oxdata在2014年底推出的一个独立开源机器学习平台,主要服务于数据科学家和开发者,为其应用提供快速机器学习引擎。Oxdata公司表示,可以在商用硬件上对任何来源(如Hadoop,SQL)的数据进行处理分析,甚至在上千个网络节点或亚马逊的AWS云运行。个人可以尝试并继续免费使用H2O.ai。Oxdata公司将收取企业用户的费用。
“很多公司使用Spark代替Hadoop短期记忆,这就像大数据的内存一样。”H2O公司市场营销和增长副总裁奥列格·罗格斯科说,“在读取你的短期记忆方面,h20.ai的功能超越了Spark,基本上提供了超快速的分析能力。”
罗格斯科说,H2O.ai是旨在提供预测分析的数据工具的一个新品种。他指出,SQL帮助推动了描述性数据分析的早期阶段或“告诉我发生了什么”,其次是“预测期”的产品,看看发生了什么事,尽量帮助客户预测接下来会发生什么-例如:库存用完或产品突破等。
“我们在未来几年将看到第三个阶段是指令性的阶段发挥作用,这个系统说,‘这是我的教训,我认为未来会发生什么,你应该最大限度地实现目标。’”罗格斯科说,他还指出,谷歌地图的主动建议替代路线的能力就是一个规范性解决方案的例子。
H20.ai将自己定位为各种行业数据科学家使用的一个预测工具和“盒子”。例如,网络巨头思科公司有6万款预测购买决策的模型,该公司使用H2O.ai对这些模型评分。思科公司首席数据科学家表示,“其结果是太棒了,我们看到H2O.ai比我们的同类产品的性能要好3到7倍。在单独建模评分方面,h2o.ai环境是upwards的10到15倍。”
(2)ThoughtSpot3–大数据应用
借助谷歌公司这样的搜索引擎,很容易在网上搜到用户需要的社交数据和网络数据,但企业数据一般难以查找,也更难以利用。为此,7位工程师共同成立了ThoughtSpot公司,目标是开发一个类似于谷歌的搜索引擎,用于查找商业数据。
该公司在谷歌公司成立初期就为其提供硬件设备,在企业启用防火墙后提供超快搜索功能。ThoughtSpot结合了新搜索引擎的应用,它的功能是通过一个快速内存数据库来搜寻海量信息。该公司还计划提供一个基于云的服务。
ThoughtSpot3起始售价为90000美元,是一种为企业快速寻找大数据的数据科学家依赖的工具。“我们已经看到企业使用该产品的数据科学家正在增加。”ThoughtSpot公司营销副总裁史葛霍尔顿说,“二十亿人都在搜索,但在工作中,我们仍然依赖于数据专家。”
霍尔顿在加利福尼亚公司总部PaloAlto进行了一个演示,显示系统使用熟悉的搜索栏界面是如何工作的.刚刚发布的ThoughtSpot3.0具有一些新功能,包括“DataRank”的工作方式,类似于谷歌的PageRank和typeahead。该软件使用机器学习算法建议的关键词为客户搜索,以加快这一进程。
Popcharts无疑是最酷的新功能。当你在搜索框中输入“由东海岸销售......”ThoughtSpot瞬间创建基于查询相关的图表,并利用机器学习给出10多个可以选择的图表。
另一个“即时”功能是AutoJoins,其目的是为一般都有数百个数据源的企业导航。AutoJoins使用ThoughtSpot的数据索引,通过索引模式和机器学习,以了解表格是否相关,并在一秒内呈现研究结果。
霍尔顿说,ThoughtSpot更侧重于对历史数据的传统BI分析(速度超快,使用十分方便),其预测性和规范性分析功能会在未来的软件中体现。
(3)Connotate软件
Connotate公司是一家为美联社、路透社、道琼斯等大型公司对全球上千个网站的非结构化数据进行实时分类和分析的企业。在Web数据抽取和监控上,Connotate软件是世界上最简单、最合算的解决方案,以有效地利用海量数据,从中挖掘出对企业增长有价值的信息,并可以进行高度可扩展性的数据监控和数据收集。
Gartner公司分析师道格·莱尼表示,Connotate和BrightPlanet在他所列的大数据工具名单上,因为它们有助于从企业自身的数据库和互联网上收割和构建丰富多彩的内容。
“随着数字化和经济增长,企业认识到只关注自己的数据不再是万无一失的创新良方,他们越来越多地转向外源数据(即公司外部的数据)。”莱尼说。
Connotate公司表示,其从网页抽取内容的专利技术远远超出了网页抓取或自定义脚本。取而代之的是对于网站工作如何使用机器学习采用一种直观的视觉理解,Connotate公司表示,使其内容提取“准确可靠,并且可扩展。”
据该公司介绍,Connotate平台”可以很容易处理成百上千的网站和百万兆字节。”并提供与业务相关的有针对性的信息。其提供的内容采集平均成本比传统方法少55%。
例举一个使用案例,Connotate帮助销售情报提供者从数千个医院网站提取联系人资料(姓名,职务,电话,电子邮件和隶属关系),并建立一个全国性的医生档案数据库。
Connotate公司表示,其大数据解决方案卖给了几家大型制药公司,并没有花费额外的硬件或IT资源。大数据提取的规模化,甚至可以提供50万名医生的数据。
(4)BrightPlanet工具
BrightPlanet公司也从网络中提取数据,该公司宣称其搜索具有所谓的“深网”见解的能力。其深网可以挖掘那些具有密码保护的网站和通常不会被传统的搜索引擎索引的其他网站的数据。
BrightPlanet公司表示,其收集的数据条目数以百万计,其中包括推特和新闻数据库和医学期刊的数据,并可以根据企业的具体需求和条件进行过滤。
该公司为使用该软件的数据采集工程师提供一个免费的数据即服务(DaaS)咨询,并介绍他们的服务是一个不错的选择。咨询的目的是帮助企业数据中心找到合适的收集数据,并得到正确的格式,这样客户可以得到一个好主意的过程和结果。
最终用户或客户可以选择哪些网站收获的内容。反过来,BrightPlanet公司又将其内容进行充实。例如,像在社交媒体网站评论这样的非结构化数据,通过一个自定义格式设计,使其在更便于使用的客户端提交。
end
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数字化运营中,“凭感觉做决策” 早已成为过去式 —— 运营指标作为业务增长的 “晴雨表” 与 “导航仪”,直接决定了运营动作 ...
2025-10-24在卷积神经网络(CNN)的训练中,“卷积层(Conv)后是否添加归一化(如 BN、LN)和激活函数(如 ReLU、GELU)” 是每个开发者都 ...
2025-10-24在数据决策链条中,“统计分析” 是挖掘数据规律的核心,“可视化” 是呈现规律的桥梁 ——CDA(Certified Data Analyst)数据分 ...
2025-10-24在 “神经网络与卡尔曼滤波融合” 的理论基础上,Python 凭借其丰富的科学计算库(NumPy、FilterPy)、深度学习框架(PyTorch、T ...
2025-10-23在工业控制、自动驾驶、机器人导航、气象预测等领域,“状态估计” 是核心任务 —— 即从含噪声的观测数据中,精准推断系统的真 ...
2025-10-23在数据分析全流程中,“数据清洗” 恰似烹饪前的食材处理:若食材(数据)腐烂变质、混杂异物(脏数据),即便拥有精湛的烹饪技 ...
2025-10-23在人工智能领域,“大模型” 已成为近年来的热点标签:从参数超 1750 亿的 GPT-3,到万亿级参数的 PaLM,再到多模态大模型 GPT-4 ...
2025-10-22在 MySQL 数据库的日常运维与开发中,“更新数据是否会影响读数据” 是一个高频疑问。这个问题的答案并非简单的 “是” 或 “否 ...
2025-10-22在企业数据分析中,“数据孤岛” 是制约分析深度的核心瓶颈 —— 用户数据散落在注册系统、APP 日志、客服记录中,订单数据分散 ...
2025-10-22在神经网络设计中,“隐藏层个数” 是决定模型能力的关键参数 —— 太少会导致 “欠拟合”(模型无法捕捉复杂数据规律,如用单隐 ...
2025-10-21在特征工程流程中,“单变量筛选” 是承上启下的关键步骤 —— 它通过分析单个特征与目标变量的关联强度,剔除无意义、冗余的特 ...
2025-10-21在数据分析全流程中,“数据读取” 常被误解为 “简单的文件打开”—— 双击 Excel、执行基础 SQL 查询即可完成。但对 CDA(Cert ...
2025-10-21在实际业务数据分析中,我们遇到的大多数数据并非理想的正态分布 —— 电商平台的用户消费金额(少数用户单次消费上万元,多数集 ...
2025-10-20在数字化交互中,用户的每一次操作 —— 从电商平台的 “浏览商品→加入购物车→查看评价→放弃下单”,到内容 APP 的 “点击短 ...
2025-10-20在数据分析的全流程中,“数据采集” 是最基础也最关键的环节 —— 如同烹饪前需备好新鲜食材,若采集的数据不完整、不准确或不 ...
2025-10-20在数据成为新时代“石油”的今天,几乎每个职场人都在焦虑: “为什么别人能用数据驱动决策、升职加薪,而我面对Excel表格却无从 ...
2025-10-18数据清洗是 “数据价值挖掘的前置关卡”—— 其核心目标是 “去除噪声、修正错误、规范格式”,但前提是不破坏数据的真实业务含 ...
2025-10-17在数据汇总分析中,透视表凭借灵活的字段重组能力成为核心工具,但原始透视表仅能呈现数值结果,缺乏对数据背景、异常原因或业务 ...
2025-10-17在企业管理中,“凭经验定策略” 的传统模式正逐渐失效 —— 金融机构靠 “研究员主观判断” 选股可能错失收益,电商靠 “运营拍 ...
2025-10-17在数据库日常操作中,INSERT INTO SELECT是实现 “批量数据迁移” 的核心 SQL 语句 —— 它能直接将一个表(或查询结果集)的数 ...
2025-10-16