京公网安备 11010802034615号
经营许可证编号:京B2-20210330
如何才能将大数据真正应用起来
在这个信息爆炸的时代,每天都有大量各种各样的信息数据产生,怎么发掘这些海量数据的价值成为所有人关注的重点。因此,上至政府部门,下至平头百姓,各行各业对大数据的讨论越来越激烈,大家都在探寻大数据的奥妙和价值。
大数据说起来比较玄乎,实际上已经慢慢地渗透到我们生活的方方面面。以现在越来越普及的网络购物为例,我们在某购物网站中搜索了某些商品,再次登录该网站,甚至是其他的网站,往往就会看到系统自动推荐的与上次搜索相关的商品信息。这就是购物网站应用大数据分析,摸清了用户的消费习惯,精准推送用户可能感兴趣的产品,以更有效地促进用户消费。这是个人购物行为,再更进一步,每年各大购物网站都会发布一些购物指南,得出了一些非常有趣的结论,比如哪个地区男士为女士购买的商品最多;哪个年龄段的网络消费能力更强;同类产品,哪个品牌在某个区域的销量更好等等,这些都是通过大数据分析得到。目前,政府、医疗、互联网等等行业都已经开始了大数据应用。
大数据与安防
虽然大数据在不少行业都已经开始得到应用,并取得了非常不错的效果,但是就安防行业来说,大数据应用之路才刚刚开启。在安防领域,主要的数据来源是视频,与其他行业结构化的数据不一样,视频是一种非结构化的数据,不能直接被计算机进行处理或分析。因此,安防要进行大数据应用,首先就要采用智能分析技术将非结构化的视频数据转换成计算机能够识别和处理的结构化信息,即将视频中包含的各种信息(主要是运动目标及其特征)提取出来转成文字描述,这样才能通过计算机来对这些视频进行搜索、比对、分析等。但是,早期安防行业并没有有效的技术手段来展开这项工作。
智能分析技术其实很早就已经应用于安防行业,只不过受限于智能分析算法本身以及摄像机的硬件性能,早期主要是通过智能分析服务器来实现视频图像的智能识别和分析,但这种方式存在一个致命的缺陷——成本过高。一台刀片式服务器价格在六七万左右,而一台服务器只能识别七、八路1080P高清监控录像。以一个中等规模的城市为例,整体建设可能有十来万个监控点,即使只做2000路智能分析,也要两百多台服务器,这个成本是相当可观的。除了服务器的设备成本之外,还有服务器的能耗、所占场地、数据中心的网络设备、后期维护等成本,这些成本不比购买服务器的成本低。正是服务器这种智能分析模式因为成本过高无法规模化应用,所以视频信息无法大规模转换成结构化的数据,安防大数据也就一直无法落到实地。
随着智能分析算法的逐步成熟,以及摄像机硬件性能的不断提升,越来越多企业开始考虑将更多智能识别算法前置到摄像机中,毕竟摄像机本身的成本增加是可以预见的。在安防业内,以科达为代表的感知型摄像机这类智能摄像机的推出,比较经济有效地解决了视频数据结构化的问题,为安防大数据应用打下了基础。
除了视频数据的非结构化外,与其他行业相比,安防行业的大数据还有一些典型特征,这些特征对存储系统提出了更高的要求。比如视频的数据量特别大,且还在不断增多,就要求存储系统能够很方便地扩容;视频的价值密度低,且是实时的,连续的,稍纵即逝的,不容丢失,就要求存储的可靠性要高;一个PB级的存储系统硬盘就有几千甚至几万块,这么多硬盘可能每天都会有损坏,如果一损坏就要更换会非常麻烦,这就对存储提出了可维护性的要求;既然是大数据视频,说明会有各种各样的用户会去访问这些视频数据,所以对并发访问会有更高要求等等。要满足上述要求,传统的存储方式已经无能为力,只有云存储才能支撑。
一段视频经过智能摄像机的分析提取以后,形成了原始视频、视频里面每个运动目标的图片以及每个运动目标的语义文字描述三类数据,其中图片和视频是非结构化数据,一般存于云存储系统中,而语义的文字描述这类结构化数据存在于后端的大数据数据库中,每一条文字的描述对应相应的目标图片和视频。在完成了视频的结构化处理,以及三类数据的存储之后,应用就是接下来的关键,否则存储的数据也没有价值。
尽管在不同的垂直行业,安防大数据的应用会有一定差异,但从目前应用最为成熟的公安、交通等行业来看,大数据应用大致可以归结为检索、分析研判、实时布控和调度三大类。
第一类检索,在实现视频结构化之前,查找、检索视频只能靠人,而将视频结构化之后,利用后端的大数据检索系统,就能很方便地搜出相对应的文字、图片以及视频。比如要查找某一时间段经过某个路段一个穿蓝色衣服的可疑人员,用户只需要输入“蓝色衣服”,就能找出该时间段内所有穿蓝色衣服的人的图片,点击图片就可以获取这个人经过这个路段的视频。
第二类分析研判,比如通过车辆的多点碰撞,看是否有哪辆车在几个路口都出现过,从而帮助公安发现嫌疑车辆。
第三类是实时布控和调度,比如,公安知道一个嫌疑人住在某个小区,并且嫌疑人照片已经存在于系统后台,就可以通过安装在门口的感知型摄像机抓拍每个进出小区人员的人脸特征,并立刻送到后台去比对,一旦发现某个人员的外貌特征与目标嫌疑人比较相似,系统就会马上报警,公安人员即可指挥调度实施现场抓捕。当然,要结合行业需求实现这三大类应用,需要企业深入研究行业用户的需求,对行业需求的精准把握是大数据应用的关键。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在分类变量关联分析中(如 “吸烟与肺癌的关系”“性别与疾病发病率的关联”),卡方检验 P 值与 OR 值(比值比,Odds Ratio)是 ...
2025-11-05CDA 数据分析师的核心价值,不在于复杂的模型公式,而在于将数据转化为可落地的商业行动。脱离业务场景的分析只是 “纸上谈兵” ...
2025-11-05教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-05教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-04【2025最新版】CDA考试教材:CDA教材一级:商业数据分析(2025)__商业数据分析_cda教材_考试教材 (cdaglobal.com) ...
2025-11-04在数字化时代,数据挖掘不再是实验室里的技术探索,而是驱动商业决策的核心能力 —— 它能从海量数据中挖掘出 “降低成本、提升 ...
2025-11-04在 DDPM(Denoising Diffusion Probabilistic Models)训练过程中,开发者最常困惑的问题莫过于:“我的模型 loss 降到多少才算 ...
2025-11-04在 CDA(Certified Data Analyst)数据分析师的工作中,“无监督样本分组” 是高频需求 —— 例如 “将用户按行为特征分为高价值 ...
2025-11-04当沃尔玛数据分析师首次发现 “啤酒与尿布” 的高频共现规律时,他们揭开了数据挖掘最迷人的面纱 —— 那些隐藏在消费行为背后 ...
2025-11-03这个问题精准切中了配对样本统计检验的核心差异点,理解二者区别是避免统计方法误用的关键。核心结论是:stats.ttest_rel(配对 ...
2025-11-03在 CDA(Certified Data Analyst)数据分析师的工作中,“高维数据的潜在规律挖掘” 是进阶需求 —— 例如用户行为包含 “浏览次 ...
2025-11-03在 MySQL 数据查询中,“按顺序计数” 是高频需求 —— 例如 “统计近 7 天每日订单量”“按用户 ID 顺序展示消费记录”“按产品 ...
2025-10-31在数据分析中,“累计百分比” 是衡量 “部分与整体关系” 的核心指标 —— 它通过 “逐步累加的占比”,直观呈现数据的分布特征 ...
2025-10-31在 CDA(Certified Data Analyst)数据分析师的工作中,“二分类预测” 是高频需求 —— 例如 “预测用户是否会流失”“判断客户 ...
2025-10-31在 MySQL 实际应用中,“频繁写入同一表” 是常见场景 —— 如实时日志存储(用户操作日志、系统运行日志)、高频交易记录(支付 ...
2025-10-30为帮助教育工作者、研究者科学分析 “班级规模” 与 “平均成绩” 的关联关系,我将从相关系数的核心定义与类型切入,详解 “数 ...
2025-10-30对 CDA(Certified Data Analyst)数据分析师而言,“相关系数” 不是简单的数字计算,而是 “从业务问题出发,量化变量间关联强 ...
2025-10-30在构建前向神经网络(Feedforward Neural Network,简称 FNN)时,“隐藏层数目设多少?每个隐藏层该放多少个神经元?” 是每个 ...
2025-10-29这个问题切中了 Excel 用户的常见困惑 —— 将 “数据可视化工具” 与 “数据挖掘算法” 的功能边界混淆。核心结论是:Excel 透 ...
2025-10-29在 CDA(Certified Data Analyst)数据分析师的工作中,“多组数据差异验证” 是高频需求 —— 例如 “3 家门店的销售额是否有显 ...
2025-10-29