京公网安备 11010802034615号
经营许可证编号:京B2-20210330
汽车大数据应用的6个前提
最近博鳌的论坛上,各路大神在神侃人工智能是否会消灭人类的伦理问题,最讨厌一帮文科二货在台上扯淡人类技术末日,因为无论这个伦理问题多么严重,最终解决问题还得靠理工男女的技术头脑。制造AI的恐慌是没有意义的,了解AI是什么比想象它的恐怖有趣得多。
在当前这帮文科二货们的蛊惑下,大数据和人工智能越来越热,汽车这个垂直应用领域更是热得一塌糊涂。从大数据技术的基本应用场景看,汽车和车险的销售广告显然是典型的应用场景,近年来,汽车金融的应用场景也渐渐丰富起来,至于自动驾驶,那已经是资本宠儿。我认为汽车大数据最可能率先发挥价值的一是汽车和车险广告,二是金融和车险的风险控制,三是自动驾驶,其他领域的应用即使有,也商业价值有限。
但目前来看,绝大多数自称汽车大数据的公司本质上都是卖数据的公司,我们耳熟能详的那些大数据公司,干的基本上就是倒卖官方还没有合法公开的个人数据,未经用户同意倒卖用户隐私数据的勾当。倒卖数据是当前到处吹牛的汽车大数据公司典型业务。真正运用算法和模型解决行业问题的公司都还在埋头苦干,都在积累应用案例,短期恐怕难以盈利。对投资人和创业者而言,我认为看清楚汽车大数据的应用方向非常重要。
要应用汽车大数据,首先得解决数据处理的问题。从汽车数据处理技术的角度看,大约有6个层次。我认为这是实现汽车大数据应用的6个前提。
一是数据接口化,这个层次的问题不解决,大数据技术根本就没有用武之地。搞不定接口,只是拿个移动硬盘拷死数据的,就别凑大数据的热闹了。比如汽车违章数据对于用户个人征信有价值,弄个爬虫去偷数据的就别琢磨大数据应用了,数据源都不稳定,相当于工厂的原材料都不稳定,你还怎么搞生产,怎么考虑产品质量呢?
二是结构化,数据采集的接口问题解决了,需要解决数据存储问题。传统的数据库采用SQL存储结构化数据,但如果要用大数据技术,图片、甚至视频等非结构化数据也需要存储,虽然有NoSQL产品解决这类数据寸纯问题,但最终应用仍然需要把非结构化数据结构化。
三是标准化,结构化存储的数据来源广泛,比如同样是车辆的保单数据,不同保险公司的保单数据标准不同,在应用前必须把不同保险公司的保单数据标准化。同样,汽车违章查询的数据、汽车贷款的数据,都需要按照统一的标准进行规范,这样可以用一把尺子度量不同来源的汽车数据。通常,绝大多数吹牛自己是大数据公司的,基本工作就是做到了这一步,也就是把来自各种途径的数据进行了标准化,能够用Excel表格输出数据,可以卖了!
四是因子化,完成了标准化,这时的数据库才能采用大数据技术进行有目的的挖掘。要开展数据挖掘,首先第一步得解决标准化数据的因子化。比如车主性别,有男,有女,有不确定。计算机因子化处理这个问题的时候就会把男定义为1,女定义为0,不确定性别定义为2。性别的因子化相对简单,再比如违章数据,究竟违章多少次,何种违章才应该被判定为高风险呢?要因子化处理,我们就得定义规则,比如非扣分的违章0-3次风险因子是1,4-6次风险因子是2,7次以上风险因子是3……诸如此类的数据因子化处理,才能进入数据建模。
五是模型化,很多吹牛搞汽车大数据的,动辄就吹牛要搞数据模型,其实绝大多数人连前面四个数据处理过程都干不了。极少数搞定前四个步骤的公司会雇佣数据建模师,围绕特定的问题,建立数据模型。这个过程一定程度上并不是科学,更多的像是艺术工作。因为不存在绝对的解,建模师的工作就是要用想象力,尽可能建立一个能够模拟现实世界运行的数据模型。先有一个假设,然后用现实世界的数据去测试这个假设,如果错了,反馈参数去修订这个模型,再用真实数据测试,直到结果能够很好的模拟真实世界……这个过程就是机器学习的数据训练。由于每个行业、每个行业的细分领域、每个细分领域的不同公司都在经营不同的生意,同样是车险保单,不同保险公司的用户偏好是不同的,同一个模型是不可能适应所有保险公司,每一家保险公司如果要应用大数据和人工智能技术,都必须个性化训练,一旦某一家率先建立自己的机器人,其在行业里的效率提升将大幅领先于没有人工智能机器人的公司——对汽车保险、金融、二手车、后市场等领域来说,谁先用人工智能武装自己,谁将与竞争对手真正拉开差距。
六是产品化,有了模型并不是万事大吉,模型必须应用于某个生产场景才能创造价值。比如在汽车广告领域,区分潜在用户销售线索优劣的模型就非常有用。目前每年车企投放大量广告获得几十倍上百倍实际销售量的销售线索,目前不加区分进行电话轰炸的方式效率非常低,成本也非常高。建立销售线索鱼成交结果的数据模型之后,必须为车企提供一个应用生产环境,帮助4S店销售人员准确把握每一个销售线索的价值,把有限的时间和资源,放在最可能成交的那些潜在用户身上。也就是说,必须把模型封装在一个Saas系统里,大数据技术才能真正落地应用。
我知道这篇文章对大多数人而言过于专业,但真要应用大数据、机器学习和人工智能解决汽车行业的问题,这篇只能算是扫盲。写出这些扫盲文章的目的无他,我只是想治愈那些AI恐惧症患者。美国人可能有必要担心这些问题,因为在发达国家,数据的接口化和标准化工作已经在几十年前完成,而我们中国远远没有恐惧AI的必要,各种数据连接口化的工作都无法完成,你想训练一个AI出来,谈何容易——各位吹大数据牛的公司,卖数据的生意前景不错,6月1日网络安全法出台前可以继续得瑟,之后就自求多福吧!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27在数字化时代,企业积累的海量数据如同散落的珍珠,若缺乏有效的梳理与分类,终将难以发挥实际价值。CDA(Certified Data Analys ...
2026-02-27在问卷调研中,我们常遇到这样的场景:针对同一批调查对象,在不同时间点(如干预前、干预后、随访期)发放相同或相似的问卷,收 ...
2026-02-26在销售管理的实操场景中,“销售机会”是核心抓手—— 从潜在客户接触到最终成交,每一个环节都藏着业绩增长的关键,也暗藏着客 ...
2026-02-26在CDA数据分析师的日常工作中,数据提取、整理、加工是所有分析工作的起点,而“创建表”与“创建视图”,则是数据库操作中最基 ...
2026-02-26在机器学习分析、数据决策的全流程中,“数据质量决定分析价值”早已成为行业共识—— 正如我们此前在运用机器学习进行分析时强 ...
2026-02-25在数字化时代,数据已成为企业决策、行业升级的核心资产,但海量杂乱的原始数据本身不具备价值—— 只有通过科学的分析方法,挖 ...
2026-02-25在数字化时代,数据已成为企业核心资产,而“数据存储有序化、数据分析专业化、数据价值可落地”,则是企业实现数据驱动的三大核 ...
2026-02-25在数据分析、机器学习的实操场景中,聚类分析与主成分分析(PCA)是两种高频使用的统计与数据处理方法。二者常被用于数据预处理 ...
2026-02-24在聚类分析的实操场景中,K-Means算法因其简单高效、易落地的特点,成为处理无监督分类问题的首选工具——无论是用户画像分层、 ...
2026-02-24数字化浪潮下,数据已成为企业核心竞争力,“用数据说话、用数据决策”成为企业发展的核心逻辑。CDA(Certified Data Analyst) ...
2026-02-24CDA一级知识点汇总手册 第五章 业务数据的特征、处理与透视分析考点52:业务数据分析基础考点53:输入和资源需求考点54:业务数 ...
2026-02-23CDA一级知识点汇总手册 第四章 战略与业务数据分析考点43:战略数据分析基础考点44:表格结构数据的使用考点45:输入数据和资源 ...
2026-02-22CDA一级知识点汇总手册 第三章 商业数据分析框架考点27:商业数据分析体系的核心逻辑——BSC五视角框架考点28:战略视角考点29: ...
2026-02-20CDA一级知识点汇总手册 第二章 数据分析方法考点7:基础范式的核心逻辑(本体论与流程化)考点8:分类分析(本体论核心应用)考 ...
2026-02-18第一章:数据分析思维考点1:UVCA时代的特点考点2:数据分析背后的逻辑思维方法论考点3:流程化企业的数据分析需求考点4:企业数 ...
2026-02-16