京公网安备 11010802034615号
经营许可证编号:京B2-20210330
阿里数据科技研究院:算法是大数据的核心
这两天,阿里巴巴投入1500万元新启动了一个代号为“天池”的数据竞赛,选手们比拼如何利用现有大数据进行淘宝女装搭配的算法推荐、余额宝资金的流入流出预测等。其背后的推动者是被外界称为阿里巴巴最神秘部门IDST的负责人涂子沛,著有《大数据》和《数据之巅》。
3月25日,笔者在阿里巴巴西溪园区的会议室里对涂子沛进行了独家专访。军人出身的他,身上带有一股特殊的英气,这在IT圈里并不多见。
涂子沛去年年底从美国硅谷空降阿里巴巴出任副总裁,负责大数据的商业化创新研究。该消息引得业界广泛关注,但这个主要由科学家组成的新部门一直未向外界揭开神秘面纱。
在阿里内部,做数据研究工作的IDST几乎和集团的每一个BU(事业部)都有交集,这个扮演中转站角色的部门,要如何肩负起马云“让数据驱动未来”的商业梦想?
做其他部门不愿做、做不了的事
IDST(InstituteofDataScience&Technologies),数据科学与技术研究院,单从名称上看,就明显区别于互联网公司内部的事业部运营风格,如果把各事业部比喻成拼杀于战场上的江湖派,那么IDST则充满了学院风格,其员工也大多具有科学家背景。
作为负责人,涂子沛的名片上印的英文名字是Jack,和人们熟悉的JackMa(马云)同名,其职位只写了阿里巴巴集团副总裁,此外再没有任何如IDST等相关名头。
目前,这个部门大约有150名员工,分布在杭州、北京、硅谷和西雅图两岸四地,其中杭州有50人左右。在组织架构上,IDST分属于阿里云;层级关系上,涂子沛向阿里巴巴集团首席技术官王坚博士汇报,王坚就是IDST这个想法的最初设计师。
事实上,IDST的三名负责人都有来头。除了涂子沛,漆远是普渡大学计算机系和统计系两个系的终身教授,擅长机器学习和人工智能;金榕为美国密歇根州立大学终身教授,获得过美国国家科学基金会奖(NSFCareerAward)。涂子沛对记者说,在分工上,漆远带中国团队,金榕带美国团队,他负责商业和数据经济方面的研究。
涂子沛出国前在广州武警边防总队待了8年,后又在广东省经贸部门工作两年,其在政府方面的人脉也是马云看中的资源。要知道去年以来,阿里云披荆斩棘般地与全国十几个省份达成合作协议,与政府机构数据的对接对任何一个民间数据公司来说都如获至宝。
“IDST要做阿里其他部门不愿做也做不了的事情。”这是王坚对IDST的角色定位。何为不愿做?与那些营收增长立竿见影的业务部门相比,数据研究、机器学习、自然语言处理这些领域很难快速出成绩。涂子沛也说,既然是创新部门,就没有背负传统的绩效考核目标。何为做不了?单听这些前沿性的研究领域就知道门槛有多高。
类似的研究室在全球有实力的科技企业中生根发芽,像谷歌大脑,即googleX实验室,做的是人工智能、机器学习的研究,可应用到语音识别、无人汽车等领域;微软类似的深度学习系统名叫Adam(亚当);去年5月,前“谷歌大脑”、第一个让机器识别出“猫”的科学家吴恩达从硅谷回国,加盟百度深度学习研究院,推进人工智能研究。
从硅谷到中国,不只是科学家,大量云计算方面的高层人才正演绎着这个流动趋势,比如从甲骨文到阿里云。涂子沛认为,这股趋势背后说明,在大数据、云计算等前沿领域,中国与美国的差距微乎其微,越来越多的人看到了回国建功立业的机会。
每年投入1500万元办数据大赛
对大数据的分析和使用将对互联网公司和用户生活层面产生多大的改变?
去年,阿里巴巴举办了一次天猫算法推荐大赛,其中6名大学生组成的团队拿走了100万元的头奖,他们设计的算法效率超过了阿里巴巴工程师16.9%,这套算法随即被应用到“双11”中,通俗地讲就是让商品推荐变得更精准,内部预计这套算法给平台带来了上千万元的经济价值,这也让阿里见识到了外部新生力量的强大。
该项目的负责人、来自IDST部门的高级经理王一婷说,6个人中有一人即将入职阿里巴巴,一人靠这次的一炮而红开始创业,其他人还未毕业。26日刚启动的天池大赛与此类似,将持续一年时间,有“联赛”的意味,去年比赛有国内外共7276支队伍参加。
招揽人才、创新产品的商业化应用、推动大数据生态建设,这是IDST举办这类大赛的目的。这也得到了涂子沛的证实,他向本报记者透露,阿里每年在这个比赛上投入的资金在1500万元左右,其中最大的花费是计算成本,阿里拿出了1000台服务器专门提供给参赛者,项目还会对接风投,孵化选手们的创业梦想,“如果非要说这里边有什么商业利益的话,只有参赛者的算法被应用到阿里业务中这一点。”
这次天池大赛,选手们会围绕3个课题施展拳脚,其中之一是淘宝女装搭配,阿里将淘宝上的大数据脱敏后给到参赛者,后者需要设计一套算法,利用图像识别等技术让机器来搭配服饰,代替以往的人工挑选和搭配。当然,机器的“眼光”如何,最后还要经过消费者的评估。
还有针对资金规模高达5789亿元的余额宝,选手们要做的是精准预测其未来每天的资金流入流出情况,既保证用户的高收益,又避免大量赎回导致挤兑;此外,就是预测手机淘宝用户的购物喜好。
而像在虾米音乐上根据用户的喜欢推荐音乐等课题将放到下一次大赛中去落实。
一切业务数据化,一切数据业务化,马云最近一年在全球众多高端场合“布道”其数据观点。涂子沛称,中国目前拥有的数据量占全世界的14%,预计到2020年这一比例将为21%,但数据利用率不到0.4%,数据商业化的空间以及数据经济的未来价值已经显现。
数据开放和数据商业化,将是未来几年内不断延伸的两条交叉线。涂子沛说,以前写书、演讲,是知识传播,这次从美国举家搬到杭州,角色要求转变成了知识创新,将会更有挑战。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 CDA 数据分析师能力体系中,透视分析是数据探索、多维度汇总、业务复盘的核心基础技能。无论是 Excel 数据透视表,还是 Power ...
2026-07-03在市场竞争日趋激烈、获客成本持续攀升的当下,企业粗放式的“广撒网”获客模式早已无法适配经营需求。企业经营的核心逻辑,已经 ...
2026-07-03 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-07-03【核心关键词】运营、企业、核心、客户、新技术、数字化运营、数据分析、传统企业、人工录入、生产系统、技术人员、数据安全、 ...
2026-07-02在产品开发、项目立项、业务拓展、运营优化的工作中,市场调查、竞品分析、需求调研是三大核心基础工作。很多从业者容易将三者混 ...
2026-07-02 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-02在MySQL数据库运维与开发工作中,当单表数据量达到千万级、亿级后,会出现查询卡顿、索引失效、写入性能下降等问题。为优化性能 ...
2026-07-01在信息化建设、系统开发、数据分析、需求梳理的工作场景中,业务模型与逻辑模型是两个最基础、也最容易混淆的核心概念。很多项目 ...
2026-07-01 很多数据分析师能熟练计算各种指标,但当被问到“这些指标之间是什么关系”“为什么要选这个指标而不是那个”“指标体系的整 ...
2026-07-01【核心关键词】报表、数据源、客户、营销、业绩、销售、时效性、函数、可视化、运营、数据分析、数据报表、业务部门、数据运营 ...
2026-06-30在数据分析、商业预测、经济统计、运维监控等领域中,绝大多数业务数据都具备时间连续性特征,例如月度销售额、日度客流量、季度 ...
2026-06-30 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标在所有行业都适用”“哪些指标只对电商有意义”“二者如何搭 ...
2026-06-30在 SQL Server 安装、服务启动、数据库文件操作等场景中,经常会遇到 “实例已在使用” 类报错,不同触发场景的原因与处理方式差 ...
2026-06-29在Excel数据统计、财务核算、销售复盘、库存盘点等办公场景中,经常需要在数据透视表中实现一列数据乘以另一列数据的计算需求, ...
2026-06-29在数据分析中,指标是连接业务与数据的核心语言。它并非一个简单的数字,而是一个将模糊的业务需求(如“提升用户粘性”)转化为 ...
2026-06-29【核心关键词】大数据、零售商、消费者、供应链、运营、企业、产品、客户、数据模型、大数据平台、数据开发、系统运维、业务逻 ...
2026-06-26在物流配送、供应链履约、终端供货等业务场景中,送货率是衡量企业履约能力、服务质量、供应链稳定性的核心业务指标,直接关联客 ...
2026-06-26 很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度” ...
2026-06-26在数字化管理与数据化运营体系中,指标是连接原始数据与业务决策的核心载体。零散的原始数据只是无意义的数值堆砌,无法直接反映 ...
2026-06-25在Excel数据汇总、财务统计、业务复盘等日常办公场景中,经常需要完成逐行相乘、整体汇总求和的计算需求,最典型的场景就是:单 ...
2026-06-25