京公网安备 11010802034615号
经营许可证编号:京B2-20210330
阿里数据科技研究院:算法是大数据的核心
这两天,阿里巴巴投入1500万元新启动了一个代号为“天池”的数据竞赛,选手们比拼如何利用现有大数据进行淘宝女装搭配的算法推荐、余额宝资金的流入流出预测等。其背后的推动者是被外界称为阿里巴巴最神秘部门IDST的负责人涂子沛,著有《大数据》和《数据之巅》。
3月25日,笔者在阿里巴巴西溪园区的会议室里对涂子沛进行了独家专访。军人出身的他,身上带有一股特殊的英气,这在IT圈里并不多见。
涂子沛去年年底从美国硅谷空降阿里巴巴出任副总裁,负责大数据的商业化创新研究。该消息引得业界广泛关注,但这个主要由科学家组成的新部门一直未向外界揭开神秘面纱。
在阿里内部,做数据研究工作的IDST几乎和集团的每一个BU(事业部)都有交集,这个扮演中转站角色的部门,要如何肩负起马云“让数据驱动未来”的商业梦想?
做其他部门不愿做、做不了的事
IDST(InstituteofDataScience&Technologies),数据科学与技术研究院,单从名称上看,就明显区别于互联网公司内部的事业部运营风格,如果把各事业部比喻成拼杀于战场上的江湖派,那么IDST则充满了学院风格,其员工也大多具有科学家背景。
作为负责人,涂子沛的名片上印的英文名字是Jack,和人们熟悉的JackMa(马云)同名,其职位只写了阿里巴巴集团副总裁,此外再没有任何如IDST等相关名头。
目前,这个部门大约有150名员工,分布在杭州、北京、硅谷和西雅图两岸四地,其中杭州有50人左右。在组织架构上,IDST分属于阿里云;层级关系上,涂子沛向阿里巴巴集团首席技术官王坚博士汇报,王坚就是IDST这个想法的最初设计师。
事实上,IDST的三名负责人都有来头。除了涂子沛,漆远是普渡大学计算机系和统计系两个系的终身教授,擅长机器学习和人工智能;金榕为美国密歇根州立大学终身教授,获得过美国国家科学基金会奖(NSFCareerAward)。涂子沛对记者说,在分工上,漆远带中国团队,金榕带美国团队,他负责商业和数据经济方面的研究。
涂子沛出国前在广州武警边防总队待了8年,后又在广东省经贸部门工作两年,其在政府方面的人脉也是马云看中的资源。要知道去年以来,阿里云披荆斩棘般地与全国十几个省份达成合作协议,与政府机构数据的对接对任何一个民间数据公司来说都如获至宝。
“IDST要做阿里其他部门不愿做也做不了的事情。”这是王坚对IDST的角色定位。何为不愿做?与那些营收增长立竿见影的业务部门相比,数据研究、机器学习、自然语言处理这些领域很难快速出成绩。涂子沛也说,既然是创新部门,就没有背负传统的绩效考核目标。何为做不了?单听这些前沿性的研究领域就知道门槛有多高。
类似的研究室在全球有实力的科技企业中生根发芽,像谷歌大脑,即googleX实验室,做的是人工智能、机器学习的研究,可应用到语音识别、无人汽车等领域;微软类似的深度学习系统名叫Adam(亚当);去年5月,前“谷歌大脑”、第一个让机器识别出“猫”的科学家吴恩达从硅谷回国,加盟百度深度学习研究院,推进人工智能研究。
从硅谷到中国,不只是科学家,大量云计算方面的高层人才正演绎着这个流动趋势,比如从甲骨文到阿里云。涂子沛认为,这股趋势背后说明,在大数据、云计算等前沿领域,中国与美国的差距微乎其微,越来越多的人看到了回国建功立业的机会。
每年投入1500万元办数据大赛
对大数据的分析和使用将对互联网公司和用户生活层面产生多大的改变?
去年,阿里巴巴举办了一次天猫算法推荐大赛,其中6名大学生组成的团队拿走了100万元的头奖,他们设计的算法效率超过了阿里巴巴工程师16.9%,这套算法随即被应用到“双11”中,通俗地讲就是让商品推荐变得更精准,内部预计这套算法给平台带来了上千万元的经济价值,这也让阿里见识到了外部新生力量的强大。
该项目的负责人、来自IDST部门的高级经理王一婷说,6个人中有一人即将入职阿里巴巴,一人靠这次的一炮而红开始创业,其他人还未毕业。26日刚启动的天池大赛与此类似,将持续一年时间,有“联赛”的意味,去年比赛有国内外共7276支队伍参加。
招揽人才、创新产品的商业化应用、推动大数据生态建设,这是IDST举办这类大赛的目的。这也得到了涂子沛的证实,他向本报记者透露,阿里每年在这个比赛上投入的资金在1500万元左右,其中最大的花费是计算成本,阿里拿出了1000台服务器专门提供给参赛者,项目还会对接风投,孵化选手们的创业梦想,“如果非要说这里边有什么商业利益的话,只有参赛者的算法被应用到阿里业务中这一点。”
这次天池大赛,选手们会围绕3个课题施展拳脚,其中之一是淘宝女装搭配,阿里将淘宝上的大数据脱敏后给到参赛者,后者需要设计一套算法,利用图像识别等技术让机器来搭配服饰,代替以往的人工挑选和搭配。当然,机器的“眼光”如何,最后还要经过消费者的评估。
还有针对资金规模高达5789亿元的余额宝,选手们要做的是精准预测其未来每天的资金流入流出情况,既保证用户的高收益,又避免大量赎回导致挤兑;此外,就是预测手机淘宝用户的购物喜好。
而像在虾米音乐上根据用户的喜欢推荐音乐等课题将放到下一次大赛中去落实。
一切业务数据化,一切数据业务化,马云最近一年在全球众多高端场合“布道”其数据观点。涂子沛称,中国目前拥有的数据量占全世界的14%,预计到2020年这一比例将为21%,但数据利用率不到0.4%,数据商业化的空间以及数据经济的未来价值已经显现。
数据开放和数据商业化,将是未来几年内不断延伸的两条交叉线。涂子沛说,以前写书、演讲,是知识传播,这次从美国举家搬到杭州,角色要求转变成了知识创新,将会更有挑战。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据统计分析中,卡方检验是一种常用的非参数检验方法,核心用于判断两个或多个分类变量之间是否存在显著关联,广泛应用于市场 ...
2026-05-18在企业数字化转型的浪潮中,很多企业陷入了“技术堆砌”的误区——上线了ERP、CRM、BI等各类系统,积累了海量数据,却依然面临“ ...
2026-05-18小陈是某电商平台的数据分析师。老板交给他一个任务:“我们平台的注册用户已经突破1000万了,想了解一下用户的平均月消费金额。 ...
2026-05-18【专访摘要】本次CDA持证专访邀请到拥有丰富物流供应链数据分析经验的赖尧,他结合自身在京东、华莱士、兰格赛等企业的从业经历 ...
2026-05-15在数字化时代,企业的每一次业务优化、每一项技术迭代,都需要回答一个核心问题:这个动作到底能带来多少价值?是提升了用户转化 ...
2026-05-15在数据仓库建设中,事实表与维度表是两大核心组件,二者相互关联、缺一不可,共同构成数据仓库的基础架构。事实表聚焦“发生了什 ...
2026-05-15 很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问 ...
2026-05-15【核心关键词】互联网、机会、运营、关键词、账户、数字化、后台、客户、成本、网络、数据分析、底层逻辑、市场推广、数据反馈 ...
2026-05-14在Python数据分析中,Pandas作为核心工具库,凭借简洁高效的数据处理能力,成为数据分析从业者的必备技能。其中,基于两列(或多 ...
2026-05-14 很多人把统计学理解为“一堆公式和计算”,却忽略了它的本质——一门让数据“开口说话”的科学。真正的数据分析高手,不是会 ...
2026-05-14在零售行业存量竞争日趋激烈的当下,客户流失已成为侵蚀企业利润的“隐形杀手”——据行业数据显示,零售企业平均客户流失率高达 ...
2026-05-13当流量红利消退、用户需求日趋多元,“凭经验决策、广撒网投放”的传统营销模式早已难以为继。大数据的崛起,为企业营销提供了全 ...
2026-05-13 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-05-13在手游行业存量竞争日趋激烈、流量成本持续高企的当下,“拉新”早已不是行业核心痛点,“留存”尤其是“付费留存”,成为决定手 ...
2026-05-12 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-05-12用户调研是企业洞察客户需求、优化产品服务、制定运营策略的核心前提,而调研数据的可靠性,直接决定了决策的科学性与有效性。在 ...
2026-05-11在市场竞争日趋激烈、流量成本持续攀升的今天,企业的核心竞争力已从“获取流量”转向“挖掘客户价值”。客户作为企业最宝贵的资 ...
2026-05-11 很多数据分析师精通Excel单元格操作,熟练应用多种公式,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质 ...
2026-05-11在互联网运营、产品优化、用户增长等领域,次日留存率是衡量产品价值、用户粘性与运营效果的核心指标,更是判断新用户是否认可产 ...
2026-05-09相关性分析是数据分析领域中用于探究两个或多个变量之间关联强度与方向的核心方法,广泛应用于科研探索、商业决策、医疗研究、社 ...
2026-05-09