蚂蚁金服计算存储首席架构师何昌华:有一种情怀是用技术改变世界

简介: 本文节选自复旦大学管理学院与中国管理研究国际学会(IACMR)联合出品的《管理视野》杂志。搞技术的人最终的梦想是什么?蚂蚁金服计算存储首席架构师何昌华认为,他的最终梦想就是通过技术改变了这个世界,本篇文章就是关于他。

本文节选自复旦大学管理学院与中国管理研究国际学会(IACMR)联合出品的《管理视野》杂志

2017年那个春天,40岁的何昌华做了个决定:回国冒一次险,放弃花12年在硅谷打拼出来的“江山”,远赴万里之外的杭州,就任蚂蚁金服计算存储首席架构师。“以前可能是说祖国需要我,现在更多的事实上是说,我需要祖国了。”

在2017年12月接受央视采访时,他这样说。作为硅谷华人圈里年轻的顶级工程师,何昌华是2008年从思科进入谷歌的斯坦福大学博士,作为核心技术负责人之一,7年时间里和团队一起开发了谷歌新一代“咖啡因”搜索引擎,获得公司最高技术奖项。但如果回国的话,他面对的是“理工男”们无法抵挡、硅谷所不能给予的事业“诱惑”——动辄数亿的用户每天频繁使用自己参与设计的场景和产品,它几乎代表着无穷的潜力和无尽的挑战。“每个人都想试一下自己的极限在哪儿,我觉得在这里才真正尝试能不能够做到一个极限。”何昌华这样说。

image.png

2017年底,蚂蚁金服在ATEC大会上首次公布了面向未来的技术布局——“BASIC”战略,即Blockchain (区块链)、Artificial Intelligence(人工智能)、Security(安全风控)、IoT(物联网)和 Computing(计算)五大领域,AI人工智能占据主推方向一席之地。归国后的何昌华先后带领团队研发并上线了蚂蚁实时智能决策系统;打造了中国首个金融级的分布式图数据库Geabase;研发新一代数据技术架构以及金融级核心计算引擎。回国后的节奏显然比硅谷快很多,但何昌华表示对整个工作的状态还挺满意,关键在于,现在做的事情很有突破性:“以前我们常开玩笑说C2C就是Copy to China,国外做好的东西我们来拷贝一遍他们的答案,但我们现在做的是大家都在探索的、前沿领先的东西。”

image.png

何昌华所说的领先的东西,其中之一就是开源机器学习工具SQLFlow——把艰深的AI与简单的SQL结合起来,大大简化了数据工程师使用AI技术的门槛。研发出SQLFlow的,正是何昌华带领下的AI Infra团队。SQLFlow让用户仅需几行SQL代码就能描述整个应用或者产品背后的数据流和AI构造,大大降低了使用人工智能的门槛。“我们做这个事情的目的是希望以后对所有的业务人员而言,他们可以直接使用机器学习,这也符合国内机器学习的民主化趋势,就是希望让所有的人都能够用机器学习。” 何昌华说。2019年5月6日,蚂蚁金服副CTO胡喜正式宣布:“未来三年,AI能力会成为每一位技术人员的基本能力。我们希望通过开源SQLFlow,让技术人员调用AI像SQL一样简单。”开源后的SQLFlow不但已经应用于支付宝的营销推荐场景,还将很快推广到类似“滴滴出行”这样的其他行业领域。

image.png

如果我们跳出来看的话,SQLFlow这个璀璨的亮点,其实是一个更为宏大、雄心勃勃的计划——全实时大数据智能平台结出的硕果。伴随着金融行业越来越复杂的融合场景和海量数据,对新一代数据技术架构以及金融计算核心引擎的需要也变得愈加急迫。“就像实时智能决策平台那样,下一代金融计算核心引擎的实时计算延时要足够低,计算速度要足够快,数据即时流入即时反馈结果。”何昌华说。

在蚂蚁金服,何昌华团队的最新任务就是开发新一代计算引擎,搭建一个“完全实时”的大数据处理系统。这个平台是一个高难度的“无人地带”,是全世界上很多顶级研究团队都想做,但还没有人拿出成形方案的区域。由于线下生活场景的多样性和复杂性,这是个比构建当年的谷歌实时搜索引擎“咖啡因”更具挑战性的任务。

image.png

这一任务,被认为将成为未来技术的基石。这个汇集了数据、计算、智能的“高效率的大数据底盘”,被称为Big Data Base,中文名正是“基石”。何昌华的预测是:“未来三年以内,绝大多数的计算场景都会有人工智能参与,就是说在涉及蚂蚁金融服务的方方面面,80%的地方都会用到人工智能。”繁多的场景倒逼之下,过去十年人工智能技术的发展实际上是因为数据量极大,计算能力增长。一项技术能否取得质的领先就在于底层是否有足够强大的计算能力,有足够快速的模型迭代。他特别提到几个月以前谷歌新发布的做自然语言处理的模型,“这个模型具备的超强计算能力,已经在自然语言处理方面远远领先于同类公司了”。

image.png

在何昌华看来,海量用户群和数据,AI与金融的结合落地,将是中国新时代崛起的“时代场景”:“这个场景如果你能够参与其中,有一些贡献的话,会对你的人生是一个很大提升。”当高度数据化的社会到来时,我们处理和应用海量数据的能力直接决定我们能否基于数据做到更多的事,催生出更高的智能,进而推动人类社会向着下一阶段发展。

他坦言,自己还是有一点“普世情怀”的,最钦佩的人之一是埃隆·马斯克:“我觉得马斯克是个传奇,他做的事情是很多人不敢想象,不敢尝试,但对整个人类进步有益的事情。”何昌华现在每天的工作,要面对几亿用户,从普惠金融到服务小微企业,有一种惠及民众的责任感:“我觉得搞技术的人,最终的梦想就是这样——通过技术改变了这个世界。”

image.png

“当你觉得这件事情有意义的时候,苦一点累一点都是值得的”,长途飞行后赶到采访现场的何昌华,因为感冒、熬夜,他的脸色有些疲惫,但是在他娓娓诉说这些愿景的时候,你分明可以看见他眼眸中闪的光——那是一位科学家的目标与热情,是向未来凝视的眼睛。

相关文章
|
10月前
|
存储 NoSQL 前端开发
【赵渝强老师】MongoDB的分布式存储架构
MongoDB分片通过将数据分布到多台服务器,实现海量数据的高效存储与读写。其架构包含路由、配置服务器和分片服务器,支持水平扩展,结合复制集保障高可用性,适用于大规模生产环境。
640 1
|
存储 关系型数据库 MySQL
成本直降30%!RDS MySQL存储自动分层实战:OSS冷热分离架构设计指南
在日均订单量超500万的场景下,MySQL数据年增200%,但访问集中在近7天(85%)。通过冷热数据分离,将历史数据迁移至OSS,实现存储成本下降48%,年省72万元。结合RDS、OSS与Redis构建分层架构,自动化管理数据生命周期,优化查询性能与资源利用率,支撑PB级数据扩展。
913 3
|
存储 关系型数据库 数据库
高性能云盘:一文解析RDS数据库存储架构升级
性能、成本、弹性,是客户实际使用数据库过程中关注的三个重要方面。RDS业界率先推出的高性能云盘(原通用云盘),是PaaS层和IaaS层的深度融合的技术最佳实践,通过使用不同的存储介质,为客户提供同时满足低成本、低延迟、高持久性的体验。
|
存储 机器学习/深度学习 缓存
软考软件评测师——计算机组成与体系结构(分级存储架构)
本内容全面解析了计算机存储系统的四大核心领域:虚拟存储技术、局部性原理、分级存储体系架构及存储器类型。虚拟存储通过软硬件协同扩展内存,支持动态加载与地址转换;局部性原理揭示程序运行特性,指导缓存设计优化;分级存储架构从寄存器到外存逐级扩展,平衡速度、容量与成本;存储器类型按寻址和访问方式分类,并介绍新型存储技术。最后探讨了存储系统未来优化趋势,如异构集成、智能预取和近存储计算等,为突破性能瓶颈提供了新方向。
|
存储 数据采集 机器学习/深度学习
新闻聚合项目:多源异构数据的采集与存储架构
本文探讨了新闻聚合项目中数据采集的技术挑战与解决方案,指出单纯依赖抓取技术存在局限性。通过代理IP、Cookie和User-Agent的精细设置,可有效提高采集策略;但多源异构数据的清洗与存储同样关键,需结合智能化算法处理语义差异。正反方围绕技术手段的有效性和局限性展开讨论,最终强调综合运用代理技术与智能数据处理的重要性。未来,随着机器学习和自然语言处理的发展,新闻聚合将实现更高效的热点捕捉与信息传播。附带的代码示例展示了如何从多个中文新闻网站抓取数据并统计热点关键词。
791 2
新闻聚合项目:多源异构数据的采集与存储架构
|
并行计算 PyTorch 算法框架/工具
融合AMD与NVIDIA GPU集群的MLOps:异构计算环境中的分布式训练架构实践
本文探讨了如何通过技术手段混合使用AMD与NVIDIA GPU集群以支持PyTorch分布式训练。面对CUDA与ROCm框架互操作性不足的问题,文章提出利用UCC和UCX等统一通信框架实现高效数据传输,并在异构Kubernetes集群中部署任务。通过解决轻度与强度异构环境下的挑战,如计算能力不平衡、内存容量差异及通信性能优化,文章展示了如何无需重构代码即可充分利用异构硬件资源。尽管存在RDMA验证不足、通信性能次优等局限性,但该方案为最大化GPU资源利用率、降低供应商锁定提供了可行路径。源代码已公开,供读者参考实践。
1557 3
融合AMD与NVIDIA GPU集群的MLOps:异构计算环境中的分布式训练架构实践
|
机器学习/深度学习 弹性计算 人工智能
阿里云服务器ECS架构区别及选择参考:X86计算、ARM计算等架构介绍
在我们选购阿里云服务器的时候,云服务器架构有X86计算、ARM计算、GPU/FPGA/ASIC、弹性裸金属服务器、高性能计算可选,有的用户并不清楚他们之间有何区别,本文主要简单介绍下这些架构各自的主要性能及适用场景,以便大家了解不同类型的架构有何不同,主要特点及适用场景有哪些。
2261 10
|
存储 人工智能 运维
面向AI的服务器计算软硬件架构实践和创新
阿里云在新一代通用计算服务器设计中,针对处理器核心数迅速增长(2024年超100核)、超多核心带来的业务和硬件挑战、网络IO与CPU性能增速不匹配、服务器物理机型复杂等问题,推出了磐久F系列通用计算服务器。该系列服务器采用单路设计减少爆炸半径,优化散热支持600瓦TDP,并实现CIPU节点比例灵活配比及部件模块化可插拔设计,提升运维效率和客户响应速度。此外,还介绍了面向AI的服务器架构挑战与软硬件结合创新,包括内存墙问题、板级工程能力挑战以及AI Infra 2.0服务器的开放架构特点。最后,探讨了大模型高效推理中的显存优化和量化压缩技术,旨在降低部署成本并提高系统效率。
|
存储 机器学习/深度学习 人工智能
【AI系统】计算图优化架构
本文介绍了推理引擎转换中的图优化模块,涵盖算子融合、布局转换、算子替换及内存优化等技术,旨在提升模型推理效率。计算图优化技术通过减少计算冗余、提高计算效率和减少内存占用,显著改善模型在资源受限设备上的运行表现。文中详细探讨了离线优化模块面临的挑战及解决方案,包括结构冗余、精度冗余、算法冗余和读写冗余的处理方法。此外,文章还介绍了ONNX Runtime的图优化机制及其在实际应用中的实现,展示了如何通过图优化提高模型推理性能的具体示例。
1134 4
【AI系统】计算图优化架构
|
10月前
|
Cloud Native Serverless API
微服务架构实战指南:从单体应用到云原生的蜕变之路
🌟蒋星熠Jaxonic,代码为舟的星际旅人。深耕微服务架构,擅以DDD拆分服务、构建高可用通信与治理体系。分享从单体到云原生的实战经验,探索技术演进的无限可能。
微服务架构实战指南:从单体应用到云原生的蜕变之路