-
钱德沛:《中国的超算要敢于创新,另辟蹊径》
2026-09-01 10:21:10
作者:钱德沛(中国科学院院士,北京航空航天大学计算机学院教授)
过去30年,在我国科技人员的努力下,高性能计算事业取得了长足进步。性能也即运算速度是衡量超算水平的世界公认指标,按计算机性能划分,我国经历了4个阶段,每个阶段计算机性能提高1000倍,即从G级(每秒10亿次)到T级(每秒万亿次),再到P级(每秒1000万亿次),再到E级(每秒百亿亿次)。相对应的典型计算机系统是早期的曙光1000(G级),20世纪末的曙光3000(百G级),本世纪初的联想深腾6800和曙光4000A(T级),接着是天河一号、曙光6000和神威·蓝光(P级),神威·太湖之光和天河二号(百P级)等。“十三五”规划提出要突破E级(1000P级)计算机核心技术,也已实现了研究目标。
自主研发的神威、天河、曙光系列超级计算机已11次位居世界超算TOP500排行榜第一,大气模拟、地震模拟、量子模拟等关键领域大规模并行计算应用三次获得世界高性能计算应用最高奖“戈登·贝尔”奖。全国范围建成由14个国家超级计算中心支撑的国家高性能计算环境(中国国家网格)等战略性信息基础设施。
当前超算发展遇到瓶颈,TOP500的数据说明,超算性能增长从过去每10~11年增长1000倍降到了增长100倍以下。
首先,能效指标约束下不能依靠扩大系统规模来提高性能。2022年,美国橡树岭国家实验室研发的超级计算机Frontier成为世界上第一台百亿亿级的E级超级计算机。该机是此规模系统世界最好水平,但每小时仍耗电2万多度,相当于数十万台笔记本电脑的耗电量。在我国双碳指标约束下,计算机系统研制和数据中心建设必须考虑能耗因素。其次,计算架构师们一直信奉的摩尔定律已经接近其极限。体系结构变化缓慢,量子计算机等颠覆性技术距离实用尚有距离,新原理的计算和存储器件缺少突破,算法、软件和硬件之间匹配不良等问题,导致超级计算机性能的提升放缓。再者,我国后E级计算机的研制面临挑战。目前用于研制后E级系统的高性能处理器/加速器需进行进口替代;克服“存储墙”壁垒的HBM内存及新型存储器件方面我国与世界最先进水平仍存差距;自主高端处理器的研发和制造仍受制于人。此外,我国超算应用软件对外依赖度较高,多数并行的科学与工程计算软件依靠进口。
超算技术和国际形势正在发生变化。大模型等AI应用的兴起使得算力需求急剧上升。AI需要更多的是半精度浮点运算和整数运算,而不是传统衡量性能的双精度浮点运算。而且随着机器规模的不断扩大,发挥系统全机能力的并行计算变得更加困难,能否使应用软件充分发挥并行硬件的优势成为必须解决的难题。再者,当前依靠自主技术,在不是采用最高性能处理器实现的系统上,取得世界领先的应用成效,是赢得主动的关键。强调应用实效并不意味机器性能不重要,只是不以机器性能为唯一指标,而是把更多的力量放在软硬结合、应用优化上,以取得应用实效为硬道理。
超算提供的是超强双精度浮点运算能力,主要用于解决数值模拟和第一性原理计算等科学与工程计算问题,如气象数值预报、材料计算、流体动力学计算等。通过用数学物理方程建立待研究对象的数学模型,在初始和边界条件下求解方程,得到待研究对象的特征和性态,这是开展预测性科学研究的经典手段。随着大数据和深度学习技术的出现,出现了新的问题求解模式,即AI赋能的模式,对应的计算称之为智算。在智算模式下,采用人工神经网络作为被研究对象的模型。在训练阶段,使用大数据反复训练模型。在求解或者说推理阶段,将待解问题的数据送入模型,得到结果输出。模型的训练和推理主要使用半精度浮点数或整数运算,这是智算不同于传统超算之处。
传统的超级计算机也可以完成模型训练和推理的任务,但是其超强的双精度浮点运算能力得不到充分利用,反而消耗了更多的电力,而智算所需要的半精度浮点数和整数运算性能又不足,这是智算给传统超算带来的新挑战。伴随AI的快速进步,超算也迎来新的发展机遇。AI催生了前所未有的巨大算力需求,AI大模型通常拥有千亿以上参数,其训练依赖大算力,例如若使用每秒1000万亿次的超级计算机训练一次GPT-3模型,需要连续运行3600余天。算力的巨大需求刺激超算发展,超算正在努力适应AI的需要,增强半精度浮点和整数运算能力,发展多种硬件加速器,高效支持AI的特征操作。
此外,机器学习、深度学习等AI技术具有解决高维数学问题的强大能力,催生了一种新的科研范式,即AI For Science,或称科学智能。目前AI方法在蛋白质结构预测、新材料设计、天气预报、大规模分子模拟等方面取得了突破性进展,正在改变这些领域依赖数值模拟的传统局面,推动了超级计算与AI的融合发展。一方面,超算的并行计算能力是AI for Science的基础。AI算法通常涉及大量的并行计算,而超算的多处理器架构和并行计算能力能够充分满足这一需求。另一方面,AI for Science所产生的新方法和新软件将极大丰富传统超算的软件资源,提高其解决复杂挑战性问题的能力。
抓住AI发展的契机,能够带动超算领域硬件、算法、软件、应用和系统的协同创新。
作者介绍:
钱德沛:中国科学院院士,北京航空航天大学计算机学院教授,中国计算机学会会士,高性能计算方向连续四个国家重大项目/重点研发专项总体组组长、国家973计划信息领域咨询专家组成员、国家基金委重大研究计划“高性能科学计算的基础算法预科计算建模”指导专家组成员、CNGI专家委员会委员,享受国务院政府特殊津贴。钱德沛院士长期从事计算机系统结构和高性能计算系统研究工作,针对国家高性能计算基础设施建设的重大需求,在基于分散、异构、动态资源构建网络计算环境以及大规模国产超算系统关键技术等方面取得了创新性成果。主持完成国家自然科学基金、863计划、973计划、国际合作计划等多项课题的研究工作,发表论文300余篇。作为第一完成人获国家科技进步二等奖2项,获省部级以上科技奖励7项、中国计算机学会CCF创建60周年杰出贡献奖。
邀请老师演讲、授课请致电:19821197419 阎老师[微信同号]
免责声明:以上内容(包括文字、图片、视频)为用户上传并发布,本平台仅提供信息存储服务。如涉及版权问题,请联系我们并提供版权证明,我们将立即删除!
手机:19821197419
地址:上海市闵行区莲花南路1951号