如今OpenAI发布ChatGPT已有两年的时间,从建设进度上看,海外头部厂商在2022年、2023年已经完成万卡集群搭建。比如2023年5月,谷歌推出的AI超级计算机A3,搭载了约26000块英伟达H100 GPU;2022年,META宣布了一个由1.6万块英伟达A100 GPU组成的集群。到了2024年初,META进一步扩大规模,建成了两个各含24576块GPU的集群,并设定了宏伟目标:到2024年底,构建一个包含35万块英伟达H100 GPU的庞大基础设施。亚马逊Amazon EC2 Ultra集群采用了2万个H100 TensorCore GPU。
再看中国的智能算力建设情况。
02 国产万卡集群,谁在布局?
日前,中国工程院院士郑纬民指出,“构建国产AI卡的万卡大模型训练平台很难,但也很重要以及必要。”
当下,国内已有多家厂商及机构着手向万卡集群领域拓展业务。
根据《智算产业发展研究报告(2024)》显示,在中国,超万卡集群的智算中心已达十余个。
今年以来, 中国移动 、联通、电信三大运营商均在加速推进超万卡集群智算中心的建设。
今年8月,中国电信在智算网络建设方面取得了显著进展,其上海与北京两大万卡集群已成功投产运营。
中国移动位于呼和浩特、哈尔滨、贵阳的万卡级别的智算中心已经先后投产运行。据悉,三大集群总规模近6万张GPU卡,充分满足大模型集中训练需求。
中国联通正在打造上海、呼和万卡智算集群,全网智算算力超15EFLOPS,发布AICC、AICP、星罗调度平台等五大智算产品,提供涵盖国家“东数西算”枢纽、31省重点城市、超600边缘节点的AIDC基座。