国产GPU升级万卡集群
创始人
2024-07-07 00:40:49

本报讯(记者 孙奇茹)日前,总部位于北京的国产GPU企业摩尔线程宣布其AI旗舰产品夸娥(KUAE)智算集群解决方案实现重大升级,从当前的千卡级别大幅扩展至万卡规模。

“AI模型训练的主战场,万卡已成为标配。”摩尔线程创始人兼CEO张建中说。随着计算量不断攀升,大模型训练亟需超级工厂,也就是一个“大且通用”的加速计算平台,从而缩短训练时间,实现模型能力的快速迭代。

所谓万卡集群,是指由一万张及以上的计算加速卡(如GPU)组成的高性能计算系统,用以训练基础大模型。据了解,构建万卡集群并非一万张GPU卡的简单堆叠,而是一项高度复杂的超级系统工程。“可以把万卡集群想象为一个万人团队,团队需要有非常强的沟通机制,才能协同把一件事情做好。”摩尔线程相关负责人说,希望能够建设一个规模超万卡、场景够通用、生态兼容好的加速计算平台,并优先解决大模型训练的难题。

稳定性方面,夸娥万卡集群平均无故障运行时间超过15天,最长可实现大模型稳定训练30天以上,周均训练有效率在99%以上。

相关内容

热门资讯

快把这个秘密告诉你身边的左撇子... · 正 · 文 · 来 · 啦 · 在这个世界上,为什么90%左右的人都偏好用右手干活,只有约10...
原创 炸... 大约十年前,苹果组建如今的视觉产品团队研发头戴设备时,产品路线图截然不同。公司当时同步推进三款截然不...
一千个现代人,有一千种《颈椎病... 玩过都说颈椎痛。 在此前的Steam新品节中,很多玩家大概都和我一样,被《颈椎病》的封面图片吸引着点...
原创 L... 英雄联盟LPL第二赛段的比赛,于4月4日正式拉开序幕。基于2026年第一赛段的排名,14支队伍将划分...
原创 被... 在王者荣耀中,有些皮肤可以说是非常稀有的,而且有些皮肤不只是因为限定那么简单,因为它的获取方式也比较...