国产GPU升级万卡集群
创始人
2024-07-07 00:40:49

本报讯(记者 孙奇茹)日前,总部位于北京的国产GPU企业摩尔线程宣布其AI旗舰产品夸娥(KUAE)智算集群解决方案实现重大升级,从当前的千卡级别大幅扩展至万卡规模。

“AI模型训练的主战场,万卡已成为标配。”摩尔线程创始人兼CEO张建中说。随着计算量不断攀升,大模型训练亟需超级工厂,也就是一个“大且通用”的加速计算平台,从而缩短训练时间,实现模型能力的快速迭代。

所谓万卡集群,是指由一万张及以上的计算加速卡(如GPU)组成的高性能计算系统,用以训练基础大模型。据了解,构建万卡集群并非一万张GPU卡的简单堆叠,而是一项高度复杂的超级系统工程。“可以把万卡集群想象为一个万人团队,团队需要有非常强的沟通机制,才能协同把一件事情做好。”摩尔线程相关负责人说,希望能够建设一个规模超万卡、场景够通用、生态兼容好的加速计算平台,并优先解决大模型训练的难题。

稳定性方面,夸娥万卡集群平均无故障运行时间超过15天,最长可实现大模型稳定训练30天以上,周均训练有效率在99%以上。

相关内容

热门资讯

深圳坪山AI智园未来营正式启幕... 深圳新闻网2026年6月13日讯(记者 曹园芳)6月12日晚,深圳坪山AI智园星光璀璨、智潮涌动,以...
又是安徽!全面押注机器人,安徽... 近日,安徽省发布《关于推动机器人产业高质量发展的实施意见》(征求意见稿)(下称《意见》),从优化产业...
利元亨获得实用新型专利授权:“... 证券之星消息,根据天眼查APP数据显示利元亨(688499)新获得一项实用新型专利授权,专利名为“极...
中国发射首颗聚焦文物保护的定制... 中新社北京6月15日电 (记者 应妮)记者6月15日从中国国家文物局获悉,中国首颗聚焦文物保护的定制...
安克创新获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示安克创新(300866)新获得一项实用新型专利授权,专利名为“...