IT时报记者 郝俊慧
AI算力基础设施竞争正在换挡。
过去几年,大模型竞争围绕“算力规模”展开,谁拥有更多GPU资源,往往意味着更强的大模型训练能力。但随着AI应用从实验室走向产业,尤其是智能体应用快速兴起,行业关注点正在发生变化:如何让算力更高效、更低成本,并以服务化方式触达更多企业。
电信运营商正在成为国产AI芯片的重要应用验证场。
近日,在2026世界人工智能大会(WAIC)期间,由中昊芯英、杭州电信、中兴通讯联合打造的华东地区首个国产TPU(张量处理单元)智算千卡集群正式落地。这也是中国电信体系内首个大规模部署国产TPU架构的智算集群。
这次落地,不只是芯片企业与电信运营商的一次合作,也代表着国产AI算力产业正在从单点芯片突破,走向“芯片—服务器—集群—平台—应用”的完整生态建设。
据了解,该集群项目一期采用中昊芯英第一代TPU AI专用算力芯片“刹那”,集群规模达到1024片,算力规模达400P。“刹那”是中国首枚量产的高性能TPU架构AI专用大芯片,拥有全自研的 IP核、指令集与计算平台。
依托“刹那”芯片构建的“泰则”智算平台,是中昊芯英自研的人工智能服务器与计算集群系统,可支撑大模型训练、AI推理等高强度计算场景。
此次项目由杭州电信、中兴通讯和中昊芯英共同推进,覆盖芯片、通信网络、服务器集成以及算力运营多个环节,实现了全链路国产化,通过打造计算资源、资源调度、模型适配、运营管理、行业应用五层能力架构,形成“自主芯片+全栈集成+智能运营”的智算体系。
算力大战打到现在,一颗芯片能否真正产生价值,不仅取决于峰值算力,还取决于芯片互联、软件生态、模型适配以及最终服务成本。中昊芯英千卡集群的落地意味着国产AI芯片竞争正在从单颗芯片性能比拼,进入系统能力竞争阶段。
今年WAIC期间,几乎所有国产算力厂商都把超节点摆在了展台最醒目的位置。在接受包括《IT时报》记者在内的媒体采访时,中兴通讯CCN产品线国内MKT专家表示,超节点内部纵向扩展的带宽需求已达TB级别,大规模智算集群的核心挑战之一是解决芯片之间高速互联问题,需要支撑千卡、万卡规模下的稳定通信。
这套千卡集群的建成并非一蹴而就。
杭州电信智算及IDC(互联网数据中心)总经理王良坦言,三方围绕千卡集群的建设进行了长达数月的调优,尤其是今年Token(词元)推理需求爆发后,围绕PD分离、算子优化等关键需求,进行了持续打磨。
智能体时代的突出特征之一是输入远大于输出,Prefill(预计算)负责输入,就像车流一次性涌进收费站,需要瞬间调动大量算力把整段提问“读”进去,Decode(解码生成)负责输出,是指大模型生成答案时采用逐词输出的方式,计算量不大,但会卡内存带宽。PD分离就是将两种需求分别调度,从而让芯片能力物尽其用,进一步发挥不同计算任务的硬件效率。
据王良介绍,今年以来,该集群词元输出效率提升超过10倍,每百万词元的成本由此前约100元降至10元以内,后续将持续优化。
在AI大模型快速发展的背景下,算力需求正在发生变化。相比传统通用计算场景,大模型推理更加关注吞吐效率、能耗以及单位Token成本。
在AI产业发展早期,GPU凭借通用计算能力成为大模型训练的主流选择。但随着模型进入大规模推理阶段,行业关注点开始从单纯追求算力峰值,转向关注吞吐效率、功耗以及单位Token成本。
这也是TPU路线受到关注的重要原因之一。
“TPU本身就是为了深度学习、大规模模型计算设计的。”中昊芯英创始人、CEO杨龚轶凡表示,相比GPU芯片,TPU在硬件架构和软件栈方面更适配当前大语言模型应用,它以脉动阵列和大规模矩阵乘法单元为核心,专门针对矩阵运算做极致优化,契合大语言模型Transformer层的计算逻辑,同时还与TensorFlow深度集成,在大批量矩阵运算场景下具备天然优势。
TPU最早由谷歌研发,2016年AlphaGo对战李世石时,支撑其运行的正是TPU,是谷歌专为深度学习打造的专用ASIC芯片。经过10年的迭代,TPU第七代Ironwood成为谷歌定义自己未来的标签之一,被认为是与GPU并立的另一条主流算力路线。
TPU架构天生适配PD分离,而传统GPU要实现同等效果,需要在上层软件上做大量改造,谷歌预告的第八代架构更是将训练与推理拆成了两颗芯片。
中昊芯英是国内为数不多押注TPU路线的企业,其创始人杨龚轶凡正是出自谷歌TPU研发团队,刚刚于今年6月30日发布的第二代TPU“须臾”原生适配PD分离调度,能够大幅降低软件改造成本,提高集群调度效率。杨龚轶凡透露,“须臾”的性能对标海外先进GPU和TPU产品。
王良也表示,不同芯片并不是简单的替代关系,而是根据不同应用场景进行匹配。TPU在张量计算和推理场景中具有优势,因此成为杭州电信布局算力体系的重要组成部分。
然而,硬件的落地仅仅是迈出了第一步。如何适配不断变化的大模型,如何完善软件生态,如何降低用户迁移成本,仍然是产业需要解决的问题。
杨龚轶凡表示,国产AI芯片目前正在经历从“可用”到“好用”的阶段,需要持续提升软件栈能力,包括不同模型、不同算子的优化,以及开发者生态建设。
在这个过程中,电信运营商成为连接芯片企业和应用市场的重要纽带。过去,电信运营商更多承担的是网络连接和数据中心基础设施提供者的角色。而在AI时代,运营商正在向AI服务提供者转变,通过算力调度、模型服务、安全管理等能力,为企业提供更加普惠的AI基础设施。
更重要的是,电信运营商有着丰富的场景和客户基础,通过真实业务运行反馈,芯片企业可以持续优化硬件和软件,让国产算力从“能运行”走向“高效率运行”。
一位算力从业者告诉记者,目前国产芯片有20~30种,每种都要适配不同的大模型和版本。如果说海外大模型和芯片适配难度是10分,那么,中国算力服务商面临的挑战是100分,尤其在大模型厂商和芯片厂商以“百米冲刺”速度更新迭代的今天,适配工作量巨大。
作为电信运营商,中国电信拿出真实的机房、真实的客户、真实的账单,陪伴一款国产芯片完成从“能跑”到“跑得好”的进阶,这意味着,电信运营商在国产算力生态加速跑过程中,已经成为国产AI芯片的重要应用验证场。
此次千卡集群落地,也是中昊芯英产品演进的重要节点。
WAIC 2026上,中昊芯英第二代TPU芯片“须臾”完成实物首秀。这颗芯片已于6月30日发布,混合精度浮点算力达896TFLOPS,8-bit推理算力1792TOPS,性能是上一代芯片“刹那”的3倍,单芯片额定功耗600W,在算力性能持平的情况下功耗较传统算力芯片降低50%,在集群部署层面,单个超节点最高可实现2048片芯片直联。
据王良透露,该集群未来整体算力规模规划突破10000P,支撑超大规模模型训练、智能制造仿真以及高级无人驾驶模型训练等更多高强度AI应用场景。
杨龚轶凡表示,希望未来可以从千卡走向万卡,真正在万卡集群上运行国产模型的训练、推理,在通信基础上,满足所有商用需求所需要的性价比,以最优性能实现最优的Token 速度,实现保质保量的模型服务。
下一篇:没有了