(文/陈济深 编辑/吕栋)
此前在海外开发者圈掀起热议的匿名模型“Ox-Alpha”(中文社区俗称“牛来”),正式揭开了真实身份。
8月26日晚,智谱正式上线轻量旗舰多模态模型GLM-5.3-Flash,并在当天以MIT协议面向全球完全开源。
在正式认领前,Ox-Alpha在OpenRouter与OpenCode两大海外主流聚合平台进行了多日匿名盲测。首日便冲上OpenRouter榜首,单日Token处理量达到平台此前历史峰值的4倍;据OpenCode方面称,Ox-Alpha终结了此前DeepSeek连续56天的霸榜纪录。
OpenRouter宣布Ox-Alpha真实身份为智谱GLM-5.3-Flash 图片来源 OpenRouter
OpenRouter公开数据显示,在Ox-Alpha登顶后,全平台调用量前五的席位已全部被中国大模型占据。
Ox-Alpha登顶OpenRouter周榜,榜单前五均为中国模型 图片来源 OpenRouter
观察者网了解到,这股席卷海外开发者的超大规模并发流量,并非跑在传统的海外算力底座上,而是由10万张国产算力芯片组成的超大集群全程承载,累计处理请求流量高达62T Token。
在国际评测机构Artificial Analysis发布的综合智能指数(AA Intelligence Index)中,GLM-5.3-Flash斩获57分,追平海外公认的顶级旗舰Claude Opus 4.8。而在实际调用价格上,该模型直接打到了后者的四十分之一。
GLM-5.3-Flash在Artificial Analysis智能指数与任务成本中的位置 图片来源 智谱
8月27日,智谱(02513.HK)收涨12.62%,报1160港元/股,市值重返5000亿港元。
这头跑在10万张国产芯片上的“纯血国产牛”,不仅作为中国开源模型军团的最新成果持续打破了海外巨头“前沿智能必然昂贵”的溢价神话,更顺势接过了此前由DeepSeek树立的平价大旗,在Agent生态中划出一条全新的价格“斩杀线”,刷新了大模型产业落地竞争的新一轮竞争起点。
接力DeepSeek
7月底,DeepSeek-V4-Flash正式上线,凭借强劲的推理与代码能力以及极低定价,迅速在行业内掀起降价潮,甚至直接倒逼OpenAI等海外大厂以打折促销跟进,DeepSeek-V4-Flash在事实层面成为了大模型行业的性价比斩杀线。在上线初期,该模型在OpenCode平台上的单日处理量迅速突破8万亿Token,第一次让全球开发者体验到不必盯着账单跑长链路Agent任务的红利。
然而,Agent时代的工作流对价格极度敏感。Agent的核心是后台长任务循环:读取上下文、检索代码、调用工具、多轮试错。一个任务可能反复循环几十次,微小的Token价差在海量调用中会被成倍放大。
当8月17日0时起DeepSeek实行峰谷定价、高峰时段价格大幅上调后,平台日调用量从峰值回落超过一半,空出了近10万亿Token的庞大日常需求缺口。智谱以Ox-Alpha的匿名身份在此窗口期迅速切入,凭借以免费试用为主的盲测策略,承接了相当一部分外溢流量。
而在8月26日正式认领并开源后,GLM-5.3-Flash公布的商业定价进一步确立了其“价格屠夫”的地位,顺势刷新了这条斩杀线。
在商业定价上,GLM-5.3-Flash国内官方API标准定价为每百万Token输入0.8元、输出2.8元,仅为GLM-5.3的十分之一;上线期间实行半价后,折算价格降至二十分之一。横向对比调价后的DeepSeek-V4-Flash(谷时输入1.5元、输出4.5元),GLM-5.3-Flash在绝大多数常规输入输出场景下综合账单更低。
在国际市场上,该模型公布的输入价格为0.3美元、输出1.2美元,半价期间输出价格仅为0.6美元,约为海外顶级模型Claude Opus 4.8官方价格(输出25美元)的四十分之一,将前沿编程与Agent能力的门槛进一步拉低。
从后训练转向专属架构:国产卡也跑得起
如果说此前GLM-5.2与GLM-5.3的连续发布,印证了智谱在后训练(Post-training)与强化学习方法论上的积累,那么GLM-5.3-Flash则展现了一条截然不同的技术路径。
尽管冠以Flash之名,但智谱并没有在既有的重型底座上继续依靠蒸馏、剪枝或后训练小修小补,而是选择从第一行代码和初始权重开始,为高并发、低成本的推理场景重新设计了一套经济型专属架构。
这套架构的核心在于对计算开销的极端克制。模型总参数量为320B,但单次前向传播的激活参数被压缩到了仅18B,模型层数较上一代GLM-4.5的92层腰斩至45层。
观察者网获悉,该模型直接依托智谱最新的30T Token原生多模态预训练语料从零构建。
测试数据显示,GLM-5.3-Flash在综合能力上超过了总参数量翻倍的上一代重型旗舰GLM-5.2(743B-A40B,AA指数53分),也领先于DeepSeek-V4-Pro正式版(53分)和DeepSeek-V4-Flash(52分)。在智谱自建的代码基准Z.ai Code Bench中,其实际编程与工具调用体感同样稳居第一梯队。
在解决1M超长上下文的显存与计算瓶颈上,该架构采用了稀疏注意力与线性注意力的混合设计。线性注意力通过递归机制以极低开销捕获局部依赖,稀疏注意力借助轻量索引器精准召回全局上下文。
在此基础上,智谱自研的IndexPool技术通过加权池化将索引器缓存实现四合一压缩,配合流形约束超连接(mHC)保障小激活参数下的扩展表现。相较于GLM-5.3,该模型的单Token注意力计算量下降了3.01倍,KV缓存占用降低4.44倍,从算法源头上为国产算力的高效承载扫清了障碍。
过去,国产算力芯片很少直接面对全球化、高并发、不可预测的突发流量大考。面对1M长上下文和多模态对单卡显存容量与互联带宽的极限挤压,智谱在SGLang框架之上为国产算力构建了专属推理服务栈。
在该技术栈中,智谱在底层结合了节点内张量并行、ReplaySSM、W8A8量化与INT8/FP8/BF16混合缓存量化技术,同时配合自研Layersplit与KV broadcast通信优化;在集群调度层面,全面上线生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、提示词预填和逐Token解码拆分为相互独立、动态扩缩容的工作池。整套复杂集群的编译调优与算子开发,由GLM-5.3驱动的Infra Agent协同完成。
最终,这套运行在国产芯片上的服务栈端到端性能提升了3倍,硬件效率和单Token推理成本已基本追平主流英伟达GPU。
此外,GLM-5.3-Flash以320B-A18B的超轻激活结构与MIT协议开源,为国内芯片厂商提供了一套开箱即用的前沿模型标准载体,意味着更多国产硬件可以直接承载320B级别的前沿模型部署,降低了实际商业化推理的适配门槛。
原生多模态:打通视觉代码与复杂生产力闭环
在实际应用能力上,GLM-5.3-Flash是GLM家族首个原生多模态模型。智谱将其多模态能力重点投向了“视觉编码(Visual Coding)”领域,模型不仅能看懂静态图像,更能主动观察代码渲染出的图形界面、3D空间或交互动态,并依据视觉反馈进行自主纠错与迭代。
在开发者社区披露的实测案例中,知名独立开发者通过Ox-Alpha与GLM-5.3消耗近千亿Token,自主编写了50万至60万行代码,端到端生成了一个超大规模的可玩Web游戏。
在纯视觉驱动下,模型仅凭外部素材便能通过Godot引擎还原出类《喷射战士》的涂地对战与类《胡闹厨房》的协作玩法;在无外部素材输入的情况下,模型依托自研视觉反馈流水线,在Blender中自主连续运行12个小时,完整搭建了一套1400至2000平方米、包含12个功能区的高精度天空餐厅与酒吧3D场景;
在工业制造领域,模型甚至能直接读取CAD工程图纸草稿,编写出Python build123d参数化代码,复刻复杂的3D机械零件。
模型读取的CAD工程图纸草稿 图片来源 智谱
模型根据工程图复刻的3D机械零件 图片来源 智谱
在白领高阶生产力场景中,该模型同样具备直接交付能力。在金融场景下,模型能够覆盖从多源信息溯源研报、SOTP估值、三表勾稽复核到DCF敏感性分析;在商务场景中,模型能依据模板起草格式严谨的经销合作协议,直接生成具备专业排版质感的Word与PPT文档。
随着大模型进入Agent落地期,行业竞争逻辑正在发生转变。
单纯在发布会上比拼Benchmark跑分已很难维持开发者的黏性,谁能把架构效率做到极致、用更低的实际账单支撑起Agent全天候的长循环任务,谁才能真正成为开发者工具链中的默认选项。
就在智谱开源GLM-5.3-Flash的当晚,阿里也几乎同步推出了主打极低激活参数的Qwen3.8-Flash(采用下一代Next架构),两家厂商不约而同地将发力点转向了经济型推理模型。
从最初依赖补贴打价格战,到如今通过架构创新和软硬协同压低真实推理成本,中国AI厂商正在用更务实的工程解法,争夺全球生产力底座的话语权。