GPU 之外的隐形战场:AI 时代,存储正在被重写
创始人
2026-08-26 01:31:02

进入下半年AI 行业像被按下了快进键。

6 月智谱 GLM-5.27 DeepSeekV4-Flash 与字节 Seedance2.5 接连亮相;进入8月,阿里 Qwen3.8-Max、谷歌 Gemini3.7FlashDeepSeekV4Pro 正式版、智谱 GLM-5.3 又密集登场。与此同时,DeepSeek 官宣成立专项团队攻坚 AI Agent 赛道,对标 Anthropic Claude

从模型能力到 Agent 应用,AI 的进化速度已远超基础设施的迭代周期。

另一边,云厂商在 AI 基础设施的投入也与日俱增。国际高科技产业研究机构集邦咨询的最新数据显示,2026 年全球九大云厂商合计资本开支规模将突破 8867 亿美元,同比增幅接近 90%,这些资金均投向 AI 相关基础设施建设。此外,英伟达联合华尔街巨头,承诺投入5000 亿美元建设 AI 基础设施。

国内方面,腾讯 8 月 12 日晚间公布的财报数据显示,2026 年二季度资本开支升至 528 亿元,远超预期的 321 亿元,是上年同期 191 亿元的近三倍,其中绝大部分增量流向数据中心、GPU 服务器与智算集群。东海证券最新研究报告透露,字节跳动、腾讯、阿里、百度四家合计资本开支年增速超过 80%

这种军备竞赛式的投入,直接推高了 AI 算力的密度与复杂度。中电标协数据存储专委会秘书长孙钢近期在采访中表示,AI 时代存算关系正在发生根本性变化存储正从被动的业务承载者转变为主动的效率引擎

8 20 日,阿里云飞天发布时刻一口气发布三款面向AI 场景的存储新产品——新一代全栈自研高性能并行文件存储CPFS、全球公共云首发 G3.5 KVCache 存储产品 KVCacheStore 以及业界首个为 Agent 场景设计的文件存储 AgenticFS。三款产品分别瞄准训练、推理与 Agent 落地,围绕 AI Native Agent Native 两大方向,一套面向 AI 全生命周期的存储体系正浮出水面。

重建云存储:阿里云存储打出三套组合拳

那么,面向 AI 全生命周期的存储体系,究竟该如何构建?

阿里云给出的答案是:将存储架构与 AI 工作负载深度解耦,针对训练、推理、Agent 三大核心场景,分别提供专用化的存储解决方案。

训练侧:CPFS,让 GPU 从等数据到火力全开

    首先来看训练场景。模型训练面临三大挑战。

    第一,模型迭代速度不断加快,高频率的Checkpoint 对于存储吞吐产生更大压力。Checkpoint 间隔从几十分钟缩短到数秒级,模型参数量从千亿迈向数万亿,单次写入量远超之前。

    第二,数据集规模快速增长。训练数据扩展至百 PiB,数据类型从以文本为主,走向多模态数据。特别是在自动驾驶场景,数据集动辄达到数百 PB 级,传统文件存储的架构扩展性问题成为瓶颈。Burst I/O 与高水位读吞吐成为常态,要求存储系统具备稳定的有效吞吐与低延时。海量小文件与深层目录结构,则对元数据性能提出更高要求。

    第三,冷热数据混合的模式,使得全部使用基于 SSD 的高性能存储规格,导致成本急剧上涨。企业需要持续优化存储成本。

    面对这些挑战,阿里云推出了全栈自研的并行文件存储CPFS。从后端存储到 DPU 加速通道,再到 EFC 弹性客户端,全链路基于自研技术,针对训练场景的 IO 特征构建了端到端的加速能力。

    CPFS 基于阿里云盘古分布式存储底座,采用 Scale-out 分布式架构设计,元数据与数据分离独立扩展,实现容量和性能线性扩展。在计算节点侧通过 DPU 卸载存储协议栈,构建专用的高速存储访问通道,并通过数据零拷贝,来大幅提高计算节点访问存储的性能。

    通过这些技术创新,CPFS 单文件系统可提供高达百 TB/s 级别的吞吐和亿级 IOPS,充分满足训练场景对存储的性能需求。在规模上,支持单文件系统线性扩展达百 PiB 容量、万亿级文件。在成本上,CPFS 提供多档存储规格,智能的数据生命周期管理,大幅优化存储成本。

    这些能力也已经在通义千问大模型训练中得到验证。模型启动平均耗时下降50%,峰值算力利用率提升 30%,业务承载能力翻倍。语料供给从“等数据”变为“追算力”,高质量数据处理效率实现代际跃升。

    推理侧:KVCacheStore,大模型推理的 KV Cache 加速引擎

      接下来看推理场景。

      大模型推理中,多轮对话与长上下文推理成为趋势,KV Cache 数据量爆发式增长,显存和内存所构建的有限 KV Cache 容量,直接影响缓存命中率与服务吞吐能力。具体来看有以下四大场景挑战。

      第一,长上下文推理加速。上下文窗口长度迈向1M+KV Cache 数据也在持续膨胀,需要以存代算,将 KV 卸载至高性能、弹性扩展存储层,来突破显存内存墙,降低 TTFT

      第二,多轮对话与会话迁移。会话跨节点迁移与故障切换时,KV 状态丢失需整段重算。需要将 KV 状态持久化于共享存储,实现迁移与 Failover 免重算,对话不中断,算力调度更灵活。

      第三,P/D 分离架构下,KV 需在两者间高频流转。需要通过共享存储来承接 KVCache 的中转,提供高带宽、亚毫秒级时延,消除数据搬运瓶颈。

      第四,共享前缀复用System Prompt 等公共前缀,被大量请求重复 Prefill。需要公共前缀一次写入、全局共享,多请求并发读同一份 KV,提升命中率与 GPU 利用率。

      因此,针对这些挑战,阿里云全新发布KVCacheStore作为大模型推理的 KV Cache 加速引擎。它定位为 G3.5 KVCache 存储,是全球公共云首发的 G3.5 KVCache 存储产品。

      其技术优势体现在三点:

      第一,支持高效的 KV 接口,并面向主流推理框架提供定制化 Connector,实现推理引擎与存储之间数据零拷贝,最大程度简化存储与推理平台的对接,快速形成生产力。

      第二,支持与算力的亲和性部署。从架构上 KVCacheStore 定位于 G3.5 层,可提供优于远端 G4 共享存储的性能,单计算节点可提供 40GB/s 的吞吐,通过 batch 接口达到百万 QPS。

      第三,KVCachestore 独立于算力部署,支持弹性扩容,单实例就可以满足客户千亿级 KV 的存储规模。

      在客户的 POC 验证中,KVCachestore 将缓存命中率提升了 20% 以上,极大提升了推理服务的效率

      Agent 侧 : AgenticFS , 给每个 Agent 一间 “ 独立办公室 ”

        最后来看 Agent 场景。

        Agent 时代的工作负载呈现出生命周期短、弹速极快、波峰波谷瞬时切换的特征,且数量级往往达到百万级别。传统文件系统的挂载速度、权限隔离和资源调度能力,难以支撑这种高并发、短生命周期的爆发式负载。与此同时,Agent 的普及也带来了新的安全挑战:恶意 Agent 越权访问、个别 Agent 异常行为挤占其他 Agent 资源,这些在传统 NAS 架构下几乎无解。

        阿里云的解法是 AgenticFSAgenticSpace 为单元,赋予每个 Agent 独立的命名空间、配额与性能隔离。

        具体技术优势体现在三点:

        • 百万级动态创建+ 10 QPS 挂卸载,秒级完成百万 AgenticSpace 的创建挂载,传统分钟级操作被压缩到毫秒级;

        • Access Point + 零信任鉴权,权限隔离粒度从“文件系统级”细化到“Agent 实例级”,无需为每个 Agent 单独建文件系统;

        • 容量与性能双隔离,个别异常 Agent 只消耗自己空间内的资源,不会影响其他 Agent 或平台稳定性

        AgenticFS 之外,阿里云还在存储产品的服务层做了两个 Agent 化的尝试。

        • OSS Agent是基于通义大模型构建的智能体服务,支持用户通过自然语言完成Bucket 管理、异常诊断、健康巡检、费用分析,以及对 Bucket 中视频、图片、文档等多模态数据的语义检索与直接对话。

        • CDE Agent 则是阿里云盘企业版打造的企业级 AI 数字工作室,在网盘内无缝实现文件处理与内容生成,支持多模态检索、自动总结与安全分享,全程数据不出域、权限原生继承、操作全程审计。

        三者结合,构成了从底层基础设施到上层应用交互的完整 Agent 存储闭环。

        存储的下限,决定 AI 的上限

        这样来看,阿里云此次发布的三款新品并非简单的功能叠加,而是基于阿里云存储十余年技术积淀与对 AI 场景深度理解的必然结果。

        一方面,这是阿里云存储面向AI 时代补齐的一块拼图目前,阿里云存储产品矩阵已经覆盖了对象存储、通用文件存储、高性能并行文件存储、表格存储等场景,但面向AI 推理的 KV Cache 专用存储、面向百万级 Agent 的弹性文件存储还是空白KVCacheStore AgenticFS 的出现,加上重构后的 CPFS,让阿里云存储形成了覆盖训练推理AgentAI 全生命周期的完整产品体系。

        另一方面,这也是阿里云对云存储底层架构的一次技术重构基于飞天盘古底座,存储不再是被动等待调用的仓库,而是主动参与到算力调度中:向下,打破内存与外存的物理边界,用极低时延的KV 层为 GPU 显存减负;向上,重塑文件系统的挂载与隔离机制,让文件系统本身具备微服务般的弹性与敏捷度;在底层,则通过去中心化元数据与并行 I/O 栈,让数据流速真正追上 GPU 的计算速率。这就意味着存储和算力之间的关系正在被重新定义——存储已经跳出了跟随业务做适配的被动局面,转而以 AI 原生的姿态,主动定义数据在模型全生命周期中的流转方式。

        更进一步看,存储的角色正在从被动承载走向主动编排过去,存储往往只是数据的仓库如今,CPFS 把高性能文件存储做成按需膨胀、按秒计费的弹性服务KVCacheStore 用原生 KV 接口和算力亲和部署把 KV Cache 的外溢成本打下来AgenticFS 则为百万 Agent 提供了即取即用的独立办公室当数据供给可以按需流动、按需卸载、按需隔离,业务逻辑不必再为存储瓶颈妥协。

        简言之,存储正从后台走向前台,成为决定AI 生产力上限的关键变量。如果说算力决定AI 的上限,那么,存储决定AI 的下限。当存储的下限被不断抬高,真正的竞争才会回到业务创新本身谁的场景抽象得更准,谁的模型迭代得更快,谁能让数据以最低的成本、最快的速度流经算力,谁就能在下一轮浪潮中胜出。

        相关内容

        热门资讯

        关注|面临四大瓶颈,谁能在柔性... 来源:阳光高考信息平台 从柔性存算芯片到超薄弹性介电材料,从“能感知”到“能思考”,柔性电子正在经历...
        反常识的爆款:一亿注册、千万D... 一个月前,《无畏契约:源能行动》(业内及玩家习惯称之为“手瓦”)抛出一枚重磅数据:用户注册量正式突破...
        手瓦一周年复盘:曾担心生不逢时... 一个月前,《无畏契约:源能行动》发了条公告:注册用户破亿了。往前推几个月,今年5月他们还公布过一个数...
        重庆电力上线调控核心业务AI智... 8月25日,国网重庆江津供电公司调控中心调度班班长刘嫣然,在研发投运的“调控核心业务智能查询与辅助管...
        苹果最强Mac杀到!全新Mac... 快科技8月25日消息,今日,苹果全新Mac Studio发布,可选M5 Max与全新M5 Ultra...