作者:毛烁
Cloudera各业务线高管在圆桌访谈中,凝聚出一个共识:企业已经很难再以“不计成本”的方式推进AI试验。随着AI进入实际业务,成本、治理与合规等问题开始真正摆在企业面前。
调查数据显示,95% 的企业都曾因治理、合规等问题推迟或取消AI项目。在这样的背景下,大中型企业开始重新考虑AI的部署方式,从数据、算力到工作负载,重新调整原有的技术架构。
Cloudera将这一变化概括为“The Great AI Re-Architecture”(AI大重构)。
01 AI项目开始接受ROI审查
“不计成本的试验窗口期已经结束了。”Cloudera首席执行官(CEO)Charles Sansbury这样判断。
Cloudera首席执行官(CEO)Charles Sansbury
过去几年,不少企业担心错过生成式AI的发展机会,在业务目标尚未完全明确的情况下,便开始集中采购工具和算力。项目启动初期,管理层更关注“有没有AI”“能不能尽快做出成果”,对于项目进入长期运行后的成本,以及最终能否带来实际回报,考虑得并不充分。
如今,这种情况正在发生变化。
Charles Sansbury表示,项目优先级、ROI(投资回报率)以及运行成本上限,已经被前置到企业与供应商的首次商务沟通中。客户首先需要确认两件事:项目能否解决真实的业务问题,以及企业是否有能力承担长期运行的成本。
Cloudera首席营收官(CRO)Brian Rosso在一线市场感受到的变化更加明显。他提到,一家大型制药企业曾在短短三个月内耗尽全年的云预算。最终迫使CFO暂停新增投入,并要求后续工作负载优先部署在已有的数据中心。
Cloudera首席营收官(CRO)Brian Rosso
当然,这并非是企业要放弃公有云,而是在算清长期成本之后,重新判断不同工作负载究竟适合部署在哪里。Brian Rosso认为,对于需求波动较大、需要快速扩缩容的业务,公有云依然具有优势;但对于利用率较高、需要长期稳定运行的推理任务,如果持续按需购买云资源,成本可能不断累积。
在这种情况下,自建基础设施,或者租用固定资源建设“私有AI工厂”,反而更容易控制长期支出。资源需求可以提前规划,硬件投入和后续运营成本也能够被纳入更明确的预算周期中。
从“先上AI再算账”,到在项目启动之初就明确ROI和成本边界,企业对AI的判断标准正在发生变化。AI项目正在从一次性技术试验,逐渐进入必须接受财务审查的长期运营阶段。
02 亚太企业为混合架构提供更大空间
亚太企业复杂的IT环境,为混合架构提供了更大的发展空间。
Cloudera亚太区高级副总裁林万发观察到,亚太地区的大型机构普遍保留着大量本地系统。尤其是在金融、电信和公共服务等行业,许多关键数据和核心业务仍然运行在企业自己的数据中心。在部分区域银行中,关键工作负载的上云比例甚至不足10%。
Cloudera亚太区高级副总裁 林万发
这意味着,对于这些企业而言,并不需要从零开始建设AI基础设施,而是要在既有系统之上逐步演进。监管要求、数据主权,以及过去在本地基础设施上的投入,都决定了企业很难简单地按照单一公有云的思路来部署AI。
而当AI进一步进入不同业务场景后,这种复杂性还会继续放大。
因此,企业需要解决的,是如何让不同数据、模型和计算资源协同运行。林万发表示,企业需要将本地数据中心、公有云,以及不同的AI模型连接起来。
这样一来,公有云可以承担需求波动较大的弹性工作负载,敏感数据和关键推理任务则可以保留在本地或指定区域;与此同时,企业也能够根据不同业务的实际需求灵活选择模型和计算平台,避免长期依赖单一供应商。
03 “双轨制”兼顾稳定与创新
面对大型企业复杂的IT环境,Cloudera也对产品体系进行了重新梳理,用两条不同的产品路线,分别承接企业对稳定性和创新速度的需求。
Cloudera首席产品官(CPO)Leo Brunnick介绍,公司正在采用“双轨制”的产品策略。对于银行、油气等高度重视系统稳定性的行业,Cloudera推出了代号Kona的7.3.2版本。
Cloudera首席产品官(CPO)Leo Brunnick
Kona保留了HDFS等成熟技术,并提供长达六年的长期支持,支持周期将持续到2032年。对于拥有大量历史数据和关键业务系统的企业而言,这意味着无需频繁调整底层架构,可继续使用已经得到验证的系统,按照自身业务节奏完成升级。
与之对应的,是面向创新需求的另一条产品线——代号Maui的Cloudera Anywhere Cloud。
其主要服务于需要快速采用新技术的团队,其模块化和容器化架构,可将不同的数据服务拆分。数据科学家可以根据实际需求单独部署Spark 4(未来也可以接入Spark 5),不必等待整个数据平台统一升级。
两条产品线分别对应了大型企业内部长期并存的两类需求:核心业务系统更重视稳定性和可持续性,创新团队则希望更快尝试新模型、计算框架和数据工具。前者解决“不能轻易动”的问题,后者解决“需要快速变”的问题。
在此基础上,Cloudera首席业务官兼Applied AI总经理(CBO)Abhas Ricky进一步介绍了Anywhere Cloud Marketplace和主权推理(Sovereign Inference)能力,将这种“双轨”思路延伸到AI模型的部署层面。通过与NVIDIA NIM微服务、VAST Data存储平台等进行整合,企业可以直接在数据所在的环境中运行经过优化的AI模型。
Cloudera首席业务官兼Applied AI总经理(CBO)Abhas Ricky
这一设计,考虑的是企业在实际部署AI时面临的数据迁移成本。对于海量数据而言,跨区域传输本身就需要消耗大量网络和存储资源,而敏感数据还会受到监管限制。
因此,与其把数据反复搬到模型所在的位置,不如让模型靠近数据。将模型部署在数据所在的环境中,既可以减少数据迁移,也有助于降低基础设施成本和合规风险。
04 Agent频繁调用,数据库与权限治理承压
解决了AI“部署在哪里”,企业还需要面对另一个更基础的问题:数据如何被访问,以及能否有效控制访问。
在Cloudera首席技术官(CTO)Sergio Gago看来,Agent的大规模应用将进一步放大企业数据系统面临的压力。
Cloudera首席技术官(CTO)Sergio Gago
传统BI系统通常由用户发起查询,系统返回结果后,一次访问基本就结束了。但Agent的工作方式不同。为了完成一项任务,Agent需要持续规划步骤、检索数据、验证结果并调用其他工具,一项任务在后台可能触发十几次甚至几十次查询。
这意味着,随着Agent数量增加,企业需要承受的是大量并行访问带来的数据库压力。Sergio Gago预计,如果企业内部同时运行成千上万个Agent,数据库请求量将增长一到两个数量级。
因此,企业需要进一步明确Agent的数据访问边界:可以访问哪些数据、可以返回多少内容,以及这些数据来自哪里。一旦权限控制不到位,Agent就可能将原本分散在不同系统中的敏感信息集中暴露出来,数据访问风险也会随之放大。
所以,企业需要的是一套能够在既有数据和权限边界内运行的AI架构。
Sergio Gago认为,这也是企业级AI更倾向于采用RAG(检索增强生成)的原因之一。利用RAG,企业无需将全部数据交给模型,而是可以保留原有的数据和权限体系,在模型生成回答时,根据具体任务动态检索并提供经过授权的信息。
05 从产品到交付,FDE进驻客户现场
当企业开始把AI项目当作长期生产系统来管理,供应商的角色也随之发生变化。
项目进入生产阶段后,企业除了关注软件本身的功能和性能,更关心能否把数据、模型、业务流程和基础设施整合起来,并让整个系统持续稳定地运行。
对很多企业而言,AI项目的难点,也正在于这一阶段。
模型本身并不难部署,难的是如何将模型嵌入实际业务流程。从数据准备、权限治理,到模型选择、应用开发和系统运维,每一个环节都需要专业人员参与。因此,供应商需要承担的也不再只是软件交付,而是帮助企业完成从技术验证到实际应用的落地过程。
这正是FDE(前置部署工程师)出现的原因。
Abhas Ricky透露,他牵头组建的Applied AI团队,引入了类似Palantir的打法,设立FDE角色。
这些具备机器学习和业务架构能力的工程师将直接进入客户现场,参与梳理业务流程、设计工作流,并协助客户完成系统部署。
Brian Rosso透露,一名高水平FDE在美国市场的年度综合成本高达约75万美元。