关于人工智能潜在风险的讨论层出不穷,而硅谷的AI拥趸们最近又多了一层新的忧虑——那些提供专有大模型的头部实验室,会不会正在扮演“特洛伊木马”的角色?
这种担忧并非空穴来风。当越来越多的初创公司与大型企业开始接入OpenAI、Anthropic等厂商的模型时,这些实验室也悄然获得了海量的商业交互数据。模型提供方不仅可能利用这些信息反哺自身业务,甚至有可能在某一刻成为客户的潜在对手。此前,风险投资人Jason Calacanis、Palantir CEO Alex Karp等人就曾发出过类似警示。
而如今,微软CEO萨蒂亚·纳德拉也在一篇令人侧目的博文中,加入了这个“预警阵营”。纳德拉直言,AI使用者正在付出一种“隐性双重成本”——表面上,他们为每一次token调用付费;而暗地里,他们还在源源不断地交出自己最核心的专有知识。
他写道:你其实在为AI付两次钱——一次是现金,一次是更有价值的筹码,那就是你必须向模型暴露的内部知识。想让模型表现越好,你输入的内容就越核心。
纳德拉认为,最危险之处在于,企业其实是在一点一滴地教会模型,自己这门生意到底是怎么玩的。
他进一步指出:模型会从交互记录、提示词写法、调用工具的方式,甚至是在出错时人为纠正的行为中持续学习。每一次修正,最终都会内化为模型供应商自身的“经验积累”。而这些,恰恰是“竞争对手花多少钱都买不到的东西”,如今却被企业用户主动拱手送出。
在纳德拉看来,这里存在一个明显的不对等。如果AI公司有权利自由抓取互联网上的公开数据来训练模型,那反过来,企业也理应有权对这些模型进行“蒸馏”——也就是利用模型的输出结果,反推其逻辑,并用这些认知去训练一个更轻量、更可控的替代模型。
今年2月,Anthropic曾公开指责某开源项目向Claude发送数百万条请求进行“偷师”,并呼吁政府强化出口管制。而纳德拉的立场则更为直接:模型开发商不能两头都占——一边拿全球公开数据喂饱自己,一边又对他人做同样的事设卡设限。
他写道: 尽管模型方声称在公开数据上训练是推动创新的必要手段,但讽刺的是,他们转头就对数据蒸馏施加各种限制性条款。
纳德拉尤其点名批评“模型方保留从客户使用和交互数据中学习”的条款,认为这是最需要警惕的地方。
而他提出的出路,也颇具其身份色彩——作为大型云服务商的掌舵人,他建议企业主动“保留”自己的数据主权,包括提示词、反馈、修正记录等全部内容。具体操作上,他鼓励企业在云端构建自己的“专有学习环境”(当然,这也可以理解为对Azure的一种隐晦推介),并搭建设计所谓的“编排层”——也就是一层能灵活切换不同模型提供方的软件中间层,避免被单一供应商绑定。目前,类似AI“网关”的工具已逐渐流行,正是为满足这一需求而生。
通篇读下来,纳德拉虽未直接提及“开源”二字,但字里行间不难看出他对开源路线的倾向。然而,这还不是唯一的潜台词。
事实上,不少大型企业尽管广泛使用云服务,但仍保留着自己的数据中心。它们正开始尝试在本地部署开源模型——业内俗称“本地化部署”。Solo.io创始人兼CEO Idit Levine也印证了这一变化。她观察到,很多客户在体验过专有模型后,开始反问:能不能用开源模型跑在本地?成本更低,还能完成大模型九成以上的工作。
Levine的公司专注网络和安全软件,其技术去年已被Linux基金会选为Agent Gateway项目的底层支撑,客户包括T-Mobile、ADP、SAP等巨头。在她看来,本地开源模型正在成为企业AI应用的下一个主战场。
这并非孤例。Vercel和OpenRouter等平台也发现了类似趋势——前者以网站托管闻名,近期新增了AI模型切换功能;后者则帮助开发者在不同模型间路由请求。数据显示,上个月通过Vercel网关的流量中,开源模型已占到29%。
耐人寻味的是,纳德拉本人所在的微软,恰恰是OpenAI和Anthropic的重要投资方。他此番公开提醒企业谨慎对待专有模型,究竟会否引发企业客户大规模向本地开源方案迁移,无疑是一个值得持续追踪的信号。
正如纳德拉所写的那句话: 在你使用智能的过程中,你也在创造智能。而这份由你创造的智能,理所当然属于你自己。