7 月 21 日,谷歌新的大模型终于出炉了。
不过没有发布会,没有直播,官方悄咪咪发了个推,上了个页面就完事了。
是不是感觉有点敷衍,因为发布的不是大家盼了好久的 Gemini 3.5 Pro,而是 3 款轻量模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。
不是……明明 5 月 I/O 开发者大会上,亲口承诺 6 月就上旗舰 Pro 模型,这都7 月末了,连个影儿都没有,也是 AI 纪元的新型“大记忆消失术”了!
事已至此,就看看这 3 款模型表现到底咋样呗。
首先是这次主推的 3.6 Flash,谷歌宣传主打同成本下效果更强。
官方给出数据,3.6 Flash 的输出 Token 消耗比前代产品降低 18%,虽说不是特别明显的提升,但这意味着用它干活,要比以前好用,至少没那么啰嗦,用最快的路径完成交代它的任务,这不省下的就是赚到的。
顺带输出单价降了,从 9 美元砍到 7.5 美元/百万 Token,反正怎么省钱怎么来。
代码基准测试上,DeepSWE 从 37% 涨到 49%,毕竟代码生成的需求是急剧增长的,这方面的能力提升和贴近现实生产工程的场景需求,无疑是优化重点。
单看纸面数据,像是一次均衡升级,但实测后不对劲了。
根据 Artificial Analysis 测试的数据,3.6 Flash 综合智能评分和上代 3.5 Flash 完全持平,本质上只优化了推理链路,模型底层理解能力没有提升,虽然完成任务消耗的算力成本更低,但解决复杂问题的上限丝毫没有上涨。
翻译翻译就是,变便宜了,但智力没涨……
X 上也有用户实际分享了不同应用场景下,3.6 Flash 的表现,只能说一言难尽了……
说白了,这波 Gemini 升级优化的不是模型智商,是推理效率。它学会了少说废话、少走弯路,完成同样的简单任务,消耗的算力更少、更省钱。
但要是指望它能搞定更复杂的事,比如长链条代码重构、复杂多模态创作、深度逻辑推演,抱歉,跟以前一样拉胯。
可不谈智能的情况下谈省钱,这妥妥的伪命题啊……
省 Token 是真省,笨也是真笨。简单批量任务用着划算,一旦涉及复杂逻辑,就得反复提示、多轮修正,看似单次便宜了,总调用成本反而更高,离了大谱!
另一款 3.5 Flash-Lite,定位更极致:便宜,快,吞吐量大。
价格不用问,量大管饱,输入 0.3 美元、输出 2.5 美元/百万 Token,算是直接干到地板价了。
代价也很明显,模型能力大幅裁剪,上下文深度、逻辑复杂度都砍了一刀,更适合干批量摘要、简单检索这种流水线粗活。
不过,总比 3.1 Flash-Lite 聪明一些。
实话说,个人觉得这就是专门给海量标准化任务准备的“算力耗材”,跟智能两个字基本不沾边。
至于 3.5 Flash Cyber,这款模型其实和普通用户没啥关系。
它专为代码漏洞扫描微调,仅对政府、可信企业内测开放,料想谷歌也是在 AI 安全防范这套叙事里比较严谨,生怕这款模型被用来挖掘攻击漏洞,所以严格锁死准入门槛。
看下来,3.5 Flash Cyber 更像是补足安全赛道的点缀产品,谈不上核心竞争力,也撑不起大众口碑。
至于表现究竟如何?普通用户测不到,在比较知名的 CyberGym 基准上,官方表示 3.5 Flash Cyber 属于具有竞争力的水平,咱就当看个热闹吧。
所以,说了这么多,其实大家最关心的问题是:还能等到 Gemini 3.5 Pro 吗?
据彭博社等多家科技媒体的报道,3.5 Pro 缺陷的原因大概率是因为其代码生成与智能体规划能力不达标。
在企业付费场景里,代码、自主 Agent 是商业价值颇高的赛道,客户愿意为能独立完成工程重构、自动化运维的模型支付高额服务费。
据说,在谷歌多轮内部测试中,3.5 Pro 在代码基准、长程工具调用上始终达不到谷歌内部及格线,即便迭代多版训练数据集,提升幅度依旧远低于预期,最终只能跳票。
这么一看,谷歌面临的状况还蛮棘手的,高端客户一直在流失,自家旗舰又迟迟交不出货,除了拿低价 Flash 模型守着中低端盘子,好像也没别的办法。
谷歌这边,没准也是因为关注到舆论,大家都在抱怨旗舰跳票,官方工作人员就顺势放了个消息:Gemini 4 已经启动史上最大规模预训练。
这……谷歌你这浓眉大眼的,怎么也学会画饼了!
当下的产品拿不出手,就用下一代的远期预期安抚资本市场和用户。
只能说,这种操作硅谷大厂玩得轻车熟路,但远水救不了近火,而且用多了,只会越来越消耗大家的信任。
按道理说,谷歌做 AI 大模型,不应该拉垮。
它是 Transformer 的诞生地,是深度学习时代的王者,DeepMind 做出过 AlphaGo 这种惊艳全世界的成果。
没人会怀疑谷歌的技术底蕴,可一手好牌打成今天这样,旗舰跳票、人才流失、市场份额被蚕食,确实让人唏嘘。
此前,网上流传 Anthropic 创始人说 Kimi 蒸馏了他们尚未开发完成的模型,成为大家的笑谈。
实在不行,不如让 Gemini 直接蒸馏 Kimi K3 吧,这样起码模型表现更好些。
毕竟 AI 时代,没有永远的王者,菜就是原罪。
深耕十余年的科技媒体,近千万读者的兴趣栖息地,每日跟踪科技、数码、AI、新能源、热点等重磅内容,专注于每日为大家提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注@科技狐!