谷歌连发三款AI模型,网友却笑出了声:这波是“省钱省到智商上了”?

温故智新AIGC实验室

TL;DR:

Google 一口气发布了 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,口号喊的是“更省、更快、更强”。 结果旗舰模型 3.5 Pro 直接“难产”,新模型被第三方锤爆“智商原地踏步”,性价比甚至不如对手。 网友锐评:谷歌这波操作,像极了考试前说自己没复习,结果真考砸了还嘴硬的学渣。


“如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。”这是最近网友对 Gemini 最扎心的一句调侃。

按理说,公司发新模型,就是来打脸这种调侃的。可就在刚刚,Google 一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。多少有种“他们都不看好你,可偏偏你最不争气”的既视感。1

三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的 3.5 Flash Cyber。官方博客的措辞也相当眼熟——「更高效」「更聪明」「为大规模 AI agent 而生」,一句不落。

只不过,实际体感却冰火两重天。

主角登场:3.6 Flash,干同样的活,废话更少

先说头牌,3.6 Flash。官方给的定位就俩字——「主力」(workhorse),干活模型。它最大的卖点就一个字:

省 token 省到你心坎里。3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE 这类场景上甚至能省到 65%1。用大白话讲就是:干同样的活,废话更少,绕路更少,账单更薄

价格也确实降了。输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——上一代 3.5 Flash 输出可是 9 美元,这波直接砍到 7.5。又快又省,光看账本,确实漂亮。

基准测试上,官方摆出了一整排数据:DeepSWE 从 37% 提升到 49%,MLE Bench 从 49.7% 拉到了 63.9%1。知识截止日期也终于从 2025 年 1 月推进到了 2026 年 3 月,老黄历总算翻篇了

看起来,一切都在变好?

小弟逆袭,画风突变:3.5 Flash-Lite 和 Cyber

第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打「快」和「便宜」。价格简直是白菜价——输入 0.3 美元、输出 2.5 美元每百万 token1。更骚的是,它支持调「推理档位」,低配活儿开最低档,碰上难题就把思考档位往上拨。

最有意思的是,这个「小弟」在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。

最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。不过我们暂时也用不上——考虑到「找漏洞」这种能力是把双刃剑,Google 也学 Anthropic 玩起了安全叙事,把它锁得死死的,只对「可信合作伙伴」限量开放。

等等,说好的 3.5 Pro 呢?

看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?

官方口径是「正在和合作伙伴测试」,但背后的故事,可能没那么体面。

据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训1

你以为这就完了?Gemini AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了 Gemini 4,声称他们已经启动了史上最雄心勃勃的预训练。

这操作你品,你细品。放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。这就好比你家餐厅招牌菜做糊了,服务员跑过来跟你说:“别急,我们明年开个米其林三星。”

网友开喷:又贵又笨,Flash 的招牌要砸了?

今年 5 月,Gemini 3.5 Flash 刚发布时,曾一度凭借「中杯价格、大杯性能」让业界眼前一亮23。这才过了两个月,3.6 Flash 就在智商上原地踏步。

第三方评测机构 Artificial Analysis 直接补刀:「3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步1

价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。这定位,属实有点尴尬

X 网友的吐槽更是精准打击:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5 这一票对手。直呼简直烂透了。1

网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合对于主打「性价比」的 Flash 系列来说,等于自砸招牌。1

实测派也来补刀。网友 Balder 更是直接开团:这三个模型性能全比之前的 3.5 Flash 差。基础解码就有毛病,中文选词经常很离谱,经常记忆混乱。他甚至上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。1

而另一边,OpenAI 的 Tibo 刚刚发话:由于周活跃用户达到 1000 万,Codex 的付费用户额度重置了。这对比,这落差,还有人记得大明湖畔的 Gemini 吗?1

写在最后:谷歌,你的科技树是不是点歪了?

简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token 的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。1

这很难不让人好奇:是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?

反正 Gemini 4 的预训练都开跑了。2026年下半场的AI军备竞赛已经打响,留给谷歌证明“我能行”的时间,真的不多了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

引用