TL;DR:
谷歌昨晚突然端出三款新模型,结果开发者实测后心态崩了:Gemini 3.6 Flash前端能力一塌糊涂,被戏称“史上最差”;大家翘首以盼的3.5 Pro又双叒叕延期,谷歌只好画饼Gemini 4预训练。这波操作,网友直呼:谷歌你行不行啊?
就在昨夜,谷歌DeepMind悄咪咪地上线了三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。本以为是要给AI圈来点惊喜,没想到却成了大型翻车现场——3.6 Flash被开发者们集体吐槽为“史上最差”,从前端生成到空间推理,全线崩盘1。
实测崩盘:代码逻辑错乱,空间推理退步
到底有多差?开发者用2-shot测试它的界面生成能力,结果输出代码逻辑错乱、组件嵌套混乱、交互逻辑断裂,根本无法投入实际使用。有开发者直言:“这是我真正见过的最差结果。”这句话配上截图,在开发者社区迅速传播2。而在空间推理测试中,模型频繁出错,基础位置关系和方向判断的准确率甚至不如前代3.5 Flash。即使开启所谓的高性能“high thinking”模式,情况也没有好转2。
更尴尬的是,根据第三方综合测评Artificial Analysis,Gemini 3.6 Flash得分与3.5 Flash完全相同,表现远不如Meta Muse Spark 1.1、GLM-5.2、GPT-5.6 Luna等竞品1。有网友发现其知识截止日期并未更新,声称是2026年3月,但实际上对2025年后的内容一问三不知,简直就像“未完成的模型”2。
对比之下,此前发布的Gemini 3.5 Flash曾获得不错评价,被指比GPT-5.5快4倍,在速度和智能体控制上表现亮眼3。但这次的3.6 Flash显然是“退步比进步更明显”。
当然,谷歌也不是完全没亮点。官方数据显示,3.6 Flash在视觉和上下文基准测试上保持领先,主打“性价比”4。至于3.5 Flash-Lite,则主打速度——每秒可输出350个token1。但开发者显然不买账——毕竟,谁想要一个又快又便宜的“翻车神器”呢?
实际上,在谷歌Cloud模型文档中,Gemini 3.6 Flash等新模型已经悄然上线5。而根据Evolink的追踪页面,这次发布的3.5 Flash-Lite和3.5 Flash Cyber也填补了产品线的一些空缺6。
3.5 Pro:三度延期,玩家集体失语
不过,更让网友心塞的是,那个在I/O大会上画了饼的Gemini 3.5 Pro,居然又一次延期了!这已经是第三次跳票。据彭博社和iThome报道,因为内部测试中实际应用稳定性不佳(幻觉频繁、输出不一致),DeepMind被迫放弃原有成果,从头打造新版本78。这也解释了为什么谷歌突然拿出3.6 Flash这样的“阉割版”来填空档期。
与此同时,谷歌宣布Gemini 4已经启动预训练,并称这是“有史以来规模最大的预训练项目”,公司“对取得的进展感到非常振奋”4。但网友调侃:4.0都开始跑了,3.5 Pro还没影儿,这版本号跳跃得有点“魔幻”。
这波操作背后,用户讽刺DeepMind陷入了某种“官僚主义的指标狂热”:为了在财报和发布会上展示更高的版本号、更快的推理速度,牺牲了AI最本质的东西——真实效用1。再加上多位高层的出走,包括诺奖得主John Jumper加入Anthropic、Gemini前主管Sissie Hsiao跳槽OpenAI等7,人才流失可能也是开发进度严重滞后的一大原因。
在AGI竞赛日益激烈的当下,谷歌这手牌打得有点乱。这次发布的口碑滑铁卢,或许是一个警示:步子迈大了,真的容易扯着蛋。
-
谷歌「史上最差」AI模型发布!·新智元·ASI启示录、大卫(2026/7/22)·检索日期2026/7/22 ↩︎ ↩︎ ↩︎ ↩︎
-
Waguri_Kaoruko8的推文(2026/7/22)·检索日期2026/7/22 ↩︎ ↩︎ ↩︎
-
Google官方博客:Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber·Google Blog(2026/7/22)·检索日期2026/7/22 ↩︎ ↩︎
-
Google 模型 (Cloud文档)·Google Cloud(2026/7/21)·检索日期2026/7/22 ↩︎
-
Gemini 3.5 Pro 与 Flash 发布追踪·Evolink(2026/5/18)·检索日期2026/7/22 ↩︎
-
Gemini 3.5 Pro傳因從頭打造,再度延後推出·iThome·林妍溱(2026/7/20)·检索日期2026/7/22 ↩︎ ↩︎
-
突发叫停!Gemini 3.5 Pro难产,谷歌跌入失望陷阱·知乎(约2026/7/17)·检索日期2026/7/22 ↩︎