从屠榜大佬到“北美豆包”,Gemini 这一年经历了什么?

温故智新AIGC实验室

TL;DR:

去年还是 AI 圈的当红炸子鸡,今年直接沦为“北美豆包”。数学题画大便,知识库停在2025年1月,写代码只会给情绪价值。背后是谷歌各部门为了抢地盘互相使绊子,算力优先给氪金用户,顶级人才纷纷跳槽去赌原始股。虽然最近出了更快的3.6 Flash,但跟对手比还是差了口气。谷歌已经开炼 Gemini 4,能不能翻盘就看这波了。

去年的 Gemini 2.5 Pro,可以说是 AI 圈的“别人家孩子”:知识广博、文字有活人感、测试榜单上霸榜常客。那时候提起谷歌 AI,大家眼里都是敬佩。
但到了今年,画风突然变得抽象起来——和它聊数学问题,结果一转头出现了大便;让它画张海滩的照片,它直接给用户扣上了“恋童癖”的帽子1。因为这些迷惑发言,Gemini 在互联网上被戏称为“北美豆包”——没错,就是那个经常语出惊人的国产 AI 豆包的北美分包。

模型风评急转直下,人才也在加速流失。两年前谷歌花了 27 亿美元才挖回来的 Transformer 作者之一,如今脚底抹油投入了 OpenAI 的怀抱2;在 AlphaFold 里默默干了九年的诺贝尔奖得主,也被曝和 Anthropic 眉来眼去3。顶级人才用脚投票,说明谷歌的吸引力正在减退。

原本大家盼星星盼月亮,等着 Gemini 3.5 Pro 发布来一雪前耻,结果从五月等到七月迟迟没动静。前几天终于有消息了,端上来的却不是旗舰 Pro,而是主打“实惠”的 Gemini 3.6 Flash4。这个模型能力如何?看官方对比就知道:它挑的对手是 GPT-5.6 Luna 和 Claude Sonnet 5——都是各家的中端型号,而不是最顶级的 Fable 或 GPT-5.6 Sol。光是对标对象就能看出谷歌的预期——它根本就没打算跟顶级模型过招。

在编程和 Agent 能力上,Gemini 更是掉队得厉害。各大排行榜的第一页,你可能都翻不到它的名字1。有开发者吐槽,让 Gemini 做项目迁移,结果它光顾着提供情绪价值,好话说了一大堆,代码是一点没改1。说白了,Gemini 深谙职场之道:活可以不干,但不能让用户不开心。

但 Gemini 也并非一无是处,它的世界知识广度依然很强。就连 DeepSeek 都在论文里老老实实承认,在知识广度上不如 Gemini1。问题是,Gemini 的内置知识库只更新到了 2025 年 1 月——也就是说,这一年半里发生的事它一概不知。你问它 Claude 3.7,它脑子里只有 3.5,然后开始一本正经地胡说八道。想让它知道新东西就得开联网搜索,但搜索一开,模型又容易因为吃进去太多资料而能力下降,一根筋变成两头堵。

谷歌内部:所有人对所有人的“战争”

说到底,Gemini 表现拉胯的根本原因,是谷歌庞大的 AI 版图里各个山头都在各自为战。

和 OpenAI、Anthropic 这些纯粹的大模型公司不同,Gemini 对谷歌来说从来不止是一个聊天机器人。它既是 DeepMind 手里的前沿模型,也是 Google Search 守住搜索入口的武器,还是 Google Cloud 卖给企业客户的 API,还要塞进 Android、Chrome、Workspace、Pixel、Google Home……每条业务线都想把 AI 变成自己的“下一代入口”,每个团队都觉得自己手里的场景最重要。

结果就是内部摩擦不断。据 The Information 报道,谷歌 AI Labs 做出了 NotebookLM,结果惹恼了 Gmail 和 Google Docs 的同事——他们认为这是在抢自己的活儿,甚至一度考虑过关停 NotebookLM1。Google Cloud 团队和 DeepMind 团队也干过一场,Pixel 的手机团队想做点 AI 功能,也被要求不能和 Gemini 助手形成竞争1。公司大到一定程度,部门边界就成了楚河汉界,每个人都紧紧捂着手里的那点场景。

这种内耗甚至影响到了算力分配。按理说谷歌最不应该缺的就是算力:有自己的 TPU、有云、有数据中心,甚至还把 TPU 卖给 Anthropic、Midjourney 这样的外部公司。但商业和科研怎么平衡成了大问题。不少 AI 研究员抱怨,公司更愿意把算力分给付了钱的“氪金用户”,自己人申请算力却要层层审批走流程,以至于有些研究员发现不如离职自己创业,搞算力反而更快5

薪酬也是留不住人的原因之一。作为市值超过 4 万亿美元的巨头,谷歌给顶级人才的薪酬大多是限制性股票。这股票能赚钱不假,但想再翻几倍可就难了。而对面 OpenAI 和 Anthropic 都在悄悄准备上市,如果能拿到原始股,上市后很可能实现财富自由——比起在大厂等着股价缓慢爬升,一步到位岂不更香?6

谷歌的反击:中训练与 Gemini 4

当然,谷歌也意识到了这些问题。前段时间组织架构做了调整,在常规的预训练和中训练之间加了一个“中训练”团队,专门用来强化模型的编程能力1。新发布的 Gemini 3.6 Flash 虽然智力评分不太亮眼(在 Artificial Analysis 的 Intelligence Index 上只得了 50 分,落后于 Claude Fable 5、GPT-5.6 Sol、Kimi K3 等4),但速度很快,并且确实降低了任务成本——输出 Token 消耗减少了 17% 到 65%4。更重要的是,谷歌已经正式宣布开始了 Gemini 4 的预训练4,并表示要用它来重铸荣光。

那么,Gemini 能否王者归来?现在还不好说。但有一点值得注意:即便在这些乱象之下,Gemini 写出来的文字依然有一种难得的“活人感”——在这个人人都在卷 Coding 能力的时代,这种会聊天、有温度的能力反而变得稀缺1。或许,这就是谷歌 AI 最后那根稻草。


引用


  1. 微信公众号“差评X.PIN”·去年还超神的Gemini,怎么没声音了?·作者:早起(2026/7/24)·检索日期2026/7/24 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  2. The New York Times·Google Fires AI Researchers·(2022/5/2)·检索日期2026/7/24 ↩︎

  3. Financial Times·Google’s top AI executive seeks the profound over profits and the prosaic·(2025/??)·检索日期2026/7/24 ↩︎

  4. 36氪·新模靠边站,谷歌Gemini 4要来了,公司史上最大炼模启动·(2026/7/22)·检索日期2026/7/24 ↩︎ ↩︎ ↩︎ ↩︎

  5. StartupFortune·Midjourney’s TPU Regret Is a Warning for AI Startups·(?)·检索日期2026/7/24 ↩︎

  6. X(Twitter)·@akshen121·关于薪酬的推文·(?)·检索日期2026/7/24 ↩︎