DeepSeek V4正式版“偷跑”:130亿参数的“轻量版”,如何靠“课后辅导”单挑Pro?

温故智新AIGC实验室

TL;DR:

DeepSeek V4-Flash 正式版低调上线,骨架没变,仅靠“后训练”魔术般的优化,Agent 能力直接逼近三个月前的旗舰 Pro 预览版。130 亿活跃参数、2840 亿总参数的小模型,硬是在各种硬核测试中跑出了让人惊叹的分数。更关键的是,它原生对齐了 OpenAI 的 API 生态,这性价比,说是向 Agent 赛道投下一枚“核弹”也不为过。

7月31日午后,DeepSeek 官网静悄悄上线了一个更新——V4-Flash 正式版开始公测。

没有发布会,没有提前造势,但如果你仔细观察那几张 Benchmark 表格,就会意识到:事情并没有那么简单。

在大模型圈,长期以来存在一个不成文的共识:参数越大,能力越强。Pro 版本负责登顶刷榜,Flash 版本负责走量赚钱,分工明确,各司其职。

但 DeepSeek 这次的操作,直接打破了这道默认的藩篱。

V4-Flash 总参数 2840 亿,激活参数仅 130 亿;而 V4-Pro 总参数 1.6 万亿,激活参数 490 亿。两者数量级相差悬殊,按常理,Flash 很难染指 Pro 的核心领地。

可事实是,这个“轻量版”在 Agent 能力测试上打出了一组惊人数据:Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 54.2 分,Cybergym 76.7 分。作为直接参照,三个月前发布的 V4-Pro 预览版在 Terminal Bench 2.0 上得分 67.9。

官方日志的表述极其克制,甚至带点“凡尔赛”的味道:“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 Flash-preview 保持一致,重新进行了后训练。”

翻译一下:技术骨架完全没动,仅仅调整了训练的后半程(训练方法、数据配比),效果就实现了跨越式迭代。这哪里是常规升级,这简直是给模型找到了训练领域的“顶级私教”,重新规划了一套高效的训练方案,直接实现“脱胎换骨”。

这个“仅”字,背后藏着一个对行业极为重要的信号:在 Agent 这个新赛道上,模型规模并非决定一切的金标准。后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。 换言之,巧练,远比苦练更重要。

Agent 暗战:DeepSeek 亮剑,生态争夺战打响

如果说 2023 年的大模型竞争是“拼通用能力”,2024 年是“拼长上下文”,那么 2026 年的关键词,毫无疑问是 Agent。

大模型不再是只会陪聊的“电子宠物”了。它需要像真正的智能体一样,自主规划、调用工具、执行复杂任务。从 Terminal Bench(终端操作)、NL2Repo(代码仓库生成)到 Cybergym(网络安全任务),这些专为 Agent 打造的新考场上,分数直接决定了模型在现实世界中的实用价值。

Agent 任务的一个显著特点就是成本极度敏感。一个需要反复调用工具、多轮推理的 Agent 任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。

DeepSeek 的算盘打得清清楚楚:把 Flash 打造成开发者和 Agent 应用的首选底座。 如果你的能力够用,价格只有 Pro 的几分之一,开发者凭什么不选择你?

更体现战略野心的是,这次 Flash 正式版原生支持了 OpenAI 力推的 Responses API 格式,并针对性适配了 Codex。

这个动作的潜台词极其清晰:“开发者们,你们在 OpenAI 生态里辛辛苦苦写的 Agent 代码,现在几乎可以零成本、零痛苦地迁移到我这里来。一样的接口,一样的体验,一半甚至更低的价格。”

这不是简单的技术跟进,这是生态层面的正面硬刚。DeepSeek 不想只做一个“便宜的替代品”,它想直接在 Agent 时代建立自己的生态位,与 OpenAI 展开正面对抗。

500 亿融资之后:技术的加速兑现

此次重磅更新,距离 DeepSeek 完成成立近三年来的首轮外部融资还不到两个月。

约一个多月前,DeepSeek 完成超 500 亿元人民币融资,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元。新一轮融资的投前估值,已经迅速拉升至 710 亿美元。

资本用真金白银在投票。创始人梁文锋此前近三年一直坚持自有资金投入,如今积极拥抱资本,信号再明确不过:DeepSeek 正在加速冲向商业化和 IPO。

此次 V4-Flash 的发布,正是融资到位后的一次重要“技术兑现”。

而在技术层面,这次更新也首次披露了 DeepSeek 在 Agent 领域的核心底牌——官方自研的 Agent Harness。这个 Harness 团队组建于今年 3 月,挂帅者崔添翼,90 后,浙大计算机出身,手里攥着 6 枚 ACM 亚洲区域赛金牌,曾在顶级量化机构 Jane Street 任职九年。

融来的钱,招来的顶级人才,正在快速转化为实实在在的技术红利。

梁文锋曾在内部说过一句值得回味的话:“AI 现在不缺品位和直觉,它缺的是持续学习的能力。投资人看 Agent,我们看怎么解决学习。”1

这个“持续学习”的工程落点,就在 Harness 上。当 Flash 用“后训练”证明了巧练的价值,当 Harness 开始着手解决“持续学习”这个终极挑战,DeepSeek 通往 AGI 的拼图正在一块块变得完整。

官方在日志末尾轻描淡写补了一句:“DeepSeek-V4-Pro 正式版将会尽快发布。”1

V4-Flash 只是前菜,真正的主菜还在路上。

Agent 战争的大幕才刚刚拉开。DeepSeek 用一个轻量模型的大幅进化,给整个行业出了一道新考题——当后训练的红利被充分挖掘,当效率的提升开始抵消参数的巨大差距,大模型的竞争逻辑,恐怕要被彻底重新书写了。

友商们,准备好答案了吗?


  1. DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战 (https://mp.weixin.qq.com/s/N0ybT7ZiRcFhqhn4fly0Uw) · 凤凰网科技 (2026/7/31) · 检索日期 2026/7/31 ↩︎ ↩︎