DeepSeek V4-Flash正式公测:Agent能力全面爆发,AI工程师“正式上岗”

温故智新AIGC实验室

TL;DR:

DeepSeek V4-Flash正式版API来了,9项基准测试全面碾压预览版,Agent能力直接拉满。AI不再只写代码,开始像工程师一样操作终端、分析仓库、完成全栈任务。更关键的是模型结构没变,全靠后训练优化——看来“后天努力”比“天生骨架”更重要啊!

7月31日,DeepSeek突然扔出一枚“重磅炸弹”:V4-Flash正式版API公测上线。这次更新最亮眼的关键词——Agent能力大幅跃升

如果说之前的AI还是个刚毕业的实习生,只会写些零散的函数,那么现在这位“实习生”已经偷偷考了一堆证书,开始像资深工程师一样全面接管项目了。1

9项测试成绩单:Agent能力全面爆发

DeepSeek这次没藏着掖着,直接公布了9项基准测试的完整成绩。从终端操作到代码仓库分析,从网络安全对抗到全栈开发,覆盖面相当广。

其中最顶的是Terminal Bench 2.1,82.7分。这意味着模型在终端环境下的执行能力已经相当成熟——能理解复杂的命令行操作、编写脚本、调试错误,活脱脱一个“AI运维工程师”。

Cybergym拿下76.7分,展示了网络安全对抗能力;DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,说明它不仅能写单个函数,还能搞定从前端到后端的完整开发链路。

一句话总结:AI不再只是“写代码的工具”,而是开始真正“干工程”了。

后训练的秘密:骨架不变,灵魂升级

一个特别值得关注的细节:V4-Flash-0731的模型结构和尺寸与Preview版完全一致,只是重新进行了后训练。

什么意思?就是硬件没换,但软件系统升级了。这就好比同一个班级的两个同学,大脑结构一样,但一个通过更高效的学习方法突然成绩飙升。后训练,就是AI的“高效学习方法”。

这给整个行业一个明确信号:在Agent能力这条赛道上,后训练策略的优化空间依然巨大。不一定要通过堆参数、扩大模型来提升性能,精细的后训练调优同样能带来质的飞跃。

AI工程师时代:是时候重新定义“写代码”了

从Terminal Bench到Cybergym,从DeepSWE到Toolathlon,这些基准测试的名字本身就揭示了一个趋势:AI的能力评测,正在从“写一段代码”进化到“完成一个工程任务”。

DeepSeek-V4-Flash正式版在多项Agent基准上远超V4-Pro-Preview,释放了一个明确信号——后训练时代的竞争焦点,已经从模型规模转向了Agent能力的深度优化。

当AI能够熟练地操作终端、分析代码仓库、进行网络安全对抗、完成全栈开发任务时,我们或许正在见证一个新时代的开启:AI不再只是代码助手,而是成为了真正的AI工程师。

而DeepSeek,正在这条路上跑在最前面。

当然,这次升级仅限于V4-Flash的API接口。V4-Pro的用户和APP/Web端用户暂时不受影响。但DeepSeek表示V4-Pro正式版“将尽快发布”。考虑到Flash版已经表现出如此强势的Agent能力,Pro版会强到什么程度?值得期待。

但有一个问题摆在我们面前:当AI开始像工程师一样工作,程序员们是否该考虑升级自己的技能树了?也许未来,我们的工作不是写代码,而是指挥AI写代码。这画面,好像也挺带感的。


  1. 刚刚,DeepSeek-V4-Flash正式版API公测上线·CSDN·梦依丹(2026/7/31)·检索日期2026/7/31 ↩︎