2026年7月31日,七月的最后一天,DeepSeek在API文档更新日志中悄然宣布——DeepSeek-V4-Flash正式版API开启公测。消息一出,DeepSeek迅速冲上知乎热搜第一。
这款定位“高性价比”的轻量级模型,在此次升级后展现出令人意外的Agent能力——9项基准测试全面超越自家先发的V4-Pro预览版。用网友的话说:“倒反天罡了属于是。”

▲ DeepSeek-V4-Flash正式版9项基准测试成绩,多项指标远超V4-Pro预览版
一组关键数字:总参数284B、激活仅13B;支持100万Token超长上下文;API定价输入1元/百万Token、输出2元/百万Token;Terminal Bench 2.1得分82.7,DeepSWE从7.3分暴涨至54.4分,性能提升超6倍。
“便宜版”干翻“旗舰版”,这事儿有点离谱
今年4月24日,DeepSeek发布V4预览版时,同时推出了两款MoE模型。V4-Pro拥有1.6万亿总参数、每次激活49B参数,定位性能天花板;V4-Flash则只有284B总参数、每次激活13B参数,主打低成本。两者均支持100万Token上下文。
按照常理,Pro版应该全方位碾压Flash版。但今天正式版上线后,剧情反转了——Flash正式版的Agent能力全面超越了Pro预览版。官方干脆在更新日志中直接写明:基准测试表现“远超DeepSeek-V4-Pro-Preview”。
一个激活参数仅130亿的轻量模型,在Agent能力上跑赢了参数规模大一个数量级的Pro预览版。这在AI圈引发了一个讨论:后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。
9项基准测试:从终端到全栈,AI开始像工程师一样工作
DeepSeek此次直接亮出了9项基准测试的完整成绩单。这组数据覆盖了从终端操作到代码仓库分析、从网络安全到全栈开发的广泛维度。
| 基准测试 | 得分 | 说明 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 终端操作与命令行任务 |
| Cybergym | 76.7 | 网络安全对抗能力 |
| Toolathlon verified | 70.3 | 工具调用基准 |
| DSBench-FullStack | 68.7 | 全栈开发测试(内部) |
| DSBench-Hard | 59.6 | Coding Agent难题测试(内部) |
| NL2Repo | 54.2 | 代码仓库理解与生成 |
| DeepSWE | 54.4 | 软件工程任务 |
数据来源:DeepSeek官方更新日志
其中Terminal Bench 2.1以82.7分领跑,意味着模型在终端环境下的任务执行能力已经相当成熟——能够理解复杂的命令行操作、编写脚本、调试错误。DeepSWE从预览版的7.3分暴涨至54.4分,性能提升超过6倍。
DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,说明模型不仅能写单个函数,还能胜任从前端到后端的完整开发链路。
从Benchmark成绩来看,DeepSeek-V4-Flash正式版在多项Agent基准上的表现已经逼近Opus 4.8。海外模型评测机构Artificial Analysis在7月31日更新的智能指数测试中,给予V4-Flash-0731(最高推理档位)50分,在同类可比模型中明显高于平均水平——可比模型的中位数为17分。
身板没变,变的是“做事的方式”
这次升级有一个值得注意的细节:DeepSeek-V4-Flash-0731的模型结构和尺寸与Preview版保持完全一致,仅重新进行了后训练。
底座没有变,变的是“后天教育”。可以把基础训练理解成上学,后训练更像入职后的专项练习——模型原本已经会写代码、读文档,现在反复练习怎么拆解任务、选择工具、发现错误,以及如何把一件事情从头做到尾。身板没变,做事的习惯变了。
这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间依然巨大。同样的模型架构,经过更精细的后训练调优,就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。
DeepSeek-V4在长上下文效率上也给出了激进的优化:在100万Token场景下,其单Token推理计算量仅为V3.2的27%,KV Cache占用降至约10%。
价格只有Claude的1/90,OpenAI同一天宣布降价
V4-Flash的API定价维持不变:输入1元/百万Token,输出2元/百万Token。输入命中缓存的情况下更是低至0.2元/百万Token。
作为对比,有测算显示V4-Flash的价格只有Claude的1/90。即便与刚降价的GPT-5.6 Luna相比,V4-Flash的费用仍然少了一半以上。
就在同一天,OpenAI宣布GPT-5.6 Luna的API价格下调约80%,Terra降价20%。业内将此解读为被国产大模型的低价策略倒逼。
但价格战打到今天,API调用成本似乎已不再是开发者选用模型的决定性因素——真正稀缺的是能交付的Agent能力。DeepSeek-V4-Flash正式版用更便宜的价格交出了更强的干活能力,证明了一件事:低价不等于低能。
原生支持Responses API,适配Codex
除了基准成绩的飞跃,正式版V4-Flash在工程适配上也有重要更新——原生支持OpenAI的Responses API格式,并针对性适配了Codex。
Responses API是OpenAI力推的新一代API格式,相比传统的Chat Completions,它更适合Agent场景——支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。对Codex的适配则瞄准了代码生成与软件开发这一垂直场景。
现在,开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中,将DeepSeek配置为模型提供方。开发者无需修改Base URL即可切换模型。

▲ DeepSeek-V4-Flash正式版Agent-能力大幅增强
谁在用?用在哪?
AI Agent开发者。 V4-Flash在Terminal Bench、NL2Repo、Toolathlon等Agent基准上表现突出,适合构建需要工具调用和多步骤执行的智能体。
软件工程师与编程场景。 DeepSWE从7.3分暴涨至54.4分,DSBench全栈测试68.7分,代码修改、仓库理解和端到端开发能力大幅增强。
成本敏感的企业用户。 输入1元/百万Token、输出2元/百万Token的定价,让大规模API调用不再成为预算瓶颈。
需要长上下文的场景。 100万Token上下文窗口,适合塞进大份文档或整个代码项目。
常见问题解答
V4-Flash正式版和预览版有什么区别?
模型架构和参数规模完全一致(总参数284B、激活13B),仅重新进行了后训练,主要改善代码修改、工具调用和多步骤任务执行等Agent能力。简单说:身板没变,做事的方式变了。
价格是多少?
输入1元/百万Token,输出2元/百万Token。输入命中缓存仅0.2元/百万Token。
在哪里可以使用?
目前仅限API接口,开发者使用deepseek-v4-flash名称调用即可。APP端和网页端暂未更新。
V4-Pro正式版什么时候来?
DeepSeek表示V4-Pro正式版将“尽快发布”。有传闻称可能在8月初上线。
支持Responses API吗?
支持。V4-Flash正式版原生支持Responses API格式,并已针对Codex进行优化适配。
Agent战争的大幕刚刚拉开
如果说2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,那么2026年的关键词,毫无疑问是Agent。Agent能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。
DeepSeek-V4-Flash正式版的上线,用284B参数、13B激活的轻量级体量,证明了后训练优化可以比堆参数更具性价比。有网友评论:“这还只是Flash版,真不敢想象V4-Pro会有多强!”
对开发者而言,价格战比拼的是入局门槛,而模型的Agent能力比拼的才是智能的天花板。当284B的Flash版在多项Agent基准上逼近Opus 4.8,大模型的门槛,已经被抬到了一个新的位置。
一句话总结:DeepSeek-V4-Flash正式版于2026年7月31日API公测上线,284B总参数(13B激活)、100万Token上下文,9项Agent基准全面超越V4-Pro预览版,API定价输入1元/百万Token、输出2元/百万Token。适合 AI Agent开发者、软件工程师、成本敏感型企业用户 重点关注。
了解更多:访问 DeepSeek API文档 或查看 官方更新日志
© 版权声明
© 本站文章版权归 众享AI 所有,未经许可禁止转载。
相关文章
暂无评论...



