DeepSeek V4-Flash正式版上线:284B参数干翻自家Pro预览版,价格只有Claude的1/90

AI工具快讯1个月前发布 众享AI
30 00

2026年7月31日,七月的最后一天,DeepSeek在API文档更新日志中悄然宣布——DeepSeek-V4-Flash正式版API开启公测。消息一出,DeepSeek迅速冲上知乎热搜第一。

这款定位“高性价比”的轻量级模型,在此次升级后展现出令人意外的Agent能力——9项基准测试全面超越自家先发的V4-Pro预览版。用网友的话说:“倒反天罡了属于是。”

DeepSeek V4-Flash 九项基准测试成绩

▲ DeepSeek-V4-Flash正式版9项基准测试成绩,多项指标远超V4-Pro预览版

一组关键数字:总参数284B、激活仅13B;支持100万Token超长上下文;API定价输入1元/百万Token、输出2元/百万Token;Terminal Bench 2.1得分82.7,DeepSWE从7.3分暴涨至54.4分,性能提升超6倍

“便宜版”干翻“旗舰版”,这事儿有点离谱

今年4月24日,DeepSeek发布V4预览版时,同时推出了两款MoE模型。V4-Pro拥有1.6万亿总参数、每次激活49B参数,定位性能天花板;V4-Flash则只有284B总参数、每次激活13B参数,主打低成本。两者均支持100万Token上下文。

按照常理,Pro版应该全方位碾压Flash版。但今天正式版上线后,剧情反转了——Flash正式版的Agent能力全面超越了Pro预览版。官方干脆在更新日志中直接写明:基准测试表现“远超DeepSeek-V4-Pro-Preview”。

一个激活参数仅130亿的轻量模型,在Agent能力上跑赢了参数规模大一个数量级的Pro预览版。这在AI圈引发了一个讨论:后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应

9项基准测试:从终端到全栈,AI开始像工程师一样工作

DeepSeek此次直接亮出了9项基准测试的完整成绩单。这组数据覆盖了从终端操作到代码仓库分析、从网络安全到全栈开发的广泛维度。

基准测试得分说明
Terminal Bench 2.182.7终端操作与命令行任务
Cybergym76.7网络安全对抗能力
Toolathlon verified70.3工具调用基准
DSBench-FullStack68.7全栈开发测试(内部)
DSBench-Hard59.6Coding Agent难题测试(内部)
NL2Repo54.2代码仓库理解与生成
DeepSWE54.4软件工程任务

数据来源:DeepSeek官方更新日志

其中Terminal Bench 2.1以82.7分领跑,意味着模型在终端环境下的任务执行能力已经相当成熟——能够理解复杂的命令行操作、编写脚本、调试错误。DeepSWE从预览版的7.3分暴涨至54.4分,性能提升超过6倍

DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,说明模型不仅能写单个函数,还能胜任从前端到后端的完整开发链路。

从Benchmark成绩来看,DeepSeek-V4-Flash正式版在多项Agent基准上的表现已经逼近Opus 4.8。海外模型评测机构Artificial Analysis在7月31日更新的智能指数测试中,给予V4-Flash-0731(最高推理档位)50分,在同类可比模型中明显高于平均水平——可比模型的中位数为17分。

身板没变,变的是“做事的方式”

这次升级有一个值得注意的细节:DeepSeek-V4-Flash-0731的模型结构和尺寸与Preview版保持完全一致,仅重新进行了后训练

底座没有变,变的是“后天教育”。可以把基础训练理解成上学,后训练更像入职后的专项练习——模型原本已经会写代码、读文档,现在反复练习怎么拆解任务、选择工具、发现错误,以及如何把一件事情从头做到尾。身板没变,做事的习惯变了。

这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间依然巨大。同样的模型架构,经过更精细的后训练调优,就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。

DeepSeek-V4在长上下文效率上也给出了激进的优化:在100万Token场景下,其单Token推理计算量仅为V3.2的27%,KV Cache占用降至约10%。

价格只有Claude的1/90,OpenAI同一天宣布降价

V4-Flash的API定价维持不变:输入1元/百万Token,输出2元/百万Token。输入命中缓存的情况下更是低至0.2元/百万Token。

作为对比,有测算显示V4-Flash的价格只有Claude的1/90。即便与刚降价的GPT-5.6 Luna相比,V4-Flash的费用仍然少了一半以上。

就在同一天,OpenAI宣布GPT-5.6 Luna的API价格下调约80%,Terra降价20%。业内将此解读为被国产大模型的低价策略倒逼。

但价格战打到今天,API调用成本似乎已不再是开发者选用模型的决定性因素——真正稀缺的是能交付的Agent能力。DeepSeek-V4-Flash正式版用更便宜的价格交出了更强的干活能力,证明了一件事:低价不等于低能

原生支持Responses API,适配Codex

除了基准成绩的飞跃,正式版V4-Flash在工程适配上也有重要更新——原生支持OpenAI的Responses API格式,并针对性适配了Codex

Responses API是OpenAI力推的新一代API格式,相比传统的Chat Completions,它更适合Agent场景——支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。对Codex的适配则瞄准了代码生成与软件开发这一垂直场景。

现在,开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中,将DeepSeek配置为模型提供方。开发者无需修改Base URL即可切换模型。

DeepSeek V4-Flash 九项基准测试成绩

▲ DeepSeek-V4-Flash正式版Agent-能力大幅增强

谁在用?用在哪?

AI Agent开发者。 V4-Flash在Terminal Bench、NL2Repo、Toolathlon等Agent基准上表现突出,适合构建需要工具调用和多步骤执行的智能体。

软件工程师与编程场景。 DeepSWE从7.3分暴涨至54.4分,DSBench全栈测试68.7分,代码修改、仓库理解和端到端开发能力大幅增强。

成本敏感的企业用户。 输入1元/百万Token、输出2元/百万Token的定价,让大规模API调用不再成为预算瓶颈。

需要长上下文的场景。 100万Token上下文窗口,适合塞进大份文档或整个代码项目。

常见问题解答

V4-Flash正式版和预览版有什么区别?
模型架构和参数规模完全一致(总参数284B、激活13B),仅重新进行了后训练,主要改善代码修改、工具调用和多步骤任务执行等Agent能力。简单说:身板没变,做事的方式变了。

价格是多少?
输入1元/百万Token,输出2元/百万Token。输入命中缓存仅0.2元/百万Token。

在哪里可以使用?
目前仅限API接口,开发者使用deepseek-v4-flash名称调用即可。APP端和网页端暂未更新。

V4-Pro正式版什么时候来?
DeepSeek表示V4-Pro正式版将“尽快发布”。有传闻称可能在8月初上线。

支持Responses API吗?
支持。V4-Flash正式版原生支持Responses API格式,并已针对Codex进行优化适配。

Agent战争的大幕刚刚拉开

如果说2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,那么2026年的关键词,毫无疑问是Agent。Agent能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。

DeepSeek-V4-Flash正式版的上线,用284B参数、13B激活的轻量级体量,证明了后训练优化可以比堆参数更具性价比。有网友评论:“这还只是Flash版,真不敢想象V4-Pro会有多强!”

对开发者而言,价格战比拼的是入局门槛,而模型的Agent能力比拼的才是智能的天花板。当284B的Flash版在多项Agent基准上逼近Opus 4.8,大模型的门槛,已经被抬到了一个新的位置。

一句话总结:DeepSeek-V4-Flash正式版于2026年7月31日API公测上线,284B总参数(13B激活)、100万Token上下文,9项Agent基准全面超越V4-Pro预览版,API定价输入1元/百万Token、输出2元/百万Token。适合 AI Agent开发者、软件工程师、成本敏感型企业用户 重点关注。

了解更多:访问 DeepSeek API文档 或查看 官方更新日志

© 版权声明

相关文章

暂无评论

none
暂无评论...