
8 月
DeepSeek V 4-Flash 0731 重磅升级:Agent 能力暴涨 4 倍,MIT 开源,价格只有 V 4-Pro 的三分之一
DeepSeek V 4-Flash 0731 重磅升级:Agent 能力暴涨 4 倍,MIT 开源,价格只有 V 4-Pro 的三分之一
2026 年 7 月 31 日,DeepSeek 发布 V 4-Flash-0731,在 7 个 Agent 基准上全面碾压 V 4-Flash 预览版和 V 4-Pro。关键数字:Agent 能力平均提升 3-4 倍,输出价格仅为 V 4-Pro 的 1/3,MIT 协议开源,支持本地部署。
前言
DeepSeek 今天干了一件很 DeepSeek 的事:没有发布会,没有预告,直接把新版模型丢上 Hugging Face,模型卡上写着「这是正式发布,取代预览版」。
然后你看数据——沉默了。
284 B 总参数 / 13 B 激活参数,和 4 月预览版一样的架构。但 Agent 基准上的成绩提升了 3 到 4 倍。不是优化了 10-20%,是翻了几倍。
这篇文章拆解 V 4-Flash-0731 的数据、技术路线和部署成本。
数据:用后训练实现「跨量级」提升
先看最震撼的几个基准:
| 基准 | V 4-Flash-0731 | V 4-Flash 预览 | V 4-Pro 预览 | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Cybergym | 76.7 | 38.7 | 52.7 | 83.1 |
| NL 2 Repo | 54.2 | 39.4 | 38.5 | 69.7 |
| AutomationBench | 25.1 | 10.8 | 12.8 | 27.2 |
几个值得注意的点:
- DeepSWE 从 7.3 到 54.4——这是 7.5 倍的提升。DeepSWE 测的是模型解决真实 GitHub Issue 的 Agent 能力,是衡量「AI 能不能当程序员」的最硬基准之一。
- 全面超越 V 4-Pro——Flash 是轻量版,Pro 是完整版。但 0731 的 Flash 在每个 Agent 基准上都跑赢了 Pro 预览版。输出价格只有 Pro 的 1/3。
- 接近 Opus 4.8 的水平——Terminal Bench(82.7 vs 85.0)和 DeepSWE(54.4 vs 58.0)已经非常接近。考虑到 Flash 是 MIT 开源且价格低得多,这个性价比令人震惊。
架构不变,后训练是核心
V 4-Flash-0731 的架构和参数规模完全没变。DeepSeek 明确说「the jump is post-training only」。
这意味着什么?不需要更大的模型,通过更好的后训练就能让 Agent 能力翻几倍。这对整个行业都是一个重要信号——Agent 能力可能更多依赖于训练方法和数据质量,而非模型规模。
开源和部署
协议: MIT(可商用,无限制)n架构: 284B 总参数 / 13B 激活 (MoE)n部署需求:n 3-bit 量化: ~110 GB 内存n 全精度: 4×GB300 节点n推理加速:n DSpark: 60-85% per-user 加速n 配置: --speculative-config '{"method":"dspark","num_speculative_tokens":7}'# vLLM 部署示例nvllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \n --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' \n --max-model-len 131072API 已经可用
V 4-Flash API 已进入公开测试:
- 原生支持 Responses API 格式
- 适配 Codex(Claude Code 竞争对手)
- 价格:输出约 V 4-Pro 的 1/3
局限与风险
- 所有基准数据来自 DeepSeek 自己——使用了未公开发布的 DeepSeek Harness。独立评测可能得出不同结论。
- Agent 得分与 harness 高度相关——DeepSeek 自己也说「scores are harness-sensitive」。
- DSBench 是内部测试集——无法独立验证。
建议:先用你自己的评测跑一遍再决定。MIT 协议意味着你可以直接下载部署测试,零门槛。
结语
V 4-Flash-0731 证明了几个重要趋势:
- 后训练 > 预训练:Agent 能力的提升更多来自训练方法,而非模型规模
- 轻量模型正在追赶旗舰:Flash 级别的模型可能成为 Agent 开发的主力
- 开源竞争力在增强:MIT 协议 + 接近 Opus 4.8 的性能,对闭源 API 形成强大竞争
DeepSeek 的节奏一如既往:不发新闻稿,直接丢模型。但数据会说话。
FAQ
V 4-Flash-0731 能替代 V 4-Pro 吗?
在 Agent 任务上可以。在纯推理、知识问答等场景,V 4-Pro 可能仍有优势。V 4-Pro 的 API 和应用端模型尚未更新。
本地部署需要什么配置?
3-bit 量化约需 110 GB 内存(2×A 100 80 GB 可跑),全精度需要 4×GB 300。DSpark 推理加速可额外提升 60-85% 吞吐。
和 Claude Opus 5 怎么比?
目前没有直接对比数据。但从 V 4-Flash-0731 对 Opus 4.8 的数据来看,DeepSeek 的 Flash 线正在快速逼近 Anthropic 上一代旗舰。需要等独立第三方评测。











评论 (4)
[…] DeepSeek V 4-Flash Agent 暴涨 […]
[…] DeepSeek V 4-Flash 0731 […]
[…] DeepSeek V 4-Flash 0731 Agent 暴涨 […]
[…] DeepSeek V 4-Flash 0731 […]
评论被关闭。