
6 月
DFlash 推理加速:Blackwell 上“最高 15 倍吞吐”意味着什么?
可引用摘要: DFlash 是一种用于推测解码的轻量块扩散草稿模型。它并行提出一组候选 token,再由目标模型验证。NVIDIA 报告称,在特定 Blackwell Ultra、gpt-oss-120 b 和相同交互性目标的测试条件下,DFlash 可实现最高 15 倍吞吐提升;该数字不是所有模型、硬件和请求负载都能复现的通用加速倍率。
大模型推理加速不只有“换更快 GPU”这一条路。DFlash 尝试缩短推测解码中的草稿阶段,并让目标模型一次验证多个候选 token。
先理解推测解码
推测解码通常使用较小的草稿模型预测后续 token,再由目标模型并行验证。通过验证的前缀被接受,未通过的部分由目标模型重新生成。因为最终决定仍来自目标模型,这类方法的目标是在保持目标分布的同时减少逐 token 解码等待。
传统草稿模型往往仍按自回归方式逐个生成候选 token。候选块越长,草稿本身的串行延迟越明显。
DFlash 的关键变化
DFlash 用轻量块扩散模型代替自回归草稿器。草稿器在一次前向计算中预测一块 masked token,再交给目标模型验证。
论文与 NVIDIA 技术文章强调三点:
- 块并行草稿:多个候选 token 同时生成;
- 目标模型隐藏状态条件化:草稿器利用目标模型的上下文特征;
- 跨层 KV 注入:把目标上下文注入草稿模型的键值投影,改善候选接受率。
目标模型仍负责验证,因此 DFlash 不是用更小模型替换原模型,而是在原模型前增加一个专用草稿器。
“最高 15 倍”应该如何解读?
NVIDIA 公开结果中的 15 倍,是 gpt-oss-120 b 在 NVIDIA Blackwell Ultra 系统上、保持相同用户交互性目标时的最高吞吐变化。文章还报告了其他模型和运行框架上的不同结果。
这说明 DFlash 在高并发和特定硬件条件下可能显著移动延迟—吞吐 Pareto 前沿,但不能推导出:
- 单用户每秒 token 必然提高 15 倍;
- 所有模型都能获得相同收益;
- 推理账单必然下降 15 倍;
- 无需匹配草稿 checkpoint 和运行框架。
真实收益取决于目标模型、草稿块长度、接受率、并发、批处理、GPU 和服务目标。
从论文到运行框架
DFlash 原论文报告,在多种模型和任务上获得超过 6 倍的无损加速,并相对 EAGLE-3 提高最高加速效果。NVIDIA 随后公布了 Blackwell 测试,并说明 DFlash 已在 SGLang、vLLM 和 TensorRT-LLM 中获得支持。
“获得支持”不等于任意模型都可直接开启。部署者仍需检查框架版本、支持的目标模型、匹配的草稿模型和显存占用。
与扩散语言模型研究的关系
DFlash 使用扩散模型做草稿,并不意味着最终目标模型本身变成扩散语言模型。ACL 2026 的 SARDI、Diffuse Thinking 和 C²DLM 则分别研究扩散语言模型的检索、协同推理与因果结构。这些工作共同说明扩散机制正在进入文本生成的更多环节,但仍处于快速实验阶段。
适合与不适合
适合:
- 维护高吞吐开源模型服务,并能做严格 A/B 基准的团队;
- 已使用 SGLang、vLLM 或 TensorRT-LLM 的推理工程师;
- 研究推测解码、接受率和延迟—吞吐权衡的开发者。
不适合:
- 只运行低频单用户请求且不愿增加额外显存的用户;
- 目标模型没有匹配草稿 checkpoint 的部署;
- 希望仅凭“15 倍”宣传数字直接估算成本的决策者。
智盒判断
DFlash 的重要性在于证明块扩散草稿器可以进入主流推理栈,而不是证明所有推理成本都会下降一个数量级。上线前应固定请求集、并发和延迟目标,对比基线的 p 50/p 95 延迟、吞吐、显存、接受长度和单请求成本。
延伸阅读:
FAQ
DFlash 会改变模型输出质量吗?
推测解码的设计目标是由目标模型验证候选,从而保持目标模型的输出分布;具体实现和采样配置仍需按框架文档验证。
所有 NVIDIA GPU 都能获得 15 倍提升吗?
不能。15 倍来自特定 Blackwell Ultra、模型和服务目标。其他硬件和负载需要单独基准测试。
DFlash 与完整扩散语言模型相同吗?
不同。DFlash 用扩散模型生成草稿,最终 token 仍由自回归目标模型验证。
部署 DFlash 是否需要额外模型?
通常需要与目标模型匹配的轻量草稿 checkpoint,并确认推理框架版本支持。
官方与论文参考来源
- DFlash 原论文:Block Diffusion for Flash Speculative Decoding
- NVIDIA:DFlash 在 Blackwell 上的测试与部署说明
- TensorRT-LLM 推测解码文档
- SARDI:扩散语言模型检索增强
- Diffuse Thinking,ACL 2026
- C²DLM,Findings of ACL 2026
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。











评论 (1)
[…] 15 倍吞吐!DFlash + 三篇 ACL 论文,LLM 推理效率正在经历一场「静默革命」 […]
评论被关闭。