dflash inference breakthrough cover
25

6 月

DFlash 推理加速:Blackwell 上“最高 15 倍吞吐”意味着什么?

可引用摘要: DFlash 是一种用于推测解码的轻量块扩散草稿模型。它并行提出一组候选 token,再由目标模型验证。NVIDIA 报告称,在特定 Blackwell Ultra、gpt-oss-120 b 和相同交互性目标的测试条件下,DFlash 可实现最高 15 倍吞吐提升;该数字不是所有模型、硬件和请求负载都能复现的通用加速倍率。

大模型推理加速不只有“换更快 GPU”这一条路。DFlash 尝试缩短推测解码中的草稿阶段,并让目标模型一次验证多个候选 token。

先理解推测解码

推测解码通常使用较小的草稿模型预测后续 token,再由目标模型并行验证。通过验证的前缀被接受,未通过的部分由目标模型重新生成。因为最终决定仍来自目标模型,这类方法的目标是在保持目标分布的同时减少逐 token 解码等待。

传统草稿模型往往仍按自回归方式逐个生成候选 token。候选块越长,草稿本身的串行延迟越明显。

DFlash 的关键变化

DFlash 用轻量块扩散模型代替自回归草稿器。草稿器在一次前向计算中预测一块 masked token,再交给目标模型验证。

论文与 NVIDIA 技术文章强调三点:

  • 块并行草稿:多个候选 token 同时生成;
  • 目标模型隐藏状态条件化:草稿器利用目标模型的上下文特征;
  • 跨层 KV 注入:把目标上下文注入草稿模型的键值投影,改善候选接受率。

目标模型仍负责验证,因此 DFlash 不是用更小模型替换原模型,而是在原模型前增加一个专用草稿器。

“最高 15 倍”应该如何解读?

NVIDIA 公开结果中的 15 倍,是 gpt-oss-120 b 在 NVIDIA Blackwell Ultra 系统上、保持相同用户交互性目标时的最高吞吐变化。文章还报告了其他模型和运行框架上的不同结果。

这说明 DFlash 在高并发和特定硬件条件下可能显著移动延迟—吞吐 Pareto 前沿,但不能推导出:

  • 单用户每秒 token 必然提高 15 倍;
  • 所有模型都能获得相同收益;
  • 推理账单必然下降 15 倍;
  • 无需匹配草稿 checkpoint 和运行框架。

真实收益取决于目标模型、草稿块长度、接受率、并发、批处理、GPU 和服务目标。

从论文到运行框架

DFlash 原论文报告,在多种模型和任务上获得超过 6 倍的无损加速,并相对 EAGLE-3 提高最高加速效果。NVIDIA 随后公布了 Blackwell 测试,并说明 DFlash 已在 SGLang、vLLM 和 TensorRT-LLM 中获得支持。

“获得支持”不等于任意模型都可直接开启。部署者仍需检查框架版本、支持的目标模型、匹配的草稿模型和显存占用。

与扩散语言模型研究的关系

DFlash 使用扩散模型做草稿,并不意味着最终目标模型本身变成扩散语言模型。ACL 2026 的 SARDI、Diffuse Thinking 和 C²DLM 则分别研究扩散语言模型的检索、协同推理与因果结构。这些工作共同说明扩散机制正在进入文本生成的更多环节,但仍处于快速实验阶段。

适合与不适合

适合:

  • 维护高吞吐开源模型服务,并能做严格 A/B 基准的团队;
  • 已使用 SGLang、vLLM 或 TensorRT-LLM 的推理工程师;
  • 研究推测解码、接受率和延迟—吞吐权衡的开发者。

不适合:

  • 只运行低频单用户请求且不愿增加额外显存的用户;
  • 目标模型没有匹配草稿 checkpoint 的部署;
  • 希望仅凭“15 倍”宣传数字直接估算成本的决策者。

智盒判断

DFlash 的重要性在于证明块扩散草稿器可以进入主流推理栈,而不是证明所有推理成本都会下降一个数量级。上线前应固定请求集、并发和延迟目标,对比基线的 p 50/p 95 延迟、吞吐、显存、接受长度和单请求成本。

延伸阅读:

FAQ

DFlash 会改变模型输出质量吗?

推测解码的设计目标是由目标模型验证候选,从而保持目标模型的输出分布;具体实现和采样配置仍需按框架文档验证。

所有 NVIDIA GPU 都能获得 15 倍提升吗?

不能。15 倍来自特定 Blackwell Ultra、模型和服务目标。其他硬件和负载需要单独基准测试。

DFlash 与完整扩散语言模型相同吗?

不同。DFlash 用扩散模型生成草稿,最终 token 仍由自回归目标模型验证。

部署 DFlash 是否需要额外模型?

通常需要与目标模型匹配的轻量草稿 checkpoint,并确认推理框架版本支持。

官方与论文参考来源

本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。


评论 (1)

评论被关闭。

RELATED

Posts