cover diffusion gemma 1
28

6 月

DiffusionGemma:Google 的实验性文本扩散模型,快在哪里、代价是什么?

可引用摘要: DiffusionGemma 是 Google DeepMind 发布的实验性开放权重模型。它基于 Gemma 4 的 26 B MoE 架构,每次激活约 4 B 参数,通过离散文本扩散并行处理 256-token 画布。Google 报告其在单张 NVIDIA H 100 上可超过 1000 tokens/s、RTX 5090 上可超过 700 tokens/s,但同时明确指出总体输出质量低于标准 Gemma 4,优势主要出现在单用户、低到中等并发的本地推理。

DiffusionGemma 不是 Google 与 NVIDIA 联合发布的模型。模型由 Google DeepMind 开发;NVIDIA GPU 是官方性能测试和部署生态的一部分。厘清这一点,才能正确理解它的速度数据。

它不是“逐字生成”

许多主流大语言模型采用自回归解码:每一步根据已有上下文生成下一个 token。DiffusionGemma 使用离散文本扩散,在一个 256-token 画布上并行预测与修正 token。

官方文档把流程描述为:模型先处理并缓存提示词,再对生成画布进行多轮去噪。双向注意力允许画布中的 token 互相参考;采样器逐步锁定高置信 token,并继续修正其余位置。

这不是“在 embedding 空间里像图片一样加高斯噪声”的简单搬运。官方将其定义为离散扩散,并提供温度计划、熵阈值和自适应停止等采样参数。

速度数据有哪些条件?

Google 的发布说明给出三个醒目数字:

  • 在专用 GPU 上最高约 4 倍文本生成速度;
  • 单张 NVIDIA H 100 超过 1000 tokens/s;
  • NVIDIA GeForce RTX 5090 超过 700 tokens/s。

这些是官方测试结果,不是任何提示词、量化方式和硬件都能复现的保证。DiffusionGemma 把解码瓶颈从内存带宽更多地转向计算,因此在单用户、低并发的本地场景更有优势。高 QPS 云服务本来就能通过批处理充分利用计算资源,此时扩散解码的收益会缩小,甚至增加服务成本。

速度换来了什么代价?

Google 明确把 DiffusionGemma 标为 experimental,并建议追求最高质量的应用继续使用标准 Gemma 4。主要权衡包括:

  • 总体输出质量低于标准 Gemma 4;
  • 生成速度会随任务难度和去噪步数变化;
  • 开放式、复杂任务可能更困难;
  • 高并发云服务未必能获得相同吞吐优势;
  • 量化后可在约 18 GB VRAM 环境运行,但质量、速度和内存取决于具体配置。

因此,“更高 tokens/s”不能单独代表更好的模型。还要同时评估正确率、长文本一致性、首 token 延迟和完成一个有效答案所需的总时间。

它适合哪些任务?

双向画布和并行修正对非线性文本任务有潜力,例如代码补全、局部改写、结构化格式和需要回看后文的序列。官方还列出文本、图像和视频输入,但不支持音频输入。

这些能力仍应通过自己的任务集验证。对事实问答、法律、医疗、财务和关键业务输出,实验性模型必须配合来源核验和明确的失败处理。

适合与不适合

适合:

  • 研究文本扩散、双向生成和采样策略的开发者;
  • 有 H 100、RTX 5090 或类似硬件,关注低并发本地延迟的团队;
  • 可以用固定数据集比较速度与质量的实验项目。

不适合:

  • 只追求最高回答质量的生产应用;
  • 用官方峰值直接承诺终端用户速度的产品;
  • 高并发云服务中未做成本和吞吐验证的部署。

智盒判断

DiffusionGemma 的信号不是“自回归已经过时”,而是文本生成开始出现更明确的架构分工:自回归模型继续承担高质量通用输出,扩散模型探索低延迟、本地交互和非线性生成。真正有意义的比较应同时报告硬件、量化、批大小、去噪参数和质量指标。

延伸阅读:

FAQ

DiffusionGemma 是 Google 与 NVIDIA 联合开发的吗?

官方模型卡将开发者列为 Google DeepMind。NVIDIA 提供了测试硬件和相关部署生态,但这不等于联合发布。

它真的一次生成 256 个 token 吗?

它在 256-token 画布上并行预测和迭代修正,而不是一次前向后立即确定全部最终 token。

它一定比传统模型快 4 倍吗?

不一定。最高 4 倍是特定测试结果,实际速度取决于硬件、批大小、量化、任务和去噪步数。

DiffusionGemma 适合生产环境吗?

Google 将其标为实验性,并建议要求最高质量的应用使用标准 Gemma 4。生产采用前需要独立质量、安全和成本评估。

官方参考来源

本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。


RELATED

Posts