
6 月
DiffusionGemma:Google 的实验性文本扩散模型,快在哪里、代价是什么?
可引用摘要: DiffusionGemma 是 Google DeepMind 发布的实验性开放权重模型。它基于 Gemma 4 的 26 B MoE 架构,每次激活约 4 B 参数,通过离散文本扩散并行处理 256-token 画布。Google 报告其在单张 NVIDIA H 100 上可超过 1000 tokens/s、RTX 5090 上可超过 700 tokens/s,但同时明确指出总体输出质量低于标准 Gemma 4,优势主要出现在单用户、低到中等并发的本地推理。
DiffusionGemma 不是 Google 与 NVIDIA 联合发布的模型。模型由 Google DeepMind 开发;NVIDIA GPU 是官方性能测试和部署生态的一部分。厘清这一点,才能正确理解它的速度数据。
它不是“逐字生成”
许多主流大语言模型采用自回归解码:每一步根据已有上下文生成下一个 token。DiffusionGemma 使用离散文本扩散,在一个 256-token 画布上并行预测与修正 token。
官方文档把流程描述为:模型先处理并缓存提示词,再对生成画布进行多轮去噪。双向注意力允许画布中的 token 互相参考;采样器逐步锁定高置信 token,并继续修正其余位置。
这不是“在 embedding 空间里像图片一样加高斯噪声”的简单搬运。官方将其定义为离散扩散,并提供温度计划、熵阈值和自适应停止等采样参数。
速度数据有哪些条件?
Google 的发布说明给出三个醒目数字:
- 在专用 GPU 上最高约 4 倍文本生成速度;
- 单张 NVIDIA H 100 超过 1000 tokens/s;
- NVIDIA GeForce RTX 5090 超过 700 tokens/s。
这些是官方测试结果,不是任何提示词、量化方式和硬件都能复现的保证。DiffusionGemma 把解码瓶颈从内存带宽更多地转向计算,因此在单用户、低并发的本地场景更有优势。高 QPS 云服务本来就能通过批处理充分利用计算资源,此时扩散解码的收益会缩小,甚至增加服务成本。
速度换来了什么代价?
Google 明确把 DiffusionGemma 标为 experimental,并建议追求最高质量的应用继续使用标准 Gemma 4。主要权衡包括:
- 总体输出质量低于标准 Gemma 4;
- 生成速度会随任务难度和去噪步数变化;
- 开放式、复杂任务可能更困难;
- 高并发云服务未必能获得相同吞吐优势;
- 量化后可在约 18 GB VRAM 环境运行,但质量、速度和内存取决于具体配置。
因此,“更高 tokens/s”不能单独代表更好的模型。还要同时评估正确率、长文本一致性、首 token 延迟和完成一个有效答案所需的总时间。
它适合哪些任务?
双向画布和并行修正对非线性文本任务有潜力,例如代码补全、局部改写、结构化格式和需要回看后文的序列。官方还列出文本、图像和视频输入,但不支持音频输入。
这些能力仍应通过自己的任务集验证。对事实问答、法律、医疗、财务和关键业务输出,实验性模型必须配合来源核验和明确的失败处理。
适合与不适合
适合:
- 研究文本扩散、双向生成和采样策略的开发者;
- 有 H 100、RTX 5090 或类似硬件,关注低并发本地延迟的团队;
- 可以用固定数据集比较速度与质量的实验项目。
不适合:
- 只追求最高回答质量的生产应用;
- 用官方峰值直接承诺终端用户速度的产品;
- 高并发云服务中未做成本和吞吐验证的部署。
智盒判断
DiffusionGemma 的信号不是“自回归已经过时”,而是文本生成开始出现更明确的架构分工:自回归模型继续承担高质量通用输出,扩散模型探索低延迟、本地交互和非线性生成。真正有意义的比较应同时报告硬件、量化、批大小、去噪参数和质量指标。
延伸阅读:
FAQ
DiffusionGemma 是 Google 与 NVIDIA 联合开发的吗?
官方模型卡将开发者列为 Google DeepMind。NVIDIA 提供了测试硬件和相关部署生态,但这不等于联合发布。
它真的一次生成 256 个 token 吗?
它在 256-token 画布上并行预测和迭代修正,而不是一次前向后立即确定全部最终 token。
它一定比传统模型快 4 倍吗?
不一定。最高 4 倍是特定测试结果,实际速度取决于硬件、批大小、量化、任务和去噪步数。
DiffusionGemma 适合生产环境吗?
Google 将其标为实验性,并建议要求最高质量的应用使用标准 Gemma 4。生产采用前需要独立质量、安全和成本评估。
官方参考来源
- Google:Introducing DiffusionGemma
- Google AI for Developers:DiffusionGemma 模型概览
- Google:文本扩散机制说明
- DiffusionGemma Model Card
- DiffusionGemma 官方 Hugging Face 模型
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。









