DiffusionGemma:用离散文本扩散和双向注意力,把推理瓶颈从内存带宽转移到算力

简介: DiffusionGemma是谷歌推出的实验性开源模型,首创离散文本扩散架构,可并行生成256-token画布,突破自回归模型的序列瓶颈;本地推理速度提升4倍,兼顾效率与质量,专为端侧低延迟场景优化。

DiffusionGemma 的发布在 AI 研究圈子里引发了相当多的讨论,原因在于它触及了 LLM 文本生成方式的根本性问题。

标准 Gemma 4 系列依赖自回归解码(autoregressive decoding),从前到后逐个预测 Token。DiffusionGemma 则是离散文本扩散(discrete text diffusion)的实验性模型,可以同时生成并精炼整个文本块,绕过了历史上制约本地 AI 性能的主要硬件瓶颈。

瓶颈的转移:从内存带宽到算力

理解 DiffusionGemma 得先看清传统自回归模型卡在哪里。

单 GPU 本地单用户运行时,标准 LLM 的瓶颈通常是内存带宽。生成每个 Token 都要从内存加载完整的权重矩阵,GPU 的张量核心在等待数据传输期间大量闲置,算力并没有被充分利用。

DiffusionGemma 的做法是把瓶颈从内存带宽挪到算力上。每次前向传播(forward pass)并行起草一个 256 Token 的画布(canvas),一次性给处理器提供更大的工作块,硬件的算术强度(arithmetic intensity)才算真正用上了。架构上的变化让模型从逐字打印的打字机,变成了一次性印出整块文字的印刷机。

架构基础

DiffusionGemma 基于 26B 混合专家模型(Mixture-of-Experts,MoE)Gemma 4 架构,推理时实际激活的参数量约为 3.8B 到 4B。稀疏 MoE 设计在保留深度推理能力的同时,量化后能压进高端消费级 GPU 的 18GB VRAM 限制内。

模型采用编码器-解码器(encoder-decoder)架构,两个组件各司其职:自回归编码器(Autoregressive Encoder)用因果注意力(causal attention)处理初始 Prompt 上下文,结果缓存到 KV Cache;双向去噪器(Bidirectional Denoiser)则在生成画布上应用双向注意力(bidirectional attention),256 Token 画布上的每个位置都能同时关注其他所有位置,以及 KV Cache 里的历史上下文。

对于超过 256 Token 的长序列,模型引入了块自回归扩散(Block Autoregressive Diffusion)机制——一个块完成去噪后提交到 KV Cache,下一个画布以已生成的历史为条件重新开始。并行扩散的速度和长文本顺序生成的稳定性,通过这种混合方式结合起来。

离散文本扩散的运作机制

生成过程是一个迭代去噪循环,和 AI 图像生成器的思路类似,分三个阶段推进:

  1. 画布初始化:模型用随机占位 Token 填满 256 Token 的块。
  2. 迭代精炼:经过多轮去噪,高置信度的 Token 率先确定,作为全局上下文指导剩余占位符的精炼。
  3. 收敛:Token 逐渐收敛,序列最终成形为连贯文本。

    整块一次性评估带来了一个自回归模型没有的能力:自我修正。某次传播中对某个位置的置信度下降,采样器可以对该位置重新加噪并替换。自回归模型一旦采样了某个 Token 就无法更改,这是两种架构之间最实质的技术差异。

推荐的部署与优化方案

Google 给出了具体的部署配置建议,以平衡延迟与输出质量。模型的实际表现对去噪采样器(denoising sampler)的调参方式高度敏感:

模型已针对 NVIDIA Blackwell 和 Hopper 架构上的 NVFP4(4 位浮点)进行优化,在接近无损精度的前提下进一步提升计算吞吐量。

性能数据与实验结果

DiffusionGemma 最直观的指标是原始生成速度。实验室专用硬件测试结果如下:

  • NVIDIA H100:超过 1,000 Token/秒。
  • NVIDIA GeForce RTX 5090:超过 700 Token/秒。
  • 与同等硬件上的传统模型相比,Token 生成速度最高提升 4 倍。

不过这些数字最有说服力的场景是低并发本地工作流。在请求已批量处理、GPU 算力本就饱和的高流量云环境中,并行解码的优势会递减,部署成本也可能上升。

案例展示:数独求解实验

研究人员用数独来测试双向上下文的实际价值——这是一个对自回归模型出了名的难题。数独网格里每个数字都受水平、垂直、宫格三重约束的交叉限制,必须能评估后续位置并在发现冲突时回溯,顺序生成的架构在结构上就处于劣势。

实验结果:

  • 基础模型表现:未经专项训练的 DiffusionGemma 基础模型成功率约为 0%。
  • Fine-tuning(SFT)后的表现:使用 Hackable Diffusion 工具箱应用监督微调(SFT)方案后,成功率升至 80%。
  • 效率变化:Fine-tuning 后模型收敛更快,自适应提前停止(adaptive early stopping)机制将步数从最多 48 步压缩到 12 步。

总结

这是一个实验性发布,因为整体输出质量低于标准自回归 Gemma 4 模型,目前更适合速度敏感的交互式本地工作流,而非高要求的生产级文本生成。

适合落地的场景集中在三类:内联编辑与快速迭代(需要实时反馈的场合);非线性文本结构,如代码填充(code infilling)、氨基酸序列、数学图(双向上下文在这类任务上有结构优势);以及代码生成中实时渲染代码和闭合复杂 Markdown 格式。

DiffusionGemma 在技术层面证明了一件事:文本生成可以从打字机模式切换到印刷机模式。双向注意力加迭代并行去噪,在专用 GPU 上实现了推理速度 4 倍的提升。原始质量还追不上标准自回归模型,但解决非线性约束问题的潜力,以及面向本地用户的吞吐量,是两个值得持续关注的方向。

https://avoid.overfit.cn/post/c1e25b8c4b534244b7a10036678c8535

作者:Mayur Jain

目录
相关文章
|
11天前
|
缓存 测试技术 API
Qwen 3.7 Plus 与 Max 实测:性价比与多模态能力差异解析(2026)
2026 年 6 月 1 日,阿里悄无声息地发布了 Qwen 3.7 Plus,距 Qwen 3.7 Max 上线刚好 11 天。同样的 1M 上下文,同样的 35 小时自治上限。但价格才是头条:Plus 是 0.40/M输入,Max是 2.50/M——便宜约 6 倍——并且还能看图、看视频。Vision Arena 上 Plus 已经排到 #16。所以这周真正值得讨论的问题不是”要不要为视觉能力买单”,而是”Max 凭什么用 6 倍价格换来 2 个百分点的 benchmark 领先”。
|
12天前
|
JavaScript 定位技术 API
CodeGraph 爆火:编程 Agent 需要的不是更多上下文,而是一张提前画好的代码地图
CodeGraph 是一款爆火的本地代码智能工具,通过 tree-sitter 解析 AST 构建结构化知识图谱(存于 SQLite),为编程 Agent 提前生成“代码地图”。它显著降低 Agent 在中大型项目中的探索成本——实测工具调用减少71%、Token 降57%、速度提升46%,支持19+语言及主流框架路由识别,完全离线、无需 API Key。
847 11
CodeGraph 爆火:编程 Agent 需要的不是更多上下文,而是一张提前画好的代码地图
|
12天前
|
人工智能 运维 JavaScript
阿里云Qoder CN(原通义灵码)全解析 产品形态、版本划分与技术适配说明
在AI辅助开发与智能办公工具持续普及的当下,阿里云旗下原通义灵码正式更名为Qoder CN,同时延伸出QoderWork CN、Qoder CN CLI、Qoder CN Mobile等多款配套产品,形成覆盖代码开发、日常办公、终端交互、移动端使用的完整工具矩阵。Qoder CN核心定位为AI智能编码助手,深度适配主流代码编辑器、集成开发环境以及终端场景;QoderWork CN则偏向桌面端综合办公辅助,二者面向不同使用场景,划分了多个版本档位,搭配差异化资源配额、功能权限与计费规则,同时兼容多款主流大模型。
861 8
|
12天前
|
存储 安全 Java
AgentScope Java 2.0:打造分布式、企业级智能体底座
AgentScope 2.0 面向分布式部署、稳定运行、权限安全等企业级需求全面升级,打造支持多租户隔离与长期稳定运行的企业级智能体底座。
|
12天前
|
JSON 缓存 安全
通过 CC Switch 本地路由让 Codex CLI 接入 DeepSeek 等第三方模型
CC Switch 通过本地路由(`127.0.0.1:15721`)实现协议转换:将 Codex 的 Responses API 请求自动映射为 DeepSeek 等厂商的 Chat Completions 接口,兼容流式响应与工具调用,无需修改 Codex 源码,安全隔离 API Key。(239字)
2336 6
通过 CC Switch 本地路由让 Codex CLI 接入 DeepSeek 等第三方模型
|
12天前
|
人工智能 弹性计算 安全
阿里云618活动时间、活动入口、优惠活动详细解读
2026年阿里云618创新加速季已全面开启,作为年度力度最大的云产品促销活动,本次大促覆盖轻量应用服务器、ECS云服务器、GPU云服务器、数据库、AI算力、安全服务、CDN等全品类产品,推出5亿元算力补贴、新用户限时秒杀、普惠满减、企业专享、免费试用、云大使返佣等多重福利,个人开发者、中小企业、AI团队均可享受专属低价。本文将系统梳理2026年阿里云618活动的完整时间节点、官方参与入口、各类优惠细则、使用规则、热门产品推荐及实操代码,帮助用户精准参与、高效省钱,以最低成本完成上云部署。
1886 6
|
12天前
|
数据采集 人工智能 前端开发
让 Coding Agent 从黑盒到透明:阿里云 Agent 观测审计数据采集实践
AI Agent 规模化落地带来执行黑盒、行为难追溯、成本难度量三大难题。阿里云基于 OTel 标准,面向 Coding Agent、个人通用助理和框架型 Agent,推出 LoongSuite Pilot、插件及探针等无侵入采集方案,让 Agent 实现可看见、可分析、可审计、可治理。
785 151
|
12天前
|
人工智能 运维 自然语言处理
阿里云百炼Qwen3.7-Max模型详解:综合能力、核心优势与订阅计划参考指南
2026年,大模型技术持续向通用化、高性能、场景化方向迭代,阿里云百炼作为一站式大模型服务平台,持续推出迭代升级的模型产品,Qwen3.7-Max便是当前主力旗舰级大模型之一。该模型依托深度优化的底层架构与大规模训练数据,在文本理解、逻辑推理、多模态交互、代码生成、长文本处理等多个维度实现能力升级,同时搭配灵活的订阅计划体系,能够适配个人开发者、中小企业、大型企业、政企机构等不同类型用户的使用需求。
633 2