端侧 AI 的推理加速:手机端大模型怎么提速?

简介: Google 给 Pixel 上的 Gemini Nano 装了个“先猜后验”的加速器

手机跑大模型听起来很酷,但真的跑起来之后,问题就接踵而来了。

我们常用的云端模型可以依赖服务器和数据中心,但手机上的模型就没这么强大的后盾。不仅如此,它还要顾及电池、内存、发热,还有尽量别让用户等太久。

Google 最近分享了一篇文章,介绍 Gemini Nano 在 Pixel 设备上的一次推理加速优化:Frozen Multi-Token Prediction。这个方法已经用在 Pixel 9 和 Pixel 10 系列的 Gemini Nano v3 中,服务于 AI 通知摘要(AI Notification Summaries)、文本校对(Proofread) 等端侧 AI 功能。

本文就借这篇文章,简单看看手机端大模型为什么容易慢,Frozen Multi-Token Prediction 大概怎么工作,以及它为什么能让 Gemini Nano 在 Pixel 上生成得更快一些。

大模型为什么会慢

大语言模型生成文字时,通常是一个 token 一个 token 往外吐。

你可以把它理解成一个很谨慎的打字员。每写下一个词,都要看一遍前面的内容,再判断下一个词是什么。这个流程看着很稳,但放到手机上,就很容易变慢。

因为手机的算力、内存和功耗都有限。模型每次只生成一个 token,就意味着要反复调用推理流程,也会更频繁地占用内存带宽。Google 在原文里提到,移动设备有严格的能耗预算和 RAM 限制,而传统自回归生成方式会形成瓶颈,影响体验和电池消耗。

所以,端侧 AI 要提速,一个很自然的方向就是:能不能一次多生成几个 token?

多猜 Token 再统一验证

Google 的 Frozen Multi-Token Prediction 的核心思路,就是先让一个轻量模块提前猜几个后续 token,再交给主模型检查。

这和 speculative decoding 的实现思路有点像。一般来说,生成 N 个 token 需要大模型跑 N 次;speculative decoding 把过程拆成两步:先由更快的小模块生成候选 token,再由主模型并行验证。如果候选内容和主模型判断一致,就可以一次接受多个 token;如果中间不一致,就从分歧处重新生成下一个 Token。

这样一来,模型生成文字就不用永远一步一步地往前挪。只要猜对了,它就可以一次往前推进几个 token。

需要提一下的是,Google 没有为 Gemini Nano 单独放一个很重的 drafter 模型。它在 Gemini Nano v3 的主模型后面接了一个轻量的 MTP head,让这个小模块负责提前预测。

图 1:Frozen MTP 的 zero-copy 架构

MTP Head 复用主模型已经计算出的 hidden states 和 KV cache,生成候选 token 后,再由主模型统一验证。

Frozen Multi-Token Prediction 是什么

这里 Frozen 的意思是,主模型权重被冻结。

Google 拿已经训练好的 Gemini Nano v3,把它的权重固定住,然后接上一个新的 MTP head。训练时,只训练这个新增模块,主模型本身不动。Google 认为,这样 MTP 更像是一个效率优化层,不会影响基础模型原有能力和安全对齐;如果提前预测错了,也会在验证阶段被丢掉,最终输出仍由主模型决定。

这点很适合端侧部署。

因为手机上的模型已经进入正式环境,重新训练和重新适配都很麻烦。Frozen MTP 的做法更像是在原有模型旁边加一个“提前预判器”,主要目标是减少等待时间和资源浪费。

端侧优化,内存也很关键

图 1 里还有一个很关键的细节:zero-copy architecture。

如果单独放一个 drafter 模型,它也要读上下文、维护自己的 KV cache,还要占用额外内存。对手机来说,这些都是成本。

Google 的方案是让 MTP Head 直接利用主模型已经算好的状态,包括 hidden states 和 KV cache。这样一来,小模块不用重新处理完整 prompt,也不用重复维护一份上下文缓存。Google 提到,这种设计可以消除 drafter 的额外 prefill 延迟,并且相比独立 drafter,每个实例最多节省约 130MB 运行内存。

这也是手机端 AI 和云端 AI 很不一样的地方。云端更容易通过堆算力解决问题;手机端要算得快,还要尽量少占内存、少唤醒重处理器、少消耗电量。

优化后的性能

在 Pixel 9 设备上的实验中,MTP drafter 相比参数量接近的独立 drafter,在部分任务上能带来 50% 以上的加速。对于 smart replies 这类结构更可预测的任务,token 接受率最高提升到 55%。在 AI Notification Summaries 和 Proofread 等生产负载中,MTP 平均每次推理可以正确多预测接近 2 个 token。

图 2:MTP 结果图

上图展示了 Gemini Nano 在 Pixel 9 不同应用场景中,引入 MTP 后的 token generation 效果对比。

小结

这篇文章可以看作 Google 对端侧大模型推理的一次工程优化记录。

它讲的重点并不复杂:手机里的大模型生成内容时,如果每次只生成一个 token,就容易慢;如果能提前预测几个 token,并且让主模型统一验证,就有机会减少推理步数。

Frozen MTP 的做法,是在 Gemini Nano v3 后面加一个轻量预测模块。主模型保持不动,小模块负责提前猜,主模型负责检查。猜中了,生成更快;猜错了,丢掉重来。

简而言之,手机端大模型要变快,除了模型本身要轻,生成方式也要更省步骤、更省内存。

相关文章
|
20天前
|
应用服务中间件 网络安全 nginx
阿里云SSL证书教程:HTTPS证书申请与安装步骤!
本文是2026年阿里云SSL证书全平台部署实战指南,融合云架构与SEO双重视角:详解HTTPS为何是出海站点生死线,涵盖免费/商用证书申领、DNS验证、Nginx/Apache手动配置及CDN/SLB一键部署,并强调301重定向、混合内容修复与GSC资产更新等关键SEO检查项。
|
12天前
|
人工智能 运维 自然语言处理
最新版通义千问(Qwen3.7-Max)功能介绍
通义千问Qwen3.7-Max(2026上线)是阿里云新一代旗舰大模型,支持百万级上下文、原生全模态、自主智能体、顶尖代码能力、全链路办公与阿里生态办事六大升级,实现从问答工具到通用AI代理的跃迁,个人端永久免费。
|
3月前
|
存储 人工智能 Java
AI实践|基于 Spring AI 从0到1构建 AI Agent
文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。
AI实践|基于 Spring AI 从0到1构建 AI Agent
|
20天前
|
机器学习/深度学习 存储 人工智能
2026年阿里云服务器活动价格:轻量、经济型、通用算力型、计算型等热门实例活动价格参考
2026年阿里云推出多档位高性价比云服务器特惠活动,覆盖轻量应用、经济型e、通用算力型u1/u2i等全系列规格。新用户可抢轻量应用服务器2核2G仅38元/年,2核4G低至9.9元/月;新老用户同享2核2G 3M带宽经济型e实例99元/年、2核4G 5M带宽通用算力型u1实例199元/年,且续费同价。同时提供从2核2G到24核64G的经济型、通用算力型全规格报价参考,适配个人博客、企业官网、数据分析等不同场景,帮助用户按需选择高性价比算力方案。
|
1月前
|
人工智能 机器人 开发工具
工程实践|Warp 的 Loop Engineering:Agent 如何自己改进 Skill?
Warp 团队提出“双循环驱动”AI Agent进化:内循环(Inner Loop)自动分诊GitHub Issue;外循环(Outer Loop)从人类反馈中提炼规则,生成PR更新技能文件(SKILL.md)。技能即SOP,可审查、可回滚、持续迭代,让Agent越用越懂团队。
212 1
工程实践|Warp 的 Loop Engineering:Agent 如何自己改进 Skill?
|
27天前
|
机器学习/深度学习 资源调度 算法
论文解读:DeepSeek DSpark 在真实高并发推理服务中,如何保证 Token 生成又好又快?
DSpark 通过半自回归生成和置信度调度,加速 speculative decoding。
191 0
|
1月前
|
机器学习/深度学习 数据采集 SQL
小模型也能做 Agent?阿里最新的 AgenticQwen 论文讲了什么
这篇论文讨论了一个很实际的工程问题:在真实的工业场景中,Agent 往往不只是要会聊天,还要具备多步推理、调用工具的能力。但受限于工业生产环境对成本的控制和延迟的要求,不适合把所有任务都交由大模型来处理。
291 3
小模型也能做 Agent?阿里最新的 AgenticQwen 论文讲了什么
|
3月前
|
人工智能 安全 API
深度解析 Claude Code 在 Prompt / Context / Harness 的设计与实践
文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。
3803 75
深度解析 Claude Code 在 Prompt / Context / Harness 的设计与实践
|
14天前
|
人工智能 自然语言处理 开发工具
Codex 实践系列 Vol.03:Codex 那些好用的 slash command
本文是Codex系列第三篇,聚焦真实项目协作:以AI志愿填报Demo为案例,详解`/status`、`/goal`、`/plan`等核心slash命令的实战用法——从确认环境、设定目标、规划修改,到聚焦文件、审查diff、复查逻辑、压缩长对话,系统提升AI编程的可控性与工程规范性。
111 2
Codex 实践系列 Vol.03:Codex 那些好用的 slash command
|
11天前
|
存储 人工智能 安全
Agent 小知识|上下文预算:让 Agent 知道该看什么
本文详解Agent系统中关键的“上下文预算”概念:区别于Chatbot的静态对话,Agent需动态管理有限上下文窗口,科学分配目标、规则、工具、记忆与历史等信息。通过固定保留、最近保留、压缩摘要、按需加载四类策略,平衡信息完整性与模型效率,保障长任务稳定执行。
Agent 小知识|上下文预算:让 Agent 知道该看什么