Qwen3.8-27B 部署测速报告(GB10 / DGX Spark)

简介: 本报告测试Qwen3.8-27B在NVIDIA GB10(121GB统一内存)上的推理性能,覆盖vLLM、SGLang、llama.cpp三大引擎。SGLang+RadixArk NVFP4+NEXTN达成单流23.02 tok/s峰值,为当前最优;llama.cpp Q4_K_M方案仅需17GB显存,兼顾效率与成本。实测GB10单流上限约23 tok/s。

Qwen3.8-27B 部署测速报告(GB10 / DGX Spark)

测试日期:2026-08-14 ~ 08-16

1. 测试环境

项目 配置
GPU NVIDIA GB10(DGX Spark,aarch64,sm_121,121GB 统一内存)
CUDA / 驱动 CUDA 13.0 / 580.142
vLLM vllm025 venv = 0.26.0(torch 2.11.0+cu130);vllm0272 venv = 0.27.2rc1.dev91 nightly(torch 2.13.0+cu130)
SGLang 0.5.17(sgl-kernel 0.3.21,aarch64)
llama.cpp build 10449(master 0d9ceae1e,CUDA 编译)
操作系统内存 121GB 统一内存(GPU/CPU 共享)

2. 测速方法

统一使用 ~/bench_100k.py

  • 输入:约 99,912 tokens 长上下文 prompt(流式 SSE 计时)
  • 输出:256 tokens
  • 指标:Prefill = prompt_tokens / TTFT;Decode = (completion_tokens-1) / (末token时间 - 首token时间)
  • 单请求、单流;并发测试使用 ~/bench_concurrent.py
  • 测速调度脚本:~/gguf_bench_one.sh(llama.cpp)、~/sglang_bench_one.sh(SGLang)

3. 模型文件(~/models/models/

路径 格式 大小 来源
Qwen/Qwen3.8-27B-FP8 safetensors FP8 29G ModelScope(官方)
Inferact/Qwen3.8-27B-NVFP4 safetensors NVFP4 25G HuggingFace
RadixArk/Qwen3.8-27B-NVFP4 safetensors NVFP4(混合:MLP NVFP4 + 注意力 FP8 + MTP/视觉 BF16) 21G HuggingFace
unsloth/Qwen3.8-27B-NVFP4 safetensors NVFP4(compressed-tensors,含 model_mtp.safetensors) 22G HuggingFace
unsloth/Qwen3.8-27B-GGUF GGUF Q8_0/Q6_K/Q5_K_M/Q4_K_M + mmproj-BF16 86G ModelScope
RadixArk/Qwen3.8-27B-DSpark DSpark 推测器(1.36B,block 7)+ 自转 GGUF 2.7G×2 ModelScope

4. vLLM 测试结果

配置 引擎参数要点 启动脚本 Decode Prefill
FP8 基线 v0.26, enforce-eager, util 0.88, 262K, kv fp8 run_qwen38_vllm.sh 7.18 805
NVFP4(Inferact) 基线 同上 run_qwen38_nvfp4_vllm.sh 8.05 1030
FP8 + MTP k=3 v0.27.2, CUDA Graph, util 0.88, 262K run_qwen38_fp8_mtp_vllm.sh 14.76 1031
FP8 + MTP k=3 + 吞吐参数 util 0.5, 131K, async-scheduling, 32768/32 同上 16.71 685
NVFP4 + MTP k=3 v0.27.2, util 0.88, 262K run_qwen38_mtp_vllm.sh 17.80 698
NVFP4 + MTP k=3 + 吞吐参数 util 0.5, 131K, async-scheduling 同上 15.73 727
NVFP4 + MTP k=5 util 0.88 同上 NUM_SPEC_TOKENS=5 13.94 981
NVFP4 + MTP k=8 同上 NUM_SPEC_TOKENS=8 14.62 854
FP8 + DSpark k=3 method=dspark, RadixArk draft, util 0.88 run_qwen38_dspark_vllm.sh 14.55 710
FP8 + DSpark k=7 同上(block 7 原生) NUM_SPEC_TOKENS=7 17.63 688

注:vLLM 仅支持单一推测方法,MTP+DSpark 不可叠加;util 0.9 曾导致系统卡死,安全上限 0.88。

5. llama.cpp 测试结果(-c 262144 -ngl 99 -fa on --mmproj)

量化 无MTP MTP n=3 MTP n=5 MTP n=8 DSpark(n=7)
Q8_0 (29G) 6.35 14.13 12.91 14.08 12.54
Q6_K (23G) 7.10 15.90 19.49 15.20 20.24
Q5_K_M (20G) 7.98 16.17 16.93 14.11
Q4_K_M (17G) 8.78 19.65 21.44 15.70 21.33

Prefill 均在 520~620 tok/s 区间。
精度实测(llama-perplexity,同一技术文本):Q8_0 PPL=1.2373,Q4_K_M PPL=1.2411,相对损失 ~0.3%
MTP+DSpark 链式(draft-mtp,draft-dspark):不可行——链式要求 draft 模型自带 MTP 头,DSpark checkpoint 没有。

启动脚本:run_qwen38_gguf.sh(Q4_K_M+MTP n5)、run_qwen38_gguf_q6k_dspark.sh(Q6_K+DSpark)。

6. SGLang 测试结果(0.5.17, flashinfer 后端, trust-remote-code)

配置 Decode Prefill 脚本/参数
RadixArk NVFP4 + NEXTN(MTP 3/1/4) 23.02 🏆 744 sglang_bench_one.sh $R nextn
unsloth NVFP4 + NEXTN 19.12 842 同上 $U nextn
RadixArk NVFP4 + NEXTN + DGX调优 21.31 1098 EXTRA_ARGS: mem 0.95, mamba-ratio 4.59, chunk 8192, disable-prefill-cuda-graph
RadixArk NVFP4 + NEXTN + 仅prefill优化 21.86 1106 chunk 8192 + disable-prefill-cuda-graph(最终采用
NVFP4 + DSPARK(两版) ❌ 失败 SGLang 0.5.17 DSPARK 实现报 shape mismatch,需 main 分支

7. 并发测试

配置 并发 聚合 decode 每路
vLLM NVFP4+MTP(吞吐参数) 8 82.2 tok/s 10.3~11.3
llama.cpp Q4_K_M+MTP n5 4 43.9 tok/s 11.0~11.8
llama.cpp Q4_K_M+MTP n5 2 26.5 tok/s 13.3~13.4

8. 结论

  1. 单流冠军:SGLang + RadixArk NVFP4 + NEXTN = 23.02 tok/s(100K 上下文)
  2. 最终采用(常驻服务 ~/run_qwen38_sglang.sh):RadixArk NVFP4 + NEXTN + prefill 优化(chunk 8192 + disable-prefill-cuda-graph),decode 21.86~23 tok/s、prefill 1106 tok/s(TTFT 90s@100K,比默认快 47%)
  3. GB10 单流天花板 ~23 tok/s(内存带宽 273GB/s 物理限制),30 tok/s 不可达
  4. RadixArk NVFP4 优于 unsloth NVFP4(23.02 vs 19.12),unsloth 版已删除,仅保留 RadixArk 版
  5. MTP/DSpark 推测采样不影响生成质量(验证采样保分布);k/n-max 甜点位 3~5,过大反而回落
  6. llama.cpp 路线胜在内存占用小(17GB Q4_K_M),SGLang 胜在速度与并发

9. 过程中修复的环境问题(备忘)

  • flashinfer JIT 需 venv bin 在 PATH(找 ninja);MAX_JOBS=2 防 nvcc 并发 OOM
  • .bashrcCUDA_HOME=/usr/local/cuda-12.4 指向残缺工具链,脚本内强制 /usr/local/cuda
  • RadixArk DSpark 的 config.json 架构名需从 DSparkDraftModel 改为 Qwen3DSparkModel(vLLM 识别),已备份 config.json.bak
  • vLLM 0.27.2 nightly 才有 Qwen3.8 的 MTP gated-delta-net 修复
目录
相关文章
|
9天前
|
缓存 自然语言处理 测试技术
国产旗舰大模型详解:Qwen3.8‑Max MoE架构、办公编程能力、API与Qoder‑CLI实操
大模型技术持续迭代,模型不再局限简单问答、片段代码生成,向着全栈工程开发、原生多模态理解、超长文档解析、长周期自主闭环任务演进。Qwen3.8‑Max作为新一代旗舰基座模型,基于第三代稀疏混合专家MoE架构打造,总参数规模达到2.4万亿,推理阶段仅激活950亿有效参数,兼顾超大模型知识容量与推理效率。该模型支持最高100万Token超长上下文窗口,具备原生多模态理解、全栈自主编程、数百类专业办公任务处理、数千轮长周期自主执行能力,同时兼容OpenAI标准接口协议,提供Qoder‑CLI命令行工具,适配个人开发者、企业业务系统、科研项目、智能体Agent开发等多元场景。本文从底层技术架构、核心能
397 0
|
2月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
4108 144
|
9天前
|
缓存 人工智能 监控
整理了一份 DeepSeek Harness 必备插件清单!
本文是DeepSeek Harness发布半个多月后的插件精选指南,涵盖10款高实用性插件:从生态入口dsh-market、视觉增强modlens,到界面升级、代码侧栏、文件引用、桌面端、多源搜索、长期记忆、费用监控及知识精读工具。附安装命令与适用场景,新手三步起步建议,助你高效打造个性化AI工作台。
758 4
整理了一份 DeepSeek Harness 必备插件清单!
|
1月前
|
机器学习/深度学习 Web App开发 编解码
2026 年 8 月大模型的三重跃迁
8月1—3日,国产大模型密集突破:通义千问Qwen3.8-Max以2.4T稀疏MoE+1M上下文实现高效推理;MiniMax开源全模态视频模型H3,支持2K/15秒带声视频生成;DeepSeek V4-Flash显著提升Agent能力。三大进展分别指向参数效率、长程自治与多模态生产,标志着大模型正从“辅助工具”迈向“端到端自主交付”。
2068 1
2026 年 8 月大模型的三重跃迁
|
1月前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)
|
2月前
|
人工智能 弹性计算 API
【AI 尝鲜实验室】上新 | New API:一个入口打通全网大模型的统一网关
New API 是 QuantumNous 开源的大模型网关与 AI 资产管理系统(AGPL-3.0,GitHub 42k+ Stars),聚合 OpenAI、Claude、Qwen 等主流模型,提供统一 OpenAI 兼容接口、渠道分组、自动重试、额度管理及在线充值。本实验通过阿里云计算巢一键部署,几分钟即可搭建专属网关,支持团队令牌分发与国产模型无缝接入编程工具。
870 3
|
4月前
|
存储 Rust NoSQL
一条命令迁移,帮你实现 OpenClaw 与 Hermes Agent 记忆互通!
本文是基于阿里云 Tablestore 的 Agent 记忆共享实战指南:一条命令迁移 OpenClaw 记忆至 Hermes,通过统一 Tablestore 实例、应用 ID 与租户 ID,实现跨Agent(如龙虾与马)记忆自动互通、实时同步与语义检索,支持 CLI 管理与对话中直接调用,安全可靠,开箱即用。
6062 125
|
10天前
|
缓存 人工智能 计算机视觉
Qwen3.8-Flash模型介绍:能力、上下文限制、费用定价详细说明
通义千问最新多模态大模型Qwen3.8-Flash(ID:qwen3.8-flash),原生支持百万级上下文(100万tokens)、文本/图像/视频输入,输出为文本。具备Function Calling、结构化输出、联网搜索(限北京/新加坡)等能力,兼容OpenAI/Anthropic协议,已在阿里云百炼平台开放免费试用(赠100万Tokens)。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens

热门文章

最新文章