MindIE PD分离部署Q&A

简介: 使用mindie进行PD分离部署

PD分离是一种近年来兴起的推理加速部署方案,kimi、deepseek都进行了工程落地。昇腾MindIE组件也支持了PD分离部署能力,参考链接为 https://www.hiascend.com/document/detail/zh/mindie/20RC1/mindieservice/servicedev/mindie_service0140.html 。部署过程中会出现一些问题,在这里记录分享一下。

单机部署

Q:运行deploy.sh 报错 core dump

A:大概率是选择了错误了 镜像,例如A2的机器使用了A3的镜像。

Q:运行deploy.sh 后,pods的状态为UnexpectedAdmissionError

A:mindie_service_single_container.yaml配置文件中,resources/requests/huawei.com/Ascend910的值目前只能为8,小于8会触发报错。

多机部署

Q:运行deploy.sh 后,coordinator一直显示not ready

A:可能是没有配置正确的rank_table_file,导致P、D节点没有拿到device信息,不能载入模型,解决方案参考 https://zhuanlan.zhihu.com/p/1900192566378497634 。

Q:拉起k8s失败,输出 kubectl get configmap rings-config-mindie-server-p0...

A:可能是之前的进程没有删除干净;deployment目录下面的yaml文件的配置可能需要修改,如果是单机16卡,则npu的卡数需要改成16;可以查看 /var/log/mindx-dl/ascend-operator的日志,检查是否有json文件的格式错误。

参数配置建议

使用benchmark工具发送请求。

llama3-8B

卡数 输入输出 concurrency 发送频率 prefill_bs decode_bs
PD混部 1 257-60 7 10 100
PD分离 2+3 257-60 1000 93 2 18
目录
相关文章
|
Kubernetes 调度 开发者
qwen模型 MindIE PD分离部署问题定位
使用MindIE提供的PD分离特性部署qwen2-7B模型,使用k8s拉起容器,参考这个文档进行部署:https://www.hiascend.com/document/detail/zh/mindie/100/mindieservice/servicedev/mindie_service0060.html,1个Prefill,1个Decode。 最后一步测试推理请求的时候,出现报错:model instance has been finalized or not initialized。
946 1
|
10月前
|
负载均衡 Docker Python
vLLM-Ascend 安装部署与环境配置指南
vLLM-Ascend 是 vLLM 项目专为华为昇腾 NPU 设计的硬件插件,支持主流大模型与多模态架构,提供高性能推理能力。项目结构清晰,涵盖核心算子、工具脚本与容器化部署方案,兼容单/多节点环境,助力高效构建昇腾上的 AI 推理服务。
4619 1
|
JSON 数据格式 Docker
docker load导入镜像报错:open /var/lib/docker/tmp/docker-import-970689518/bin/json: no such file or directo...
docker load导入镜像报错:open /var/lib/docker/tmp/docker-import-970689518/bin/json: no such file or directo...
7917 0
|
6月前
|
人工智能 自然语言处理
上下文长度是什么意思?AI大模型128k、256k和1M上下文长度是什么概念?
上下文长度指大模型单次处理的最大Token数,涵盖输入与输出。如Qwen、DeepSeek等支持128K(约16万汉字)、256K乃至1M上下文,直接影响长文档理解、多轮对话与代码分析能力。阿里云百炼/通义平台提供详细参数与阶梯计费
15139 3
|
算法 PyTorch 算法框架/工具
昇腾 msmodelslim w8a8量化代码解析
msmodelslim w8a8量化算法原理和代码解析
1556 5
vllm+vllm-ascend本地部署QwQ-32B
本指南介绍如何下载、安装和启动基于Ascend的vLLM模型。首先,可通过华为镜像或Hugging Face下载预训练模型;其次,安装vllm-ascend,支持通过基础镜像(如`quay.io/ascend/vllm-ascend:v0.7.3-dev`)或源码编译方式完成;最后,使用OpenAI兼容接口启动模型,例如运行`vllm serve`命令,设置模型路径、并行规模等参数。适用于大模型推理场景,需注意显存需求(如QwQ-32B需70G以上)。
5411 17
|
Linux Windows
Windows 10/11从官网下载ISO的方法
本文介绍了两种从微软官网下载Windows 10/11 ISO镜像的方法。一是通过修改浏览器User Agent为Linux系统,使官网提供ISO下载链接;二是使用UUPDUMP工具,从官网下载并转换为ISO格式,支持最新开发版,操作简便。
|
10月前
|
Linux Docker 容器
docker下部署 vLLM 启动Qwen3-VL-32B-Instruct模型
本文介绍在CentOS系统、A10 6×24G显卡环境下,通过Docker部署vLLM并启动Qwen3-VL-32B-Instruct大模型的完整流程,涵盖镜像拉取、容器配置、多卡并行与显存优化设置,支持32K上下文,附带启动脚本及调用验证示例。
9540 2

热门文章

最新文章