模型权重已加载完成、图编译也已完成,随后多个 Rank 同时报 aclnnMoeDistributeDispatchV4 561000,底层为 HcclAllocComResourceByTiling ret=4。
版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。
这明显是昇腾NPU上的MoE(混合专家)显存分配报错。ret=4 在HCCL里通常指资源不足或参数非法。
核心问题大概率出在 Tiling(分片策略) 上。你的模型权重加载完了,说明基础环境没问题,但在多卡并行分发时,计算图编译阶段发现显存不够或者拓扑不匹配。
排查三步走:
检查显存碎片:重启服务前确保 npu-smi info 无残留进程,显存已完全释放。
调整并行策略:如果是大模型,尝试减小 micro_batch_size 或 pipeline_parallel_size。MoE对通信开销敏感,试试关闭某些优化选项看是否恢复。
确认硬件拓扑:多卡环境下,确保所有Rank的HCCL通信路径正常,有时单卡故障会导致整体分发失败。
别硬扛,先降配试跑,定位是显存瓶颈还是通信bug。
阿里云自主研发的千问大模型,凭借万亿级超大规模数据训练和领先的算法框架,实现全模态高效精准的模型服务调用。https://www.aliyun.com/product/tongyi