飞桨x昇腾生态适配方案:02_常用环境变量

简介: 本节介绍训练前建议设置的常用环境变量,涵盖NPU私有格式、在线编译、性能优化参数(如`aclnn_scale`和`aclnn_split`)、算子黑名单配置、NPU卡号指定、Paddle内存分配策略及日志设置等内容。通过合理配置这些变量,可有效提升训练性能并解决潜在问题。例如,关闭`FLAGS_npu_storage_format`以禁用NPU私有格式,或调整`ASCEND_MAX_OP_CACHE_SIZE`优化Kernel缓存大小。同时,CANN和Paddle的日志环境变量也提供了调试支持。

训练常用环境变量

本节介绍的环境变量建议在训练前提前设置好。

NPU私有格式

0为关闭,建议关闭:

export FLAGS_npu_storage_format=0

NPU在线编译

false为关闭,建议小模型关闭,大模型打开:

export FLAGS_npu_jit_compile=false

aclnn_scale

在大模型场景设置False性能更好,小模型场景设置True性能更好:

export FLAGS_npu_scale_aclnn=True

aclnn_split

在大模型场景设置False性能更好,小模型场景设置True性能更好:

export FLAGS_npu_split_aclnn=True

npu算子加黑名单

npu算子加黑名单跑cpu,禁用NPU算子名单,可用来暂时规避精度问题,或者确认问题算子(set_value为算子名称):

export CUSTOM_DEVICE_BLACK_LIST=“set_value”

指定NPU卡号

export ASCEND_RT_VISIBLE_DEVICES=0,1,2,3,4,5,6,7

Paddle view机制

当前在NPU部分模型上性能较差,0为关闭,建议关闭:

export FLAGS_use_stride_kernel=0

Paddle内存分配方式

默认为最大值申请,可能在个别模型上引入内存问题,建议使用auto_growth随使用申请

export FLAGS_allocator_strategy_kernel=auto_growth

kernel缓存大小

设置kernel缓存大小,以防止模型训练后期性能衰减

export ASCEND_MAX_OP_CACHE_SIZE=5000

CANN日志环境变量

设置日志打屏

1为打屏,可开启后将日志重定向到.log文件中

export ASCEND_SLOG_PRINT_TO_STDOUT=1

设置日志等级

0为INFO级,所有的日志均输出,3为ERROR级

export ASCEND_GLOBAL_LOG_LEVEL=0

Paddle日志环境变量

Paddle的glog等级中,0为无日志,10为全开日志,一般开启到3即可

export GLOG_v=3

开启glog后重定向.log文件需要在语句最后加入 2>&1 命令,例如:

python tools/train.py -c PP-OCRv4_server_rec_ic15_data.yaml -o
Global.use_gpu=False Global.use_npu=True > ocr.log 2>&1
目录
相关文章
|
机器学习/深度学习 自然语言处理 并行计算
Self-Attention 原理与代码实现
Self-Attention 原理与代码实现
1590 0
|
机器学习/深度学习 Docker 容器
飞桨x昇腾生态适配方案:01_基础环境准备
本指南详细介绍在ARM环境中准备CANN环境、安装Paddle深度学习框架及PaddleCustomDevice的过程。首先下载并加载CANN镜像,启动Docker容器;接着通过日构建包或源码编译安装PaddlePaddle和PaddleCustomDevice;可选更新CANN版本时需注意环境变量配置与路径设置。最后提供基础功能检查方法,包括硬件后端、版本验证及框架健康检查,确保环境搭建成功。
1326 0
|
机器学习/深度学习 PyTorch 算法框架/工具
飞桨x昇腾生态适配方案:00_整体方案介绍
本文详细介绍PaddlePaddle与NPU的适配工作,涵盖训练与推理支持、性能优化及离线推理方案。PaddleCustomDevice作为适配层,支持主流模型(详见飞桨-昇腾模型列表),多数性能媲美V100,部分调优模型接近0.8*A800。硬件适配主要针对A2芯片,A1兼容但310系列建议离线推理。提供常用模型仓链接及整体方案导览,包括环境准备、算子适配、性能调优和Paddle转ONNX/OM等内容。
1074 0
|
开发者
鸿蒙开发:了解分割线
在实际的开发中,如果自带的分割线能够满足我们的需求,以自身的分割线属性为主,如果不满足,我们可以使用组件进行绘制。
488 16
鸿蒙开发:了解分割线
|
8月前
|
Java Spring
Spring Boot 中的 @RequestParam:获取查询参数与表单数据
`@RequestParam` 用于提取 HTTP 请求中的查询参数或表单数据,支持设置参数名、是否必填及默认值。适用于 `?key=value` 形式或 POST 表单,字段多时推荐封装为实体类自动绑定,与 `@PathVariable` 按路径取值不同,用途明确,是处理 Web 请求的常用方式。
|
Linux 数据安全/隐私保护 Perl
CentOS7中升级OpenSSL详细教程
这篇文章提供了在CentOS 7系统中升级OpenSSL到3.2版本的详细步骤,包括备份现有配置、安装依赖、下载安装新版本以及验证安装结果。
4175 3
|
存储 文字识别 文件存储
飞桨x昇腾生态适配方案:03_模型训练迁移
本案例以PaddleOCRv4模型为例,详细介绍了将模型迁移到NPU的完整流程。迁移过程中需确保模型功能在新硬件上无误,重点关注偶发性错误及长时间运行时可能出现的问题,并通过日志辅助定位问题。文档涵盖环境搭建、数据集准备、模型配置、训练启动及常见问题排查等内容。例如,通过设置环境变量排查缺失算子,处理Paddle版本兼容性问题,以及解决进程残留等。适合希望将OCR模型部署到NPU的开发者参考。
720 0
|
文字识别 算法 API
飞桨x昇腾生态适配方案:04_模型精度对齐
本文详细介绍了模型在不同硬件(如GPU与NPU)间迁移时的精度对齐方法,包括前向和反向对齐的具体步骤。前向对齐通过模块化对比计算结果(如平均值、最大最小值等),确保误差在合理范围内;反向对齐则聚焦于梯度差异,利用二分法定位问题算子。同时,文章结合PPHGNet_small和MultiHead等具体模块代码,说明了如何打印输出并分析中间结果。此外,还探讨了私有格式、梯度异常及特殊shape等可能影响精度的因素,并提出相应解决策略。整体流程清晰,为跨硬件模型迁移提供了实用指导。
877 10
|
JSON 数据格式 AI芯片
飞桨x昇腾生态适配方案:14_loop算子缺失(上):ONNX模型拆分
本文针对NPU不支持LOOP算子的问题,提出一种解决方案:将ONNX模型拆分为含LOOP算子和不含LOOP算子的子图,单独推理LOOP部分。通过构造包含LOOP算子的ONNX模型,将其转换为JSON格式提取子图,并对子图进行修改(如添加输入节点、删除无关节点)。最后,将JSON转回ONNX格式,完成模型切分与优化。此方法适用于关键路径上的LOOP算子,可有效解决离线推理中的兼容性问题。
1007 26
|
API Python
飞桨x昇腾生态适配方案:13_API离线推理
ais_bench 提供了基于昇腾硬件的 Python API,用于离线模型(.om模型)推理。支持静态与动态API场景,如单个或多个OM模型推理。通过 `InferSession` 类加载模型并执行推理,可灵活处理输入输出形状转换。示例代码涵盖图片读取、形状调整、多模型串联推理及资源释放等操作,满足多样化推理需求。
1044 26

热门文章

最新文章