人工智能平台PAI操作报错合集之带有all reduce 的算子是trace不出来的,结果会错,怎么才可以绕过去

本文涉及的产品
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
模型训练 PAI-DLC,100CU*H 3个月
交互式建模 PAI-DSW,每月250计算时 3个月
简介: 阿里云人工智能平台PAI (Platform for Artificial Intelligence) 是阿里云推出的一套全面、易用的机器学习和深度学习平台,旨在帮助企业、开发者和数据科学家快速构建、训练、部署和管理人工智能模型。在使用阿里云人工智能平台PAI进行操作时,可能会遇到各种类型的错误。以下列举了一些常见的报错情况及其可能的原因和解决方法。

问题一:机器学习PAI这个错误有空能帮忙看下吗?


机器学习PAI这个错误有空能帮忙看下吗?INFO: Found 7 targets...

ERROR: /root/.cache/bazel/_bazel_root/2f9436f914163304d24e844a3ddc3a23/external/tensorrt/BUILD:18:11: Middleman _middlemen/@tensorrt_S_S_Cnvinfer_Uheaders-cc_library-compile failed: missing input file '@tensorrt//:include/NvUtils.h'

ERROR: /root/.cache/bazel/_bazel_root/2f9436f914163304d24e844a3ddc3a23/external/tensorrt/BUILD:18:11: Middleman _middlemen/@tensorrt_S_S_Cnvinfer_Uheaders-cc_library-compile failed: 1 input file(s) do not exist

ERROR: /root/.cache/bazel/_bazel_root/2f9436f914163304d24e844a3ddc3a23/external/tensorrt/BUILD:18:11 Middleman _middlemen/@tensorrt_S_S_Cnvinfer_Uheaders-cc_library-compile failed: 1 input file(s) do not exist

INFO: Elapsed time: 2.172s, Critical Path: 0.00s

INFO: 2 processes: 2 internal.

FAILED: Build did NOT complete successfully


参考回答:

看起来环境里没有 tensorrt,建议还是用disc 的开发镜像, 那个环境是经过 CI 验证的


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/582112



问题二:机器学习PAI一条数据也会报错,什么原因?


机器学习PAI一条数据也会报错?

这个是odps表建表语句

CREATE TABLE IF NOT EXISTS label_knowl_user_training_table_dev_2(

label STRING,

user_sex STRING,

user_organization_group STRING,

user_organization_job_group STRING,

user_knowl_count STRING,

user_points STRING,

user_contribute STRING,

knowl_author_group STRING,

knowl_defind_tag_group STRING,

knowl_feaktm_tags STRING,

knowl_pro_tags STRING,

knowl_organization_group STRING,

knowl_hot STRING,

knowl_view_count STRING,

knowl_reply_count STRING,

knowl_like_count STRING,

knowl_favorite_count STRING,

user_register_at STRING,

user_pr_birthday STRING,

knowl_first_publish_time STRING,

knowl_publish_time STRING,

knowl_vec STRING)

STORED AS ALIORC ;


参考回答:

你的 第 10 个特征的特征值,和你在 EasyRec config 里面的定义,你的第 10 个特征里面没有 kv_separator 吧


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/582125



问题三:机器学习PAI现在带有all reduce 的算子是trace不出来的?结果会错?有办法绕过去吗?


机器学习PAI现在带有all reduce 的算子是trace不出来的,结果会错,有办法绕过去吗? 如果只想融合下算子 ,除了aot autograd,还有其他方式吗?


参考回答:

如果是只是想测下 fusion,直接用就可以了,dynamo 在 trace 的时候会 break 掉 collective ops。 但社区已经在解决这个问题了,比如这个 RFC:https://github.com/pytorch/pytorch/issues/93173 ,以及这个 unit test:https://github.com/pytorch/pytorch/blob/main/test/distributed/test_inductor_collectives.py


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/582108



问题四:机器学习PAI我可以直接用类似这种格式的数据训练带FG功能的模型吗?


机器学习PAI我可以直接用类似这种格式的数据训练带FG功能的模型吗?

因为我之前训练的模型,部署的时候,当设置"fg_mode": "bypass" 的时候,是可以部署成功的,但是设置成"fg_mode": "tf"以后,部署时就会报 Failed to load optimized model 的错误 所以我想知道,训练模型的时候,训练数据就必须是你们表格中的那种格式吗?


参考回答:

"fg_mode": "bypass" 这个模式就相当于直接部署EAS 的 tensorflow processor; 并不能利用用 EasyRecProcessor的额外优势。如果就只是想使用TF的推理服务的话,建议还是直接部署 TF Processor; 如果想使用 EasyRecProcessor, 一般的流程是要使用FG的,这种情况下目前训练数据是必须要处理成 第一个图中的 big string的格式 后面我们也可能会支持直接从原始table训练支持FG功能的模型;目前还不支持 。


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/580116



问题五:机器学习PAI日志中明明上面已经显示savemodelload成功,后面又loadmodel失败呢?


机器学习PAI日志中明明上面已经显示savemodel load成功,后面又load model失败呢?


参考回答:

你没有配item特征表 INVALID_ARGUMENT: Parse fg json config failed .fg.json 要放在 saved_model的目录 asserts 下面

你的json格式有问题 Parse FgConfig from file failed: /larec/build/3rdparty/include/autil/legacy/any.h(112): BadAnyCast: autil::legacy::AnyCast: can't cast from N5autil 6legacy4json10JsonNumberE to Ss, content is 0


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/580776

相关实践学习
使用PAI+LLaMA Factory微调Qwen2-VL模型,搭建文旅领域知识问答机器人
使用PAI和LLaMA Factory框架,基于全参方法微调 Qwen2-VL模型,使其能够进行文旅领域知识问答,同时通过人工测试验证了微调的效果。
机器学习概览及常见算法
机器学习(Machine Learning, ML)是人工智能的核心,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能,它是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域。 本课程将带你入门机器学习,掌握机器学习的概念和常用的算法。
相关文章
|
2月前
|
机器学习/深度学习 人工智能 运维
阿里云PAI人工智能平台介绍、优势及收费标准,手动整理
阿里云人工智能平台PAI是面向开发者和企业的机器学习与深度学习工程平台,提供数据标注、模型构建、训练、部署及推理优化等全链路服务。内置140+优化算法,支持PyTorch、TensorFlow等多种框架,具备高性能训练与推理能力,适用于自动驾驶、金融风控、智能推荐、智慧医疗等多个行业场景。PAI提供零代码开发、可视化建模、大模型一键部署等功能,助力企业快速构建AI应用。支持多种购买方式,如按量付费、预付费等,满足不同业务需求。
|
10月前
|
机器学习/深度学习 人工智能 物联网
通义灵码在人工智能与机器学习领域的应用
通义灵码不仅在物联网领域表现出色,还在人工智能、机器学习、金融、医疗和教育等领域展现出广泛应用前景。本文探讨了其在这些领域的具体应用,如模型训练、风险评估、医疗影像诊断等,并总结了其提高开发效率、降低门槛、促进合作和推动创新的优势。
通义灵码在人工智能与机器学习领域的应用
|
4月前
|
人工智能
生成式人工智能认证(GAI认证)官网 - 全国统一认证中文服务平台上线
生成式人工智能(AI)正深刻改变职场规则,但系统化学习相关技术成为难题。近日,由全球知名教育公司培生推出的生成式人工智能认证(GAI认证)中文官网正式上线,为专业人士和学习者提供了权威解决方案。该认证涵盖核心技能、提示工程、伦理合规等内容,助力持证者紧跟技术前沿,在职场中脱颖而出。全国统一认证平台提供便捷报名与在线考试服务,考后快速出成绩并颁发证书。行动起来,开启AI职业新篇章!
|
8月前
|
存储 人工智能 大数据
AI开发新范式,PAI模型构建平台升级发布
本次分享由阿里云智能集团产品专家高慧玲主讲,聚焦AI开发新范式及PAI模型构建平台的升级。分享分为四个部分,围绕“人人可用”和“面向生产”两大核心理念展开。通过降低AI工程化门槛、提供一站式全链路服务,PAI平台致力于帮助企业和开发者更高效地实现AI应用。案例展示中,介绍了多模态模型微调在文旅场景的应用,展示了如何快速复现并利用AI解决实际问题。最终目标是让AI技术更普及,赋能各行业,推动社会进步。
|
5月前
|
机器学习/深度学习 存储 Kubernetes
【重磅发布】AllData数据中台核心功能:机器学习算法平台
杭州奥零数据科技有限公司成立于2023年,专注于数据中台业务,维护开源项目AllData并提供商业版解决方案。AllData提供数据集成、存储、开发、治理及BI展示等一站式服务,支持AI大模型应用,助力企业高效利用数据价值。
|
6月前
PAI-Rec推荐平台对于实时特征有三个层次
PAI-Rec推荐平台针对实时特征有三个处理层次:1) 离线模拟反推历史请求时刻的实时特征;2) FeatureStore记录增量更新的实时特征,模型特征导出样本准确性达99%;3) 通过callback回调接口记录请求时刻的特征。各层次确保了实时特征的准确性和时效性。
137 0
|
7月前
|
人工智能 自然语言处理 BI
基于阿里云人工智能平台的智能客服系统开发与部署
随着人工智能技术的发展,智能客服系统成为企业提升服务效率和用户体验的重要工具。阿里云提供包括自然语言处理(NLP)、语音识别(ASR)、机器学习(PAI)等在内的完整AI平台,助力企业快速构建智能客服系统。本文将通过电商平台案例,展示如何基于阿里云AI平台从零开始开发、部署智能客服系统,并介绍其核心优势与最佳实践,涵盖文本和语音客服、知识库管理及数据分析等功能,显著提升客户服务效率和用户满意度。
|
9月前
|
机器学习/深度学习 传感器 人工智能
人工智能与机器学习:改变未来的力量####
【10月更文挑战第21天】 在本文中,我们将深入探讨人工智能(AI)和机器学习(ML)的基本概念、发展历程及其在未来可能带来的革命性变化。通过分析当前最前沿的技术和应用案例,揭示AI和ML如何正在重塑各行各业,并展望它们在未来十年的潜在影响。 ####
225 27
|
8月前
|
机器学习/深度学习 人工智能 算法
阿里云人工智能平台图像视频特征提取
本文介绍了图像与视频特征提取技术在人工智能和计算机视觉中的应用,涵盖图像质量评分、人脸属性分析、年龄分析、图像多标签打标、图文视频动态分类打标、视频质量评分及视频分类打标。通过深度学习模型如CNN和RNN,这些技术能从海量数据中挖掘有价值信息,为图像分类、目标检测、视频推荐等场景提供支持,提升分析精度与效率。
467 9
|
10月前
|
机器学习/深度学习 人工智能 监控
AutoTrain:Hugging Face 开源的无代码模型训练平台
AutoTrain 是 Hugging Face 推出的开源无代码模型训练平台,旨在简化最先进模型的训练过程。用户无需编写代码,只需上传数据即可创建、微调和部署自己的 AI 模型。AutoTrain 支持多种机器学习任务,并提供自动化最佳实践,包括超参数调整、模型验证和分布式训练。
847 4
AutoTrain:Hugging Face 开源的无代码模型训练平台

相关产品

  • 人工智能平台 PAI