机器学习PAI报错问题之配了tf_config开启训练报错如何解决

本文涉及的产品
交互式建模 PAI-DSW,5000CU*H 3个月
简介: 人工智能平台PAI是是面向开发者和企业的机器学习/深度学习工程平台,提供包含数据标注、模型构建、模型训练、模型部署、推理优化在内的AI开发全链路服务;本合集将收录PAI常见的报错信息和解决策略,帮助用户迅速定位问题并采取相应措施,确保机器学习项目的顺利推进。

问题一:机器学习PAI有大佬知道这个报错怎么解决吗?评估的时候报错!

问题1:机器学习PAI有大佬知道这个报错怎么解决吗?评估的时候报错

问题2:这种问题怎么进一步定位是哪个数据有问题



参考答案:

回答1:一般是tfrecord数据有问题

回答2:一般不是格式问题,就是tfrecord文件写的时候程序不正常,写一半异常终止了,或者文件系统的错误,导致无法解析



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/537514?spm=a2c6h.13066369.question.28.4d7868a2FQH6OT&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@537514._.ID_537514-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_9



问题二:机器学习PAI中model scope 部署到PAI上,Python sdk 报错?

机器学习PAI中model scope 部署到PAI上,Python sdk 报错?https://help.aliyun.com/zh/pai/use-cases/deploy-huggingface-and-modelscope-service-applications-with-one-click-of?spm=a2c4g.11186623.0.i0#790dec242a083![image.png](https://ucc.alicdn.com/pic/developer-ecology/wyvq5mjsckydw_f764e7f303144545b148b2e3c0a067ec.png)在线调试可以跑通![image.png](https://ucc.alicdn.com/pic/developer-ecology/wyvq5mjsckydw_e8e8ece2919641369288773c72bbd54e.png)



参考答案:

这个如果部署时选了ai-web应用的话,我们的sdk暂时还不支持这种链接的形式,有两个方法解决:1. 使用普通的客户端调用,比如:

import requests

import json

service_url = 'YOUR_SERVICE_URL'

token = 'TOKEN'

data = {"input": {"source_sentence": "你好"}}

result = requests.post(service_url, headers={"Authorization": token}, data=json.dumps(data))

print(json.loads(result.text))

  1. 部署的时候可以不选ai-web应用,选择镜像部署;

我们的sdk会尽快支持这个情况



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/558209?spm=a2c6h.13066369.question.29.4d7868a2BGZxGF&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@558209._.ID_558209-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_10



问题三:麻烦问下机器学习PAI,本地单机训练没问题,配了tf_config开启训练报这个错大概是啥问题?

tensorflow.python.framework.errors_impl.OperatorNotAllowedInGraphError: using a tf.Tensor as a Python bool is not allowed in Graph execution. Use Eager execution or decorate this function with @tf.function.

Exception ignored in: >

Traceback (most recent call last):

File "/venv/lib/python3.6/site-packages/tensorflow_core/python/training/server_lib.py", line 158, in del

AttributeError: 'NoneType' object has no attribute 'UnimplementedError'

麻烦问下机器学习PAI,本地单机训练没问题,配了tf_config开启train_distribute: PSStrategy训练报这个错大概是啥问题?



参考答案:

多机的地址要先自己配置好的,默认值是个示例



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/532224?spm=a2c6h.13066369.question.30.4d7868a2zGbQKD&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@532224._.ID_community@@%E9%97%AE%E7%AD%94@@532224-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_llm-OR_ser-V_3-P0_30



问题四:机器学习PAI是这样改吗?我把tar包传到oss上了,还是报一样的错

机器学习PAI是这样改吗?我把tar包传到oss上了,还是报一样的错



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/552511?spm=a2c6h.13066369.question.29.4d7868a2vllB73&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@552511._.ID_community@@%E9%97%AE%E7%AD%94@@552511-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_llm-OR_ser-V_3-P0_31



问题五:机器学习PAI-EAS部署的服务报CrashLoopBackOff错误如何处理

机器学习PAI-EAS部署的服务报CrashLoopBackOff错误如何处理



参考答案:

CrashLoopBackOff错误的原因是EAS框架的library与使用的library有符号冲突

:2022-8-5 杭州地域已全量上线新版本,其他区域暂未发布全量。常见问题请参考PAI-EAS常见问题



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/475897?spm=a2c6h.13066369.question.30.4d7868a2a73VQG&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@475897._.ID_community@@%E9%97%AE%E7%AD%94@@475897-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_llm-OR_ser-V_3-P0_32



问题六:机器学习PAI使用序列特征是要保证等长吗?我这里报tensor shape的错误

机器学习PAI使用序列特征是要保证等长吗?我这里报tensor shape的错误



参考答案:

是的,要确保序列长度相同,大多数深度学习模型要求输入数据具有相同的维度和形状。 可以使用一些方法来确保所有的序列具有相同的长度,比如填充序列,截断序列。



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/506099?spm=a2c6h.13066369.question.31.4d7868a2Qd9NHt&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@506099._.ID_community@@%E9%97%AE%E7%AD%94@@506099-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_llm-OR_ser-V_3-P0_36

相关文章
|
19天前
|
机器学习/深度学习 分布式计算 DataWorks
机器学习PAI常见问题之安装pyalink卡在qtconsole 4.0如何解决
PAI(平台为智能,Platform for Artificial Intelligence)是阿里云提供的一个全面的人工智能开发平台,旨在为开发者提供机器学习、深度学习等人工智能技术的模型训练、优化和部署服务。以下是PAI平台使用中的一些常见问题及其答案汇总,帮助用户解决在使用过程中遇到的问题。
|
19天前
|
机器学习/深度学习 人工智能 分布式计算
机器学习PAI常见问题之配了exporter_type: "final",训练完却没有如何解决
PAI(平台为智能,Platform for Artificial Intelligence)是阿里云提供的一个全面的人工智能开发平台,旨在为开发者提供机器学习、深度学习等人工智能技术的模型训练、优化和部署服务。以下是PAI平台使用中的一些常见问题及其答案汇总,帮助用户解决在使用过程中遇到的问题。
|
21天前
|
机器学习/深度学习 JSON 分布式计算
机器学习PAI常见问题之部署报错如何解决
PAI(平台为智能,Platform for Artificial Intelligence)是阿里云提供的一个全面的人工智能开发平台,旨在为开发者提供机器学习、深度学习等人工智能技术的模型训练、优化和部署服务。以下是PAI平台使用中的一些常见问题及其答案汇总,帮助用户解决在使用过程中遇到的问题。
|
21天前
|
机器学习/深度学习 SQL 人工智能
机器学习PAI常见问题之训练模型报错如何解决
PAI(平台为智能,Platform for Artificial Intelligence)是阿里云提供的一个全面的人工智能开发平台,旨在为开发者提供机器学习、深度学习等人工智能技术的模型训练、优化和部署服务。以下是PAI平台使用中的一些常见问题及其答案汇总,帮助用户解决在使用过程中遇到的问题。
|
21天前
|
机器学习/深度学习 人工智能 分布式计算
机器学习PAI常见问题之运行报错如何解决
PAI(平台为智能,Platform for Artificial Intelligence)是阿里云提供的一个全面的人工智能开发平台,旨在为开发者提供机器学习、深度学习等人工智能技术的模型训练、优化和部署服务。以下是PAI平台使用中的一些常见问题及其答案汇总,帮助用户解决在使用过程中遇到的问题。
|
30天前
|
机器学习/深度学习 存储 搜索推荐
利用机器学习算法改善电商推荐系统的效率
电商行业日益竞争激烈,提升用户体验成为关键。本文将探讨如何利用机器学习算法优化电商推荐系统,通过分析用户行为数据和商品信息,实现个性化推荐,从而提高推荐效率和准确性。
|
12天前
|
机器学习/深度学习 算法 搜索推荐
Machine Learning机器学习之决策树算法 Decision Tree(附Python代码)
Machine Learning机器学习之决策树算法 Decision Tree(附Python代码)
|
1月前
|
机器学习/深度学习 算法 数据可视化
实现机器学习算法时,特征选择是非常重要的一步,你有哪些推荐的方法?
实现机器学习算法时,特征选择是非常重要的一步,你有哪些推荐的方法?
26 1
|
1月前
|
机器学习/深度学习 数据采集 算法
解码癌症预测的密码:可解释性机器学习算法SHAP揭示XGBoost模型的预测机制
解码癌症预测的密码:可解释性机器学习算法SHAP揭示XGBoost模型的预测机制
84 0
|
1月前
|
机器学习/深度学习 数据采集 监控
机器学习-特征选择:如何使用递归特征消除算法自动筛选出最优特征?
机器学习-特征选择:如何使用递归特征消除算法自动筛选出最优特征?
53 0