AI推理服务平台升级,阿里云机器学习PAI推出新规格

简介: 全新推理规格 GU30 问世,与传统规格相比价格平均优惠45%。

导语:

随着生成式AI模型不断拓宽AI应用的场景边界,模型在线服务的数量级快速增长,AI推理环节亟需精细化的资源管理。


近日,阿里云机器学习平台PAI宣布全面升级模型服务平台PAI-EAS,面向文图生成、大语言模型等各类模型提供弹性稳定的推理服务,并推出全新规格GU30,与传统规格相比价格平均优惠45%。


全新推理规格GU30问世,释放技术红利

AI工程化链路中,推理服务是打通“模型到应用最后一公里”的重要环节,并持续伴随业务成长。


PAI-EAS是PAI推出的弹性推理服务平台,提供异构硬件 (CPU/GPU) 模型加载和服务部署,支撑达摩院、淘宝、高德等业务大量级模型服务,并广泛服务阿里云上企业客户。结合推理优化技术和云原生生态,PAI-EAS进一步提升异构资源集群整体利用率,规模化地实现服务效率与性能提升,扩大让利空间。


新推出的PAI-EAS GU30系列规格,专用于深度学习异构推理场景,较PAI-EAS同等性能的传统规格价格下降45%。


GU30可适配不同复杂程度的模型,支撑文图生成、大语言模型、多模态模型、NLP、CV、ASR等的推理需求。付费模式上,EAS同时支持预付费和灵活的按量付费,用户可以通过弹性扩缩容、弹性资源池等能力精细化地按需管控推理资源。



image.png

Serverless化覆盖多样推理场景

作为云上AI推理服务平台,PAI-EAS在基础设施层、容器调度层、模型部署层都提供丰富的产品功能,贴合不同场景的个性化需求。


  • 实时同步推理场景,例如个性化推荐或类ChatGPT对话应用等,用户可通过一键压测得到服务的QPS和时延阈值,并结合灰度发布和蓝绿部署功能,在不影响线上业务的情况下进行性能验证并顺滑切换。
  • 近实时异步推理场景,例如文图生成或视频处理等,涉及较为复杂模型的推理,单次推理时间从十几秒到几十分钟不等,PAI-EAS在推理服务内部集成服务维度的消息队列,并支持面向队列长度实现推理的自动弹性扩缩容,满足资源利用率提升及免运维需求。
  • 离线批量推理场景,例如语音数据批量文本转换等时延不敏感的场景,PAI-EAS可通过抢占型资源实例的方式帮助用户控制批量推理成本。

image.png

PAI-EAS最新活动

从2023年4月中旬起,阿里云产品试用中心将正式开放PAI-EAS同等算力的试用规格,提供最长3个月的模型在线服务免费体验包。点击PAI-EAS产品页官网(链接:https://www.aliyun.com/activity/bigdata/pai/eas),可在PAI-EAS产品官网获得最新活动信息。

相关实践学习
使用PAI+LLaMA Factory微调Qwen2-VL模型,搭建文旅领域知识问答机器人
使用PAI和LLaMA Factory框架,基于全参方法微调 Qwen2-VL模型,使其能够进行文旅领域知识问答,同时通过人工测试验证了微调的效果。
机器学习概览及常见算法
机器学习(Machine Learning, ML)是人工智能的核心,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能,它是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域。 本课程将带你入门机器学习,掌握机器学习的概念和常用的算法。
相关文章
|
8月前
|
存储 机器学习/深度学习 算法
​​LLM推理效率的范式转移:FlashAttention与PagedAttention正在重塑AI部署的未来​
本文深度解析FlashAttention与PagedAttention两大LLM推理优化技术:前者通过分块计算提升注意力效率,后者借助分页管理降低KV Cache内存开销。二者分别从计算与内存维度突破性能瓶颈,显著提升大模型推理速度与吞吐量,是当前高效LLM系统的核心基石。建议收藏细读。
1561 125
|
8月前
|
人工智能 自然语言处理 IDE
模型微调不再被代码难住!PAI和Qwen3-Coder加速AI开发新体验
通义千问 AI 编程大模型 Qwen3-Coder 正式开源,阿里云人工智能平台 PAI 支持云上一键部署 Qwen3-Coder 模型,并可在交互式建模环境中使用 Qwen3-Coder 模型。
1259 109
|
7月前
|
人工智能 自然语言处理 安全
用AI重构人机关系,OPPO智慧服务带来了更“懂你”的体验
OPPO在2025开发者大会上展现智慧服务新范式:通过大模型与意图识别技术,构建全场景入口矩阵,实现“服务找人”。打通负一屏、小布助手等系统级入口,让服务主动触达用户;为开发者提供统一意图标准、一站式平台与安全准则,降低适配成本,共建开放生态。
605 31
|
7月前
|
存储 人工智能 安全
《Confidential MaaS 技术指南》发布,从 0 到 1 构建可验证 AI 推理环境
Confidential MaaS 将从前沿探索逐步成为 AI 服务的安全标准配置。
|
8月前
|
存储 人工智能 NoSQL
用Context Offloading解决AI Agent上下文污染,提升推理准确性
上下文工程是将AI所需信息(如指令、数据、工具等)动态整合到模型输入中,以提升其表现。本文探讨了“上下文污染”问题,并提出“上下文卸载”策略,通过LangGraph实现,有效缓解长文本处理中的信息干扰与模型幻觉,提升AI代理的决策准确性与稳定性。
991 2
用Context Offloading解决AI Agent上下文污染,提升推理准确性
|
8月前
|
人工智能
AI推理方法演进:Chain-of-Thought、Tree-of-Thought与Graph-of-Thought技术对比分析
大语言模型推理能力不断提升,从早期的规模扩展转向方法创新。2022年Google提出Chain-of-Thought(CoT),通过展示推理过程显著提升模型表现。随后,Tree-of-Thought(ToT)和Graph-of-Thought(GoT)相继出现,推理结构由线性链条演进为树状分支,最终发展为支持多节点连接的图网络。CoT成本低但易错传,ToT支持多路径探索与回溯,GoT则实现非线性、多维推理,适合复杂任务。三者在计算成本与推理能力上形成递进关系,推动AI推理向更接近人类思维的方向发展。
548 4
|
8月前
|
人工智能 监控 数据可视化
如何破解AI推理延迟难题:构建敏捷多云算力网络
本文探讨了AI企业在突破算力瓶颈后,如何构建高效、稳定的网络架构以支撑AI产品化落地。文章分析了典型AI IT架构的四个层次——流量接入层、调度决策层、推理服务层和训练算力层,并深入解析了AI架构对网络提出的三大核心挑战:跨云互联、逻辑隔离与业务识别、网络可视化与QoS控制。最终提出了一站式网络解决方案,助力AI企业实现多云调度、业务融合承载与精细化流量管理,推动AI服务高效、稳定交付。

热门文章

最新文章

相关产品

  • 人工智能平台 PAI