阿里云百炼支持哪些AI大模型?文本生成、图像生成、语音合成及视频编辑等模型整理

简介: 阿里云百炼支持通义千问、通义万相等自研模型及DeepSeek、Kimi、Llama等第三方大模型,覆盖文本生成、图像生成、语音合成、视频生成、向量计算等多类AI能力,助力开发者高效构建应用。新用户可免费领取最高5000万Tokens。

阿里云百炼支持哪些大模型?不仅支持自家的通义千问、通义万相等,还支持第三方大模型,如DeepSeek、Kimi、GLM-4.5、Llama、百川、MiniMax等模型。阿里云百炼支持的模型类型包括文本生成、图像生成、语音合成、语音识别、视频生成、文本向量、多模态向量、角色扮演等类型。阿小云分享阿里云百炼支持大模型整理:

阿里云百炼AI大模型支持.png
阿里云百炼AI大模型

阿里云活动中心查看AI大模型

阿里云活动中心:https://t.aliyun.com/U/emyGuZ 查询AI大模型活动,新用户开通阿里云百炼平台,免费领取每个模型100万Tokens,最高可以领取5000万Tokens如下图:

免费领取阿里云百炼AI大模型Tokens

一、文本生成模型

文本生成模型分为通用大语言模型、多模态模型和领域模型:

1、通用大语言模型:

通义千问大语言模型:商业版(通义千问Max、通义千问Plus、通义千问Flash)、开源版(Qwen3、Qwen2.5)、超长文档模型通义千问Long。第三方模型包括DeepSeek、Kimi、GLM-4.5等。

2、多模态模型

多模态模型:视觉理解模型通义千问VL、视觉推理模型QVQ、音频理解模型通义千问Audio、全模态模型通义千问Omni。

3、领域模型

领域模型:代码模型、数学模型、翻译模型、法律模型、数据挖掘模型、深入研究模型、意图理解模型、角色扮演模型。

二、图像生成模型

图像生成模型分为文生图和图像编辑:

1、文生图

  • 通义千问文生图:在复杂文本渲染方面表现突出,特别是中英文文本渲染。
  • 通义万相文生图:适用于生成证件照、电商主图、模特图、各种风格人像图(动漫、国风、二次元等)。
  • 第三方模型:Stable Diffusion和FLUX。
  • 更多模型:创意海报生成、创意文字生成-WordArt锦书

2、图像编辑

  • 通义千问图像编辑:支持中英文提示词输入,可实现风格迁移、文字修改、物体编辑等复杂图文编辑操作。
  • 通义万相图像编辑:适用于扩图、去水印、风格迁移、背景生成、图像修复、图像美化等场景。
  • 更多模型:通义千问图像翻译、通义万相涂鸦作画、通义万相图像局部重绘、人像风格重绘、图像背景生成、图像画面扩展、图像画面扩展、人物实例分割、图像擦除补全、虚拟模特、鞋靴模特、人物写真生成-FaceChain、AI试衣

三、语音合成与识别模型

语音合成与识别分为语音合成和语音识别/翻译:

1、语音合成

Qwen-TTS-Realtime、Qwen-TTS、CosyVoice和Sambert可实现文本转语音,适用于智能语音客服、有声读物、车载导航、教育辅导等场景。

2、语音识别/翻译

Fun-ASR、Gummy、Paraformer和SenseVoice可实现语音转文本,适用于实时会议记录、实时直播字幕、电话客服等场景。此外,Gummy还支持语音翻译。

四、视频编辑与生成模型

视频编辑与生成分为文生视频、图生视频和视频编辑:

1、文生视频

文生视频:一句话生成视频,视频风格丰富,画质细腻。

2、图生视频

首帧生视频:以输入图像作为视频首帧,结合提示词生成完整视频。
首尾帧生视频:提供首帧与尾帧图像,结合提示词生成过渡自然的视频。
多图生视频:支持输入一张或多张图片,参考图片中的主体或背景,并结合提示词生成视频。
图+动作模板生成舞蹈视频:舞动人像AnimateAnyone基于人物图片和动作视频生成舞蹈视频。

图+音频生成对口型视频:

  • 通义万相-数字人基于人物图片和音频,动作幅度大且自然,支持全身、半身、肖像等多种画幅,适合唱歌、表演等场景。
  • 悦动人像EMO基于人物图片和音频,口型与表情表现力强,支持肖像、半身,适合人物特写场景。
  • 灵动人像LivePortrait基于人物图片和音频,适合语音播报场景。

图+表情模板生成表情包视频:表情包Emoji基于人脸图片和预设的人脸动态模板,生成人脸表情包视频。

3、视频编辑

通用视频编辑:基于输入的文本提示词、图片和视频,可执行多种视频编辑任务。例如,通过提取输入视频的运动特征,并结合提示词生成新的视频。

视频口型替换:声动人像VideoRetalk基于人物视频和音频,适合短视频制作、视频翻译等场景。

视频风格转换:视频风格重绘可将视频转换为日式漫画、美式漫画等风格。

五、向量模型

向量模型分为文本向量和多模态向量:

1、文本向量

文本向量:将文本转换成一组可以代表文字的数字,用于搜索、聚类、推荐、分类等。

2、多模态向量

多模态向量:将文本、图像、语音转换成一组数字,用于音视频分类、图像分类、图文检索等。

六、行业模型

行业模型如通义法睿、意图理解:

1、通义法睿

通义法睿:适用于法律咨询、案例分析和法规解读等。

2、多模态向量

意图理解:意图理解模型能够在毫秒级时间内解析用户意图,并选择合适工具来解决用户问题。

更多关于阿里云百炼大模型及收费标准,请参考阿里云百炼官方页面:https://t.aliyun.com/U/GKHJv2

相关文章
|
3月前
|
人工智能 前端开发 算法
大厂CIO独家分享:AI如何重塑开发者未来十年
在 AI 时代,若你还在紧盯代码量、执着于全栈工程师的招聘,或者仅凭技术贡献率来评判价值,执着于业务提效的比例而忽略产研价值,你很可能已经被所谓的“常识”困住了脚步。
1771 89
大厂CIO独家分享:AI如何重塑开发者未来十年
|
2月前
|
云安全 监控 安全
|
2月前
|
人工智能 自然语言处理 API
一句话生成拓扑图!AI+Draw.io 封神开源组合,工具让你的效率爆炸
一句话生成拓扑图!next-ai-draw-io 结合 AI 与 Draw.io,通过自然语言秒出架构图,支持私有部署、免费大模型接口,彻底解放生产力,绘图效率直接爆炸。
1943 153
|
3月前
|
数据采集 人工智能 自然语言处理
让跨境电商“懂文化”:AI内容生成在全球民族特色品类中的实践
本文提出并落地了一套基于大模型与民族文化知识库的民族品类智能识别与匹配方案,旨在解决跨境电商平台在服务穆斯林、印度裔等特定民族群体时面临的“供需错配”难题。
649 27
|
2月前
|
JSON 监控 数据可视化
云监控 UModel Explorer:用“图形化”重新定义可观测数据建模
阿里云 UModel Explorer 正式发布:告别复杂配置,拖拽即建模,点击即洞察,实现建模、探索、分析一体化,让可观测真正高效协同,开启可视化运维新时代!
381 59
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
AI 十大论文精讲(三):RLHF 范式奠基 ——InstructGPT 如何让大模型 “听懂人话”
本文解读AI十大核心论文之二——《Training Language Models to Follow Instructions with Human Feedback》。该论文提出RLHF框架,通过“监督微调-奖励建模-强化学习”三步法,首次实现大模型与人类意图的有效对齐,推动GPT-3进化为更安全、可信的InstructGPT,奠定ChatGPT等后续模型的技术基石,开启大模型“从博学到好用”的新时代。
699 152

热门文章

最新文章