虚拟数字人开放平台产品分享

简介: 本文摘自虚拟数字人新品发布会姜望讲解部分

——姜望

机器智能技术产品专家

一、产品介绍

image.png

过去几年,我们不断与行业客户进行深入沟通,探讨虚拟数字人领域的未来和现状,了解一些客户的需求和痛点。

许多开发者和客户没有专属的引擎工程师,缺乏 3D 资产构建能力,从零开发人工智能技术需要大量的时间、人力和成本投入。也有客户希望用自有版权的数字人形象创建数字人应用。此外,云渲染机器成本高、服务端资源利用率低也不可忽视的问题。

image.png

为了解决开发者的痛点,尽可能满足用户需求,我们研发并推出了虚拟数字人开放平台。

虚拟数字人开放平台的定位是一款工具型 PaaS 平台,提供了包含简单实用接口的标准化公共云服务,同时也提供了专有云服务。产品是面向仅拥有通用前端后端技术能力的开发团队以及有数字人相关需求的客户。

数字人开放平台具有以下四个优势

l  为开发者提供了内置的 3D2D 模型动画以及包含普通话方言语音资产。通过以上资产,开发者可以组合出适合不同场景行业的数字人形象。

l  将渲染驱动构建和互动能力封装标准接口,开发者无需关注内部实现,大幅降低研发周期和成本。

l  提供了 RTCRTMP离线视频等不同的媒体服务,开发者可以直接推流或下载到应用端上。

l  提供了自助升降配功能以及弹性复机量计费能力。

未来,我们将继续听取客户意见和反馈,不断完善产品能力,提升服务质量。

二、产品架构图

image.png

上图为虚拟数字人开放平台的产品架构图,主要包含应用场景和产品能力产品能力为应用场景做支撑。在产品能力上,本次发布了通过云渲染实现的虚拟数字人流媒体服务,其中包含 3D 实时文本驱动、2D实时文本驱动、3D离线文本驱动、2D离线文本驱动、3D实时语音驱动等几个核心能力。围绕以上核心能力,还构建了Avatar UI 形象资产库、动作库、声音库、多模双工组件等配套服务,以帮助开发者更好地实现数字人构建与互动能力。

核心能力和配套服务也离不开阿里云提供的基础能力支持,例如 ASRTTS智能对话机器人、RTCECS 等。通过产品能力,阿里云用户可以高效、快速、便捷地为终端客户场景提供服务,包括线下智慧互动屏、视频客服、长短视频制作客服转人工智能助理、电商直播内容直播视频会议等。

此外,我们还为数字人的 SaaS 层基础应用以及解决方案提供底层能力支持。

三、数字人资产管理

image.png

数字人供应板块主要包含了数字人预置、形象管理、形象选择、声音选择等服务。通过构建年轻化、互动化、人格化特征的数字人资产,帮助阿里云客户获得更多用户的青睐。

以下为3D 数字人捏脸功能演示:

image.png

点击 3D 数字资产 tab下的新建角色,输入角色的名称点击确定进入角色创建界面。在角色创建界面可以调整发型、脸型、妆容、服装和声音。选择完成后,点击保存,方便之后配置。

image.png

如果用户已经按平台提供的技术规范安排真人模特拍摄了指定的视频素材,还可通过 2D 数字人资产界面新建形象填写名称,将素材进行分类标签命名后新建专属的 2D 数字人形象。新建的 2D 形象目前只能供数字人应用部分离线生成数字人视频时使用。

四、实时文本驱动(3D2D

image.png

实时文本驱动提供了一系列标准接口,允许开发者以简单的接口访问和调用,启动数字人服务,发送文本让数字人播报,并且可以通过 RTC 或 RTMP 将生成的数字流媒体推送到指定的端上。

目前实时文本驱动支持 3D 与 2D 数字人,其中 3D 支持捏脸换装,2D支持上传视频素材,并且都可以选择不同风格的男女声音以及方言。数字人会依据输入文本自动识别意图,并且播放相应的口型动画。此外,还提供了内置的Avatar UI 功能,支持字幕、图片、卡片等内容的展示双工打断、 RTC 透明通道等功能也已上线。

实时文本驱动适合构建线下大屏视频客服、虚拟主播、智能助理等场景应用。

image.png

图展示结合 ASR、智能对话机器人实现数字人客服效果。

首先终端用户通过麦克风收音,开发者可将音频通过阿里云提供的 ASR 接口进行处理收集到终端用户的问题文本。然后将该文本输入对话机器人对话流,对话机器人吐出答案文本后,即可将该文本发送到实时文本驱动数字人播报接口,通过内置的数字人驱动渲染引擎合成的视频流可以通过阿里云提供的 RTC SDK 拉流到终端上,最终形成数字人画面嵌入终端的效果。

通过以上方式可以完成带有互动效果的数字人在终端的部署。

image.png

针对直播场景,可以使用类似的方式实现。与上一张图不同之处在于终端用户观看直播的评论互动需要经过开发者的筛选,并且最终合成的视频流可以通过 RTMP 协议直接推流到直播平台前提是直播平台提供了对应的推流地址和推流码。

相关文章
《虚拟数字人视频创作产品分享》电子版地址
虚拟数字人视频创作,是一项离线渲染数字人并生成视频的技术应用方案,支持2D真人数字人形象和3D虚拟数字人形象的离线渲染。用户通过方案提供一个简约便捷的Web网页操作界面,可实现“输入文本/音频,驱动数字人形象生成视频,并下载视频内容”的效果。作为技术内容型的解决方案,它可作为高效的内容创作工具,广泛适用于多媒体播报、知识教育、内容宣导等场景。
137 1
《虚拟数字人视频创作产品分享》电子版地址
|
6月前
|
传感器 人工智能 搜索推荐
|
9天前
|
API 语音技术 开发者
基于开源技术的数字人实时对话:形象可自定义,支持语音输入,对话首包延迟可低至3s
魔搭社区最近上线了基于开源技术的数字人实时对话demo,无需预训练即可使用自定义的数字人形象进行实时对话,支持语音输入和实时对话。
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
【人工智能】python之人工智能应用篇--数字人生成技术
数字人生成技术是基于人工智能技术和计算机图形学技术创建的虚拟人物形象的技术。该技术能够模拟人类的外貌、声音、动作和交流能力,为多个领域带来创新的应用可能性。数字人的本质是将所有信息(数字和文字)通过数字处理(如计算机视觉、语音识别等)再进行表达的过程,形成具有人类形态和行为的数字产物。 数字人的生成涉及到多种技术,如3D重建技术,使用三维扫描仪扫描人的外观、五官等,并通过3D模型重建三维人;虚拟直播技术,使用计算机技术生成人物或实体,并且可以实时直播、录制;数字人体数据集技术,利用数据构建数字人模型以及训练虚拟现实引擎等
110 4
|
4月前
|
新零售 人工智能 vr&ar
国家发展改革委等部门:鼓励利用数字人等技术拓展电商直播场景!
国家发改委推出措施鼓励创新消费场景,特别提到利用AI、VR等技术增强购物体验,支持数字人电商。青否数字人直播系统提供独立部署方案,适应抖音直播并解决封号问题,具备实时话术改写和AI智能回复功能,确保互动合规。此系统适用于24小时直播,降低商家成本,提升效率。欲了解更多信息,可访问:zhibo175。
国家发展改革委等部门:鼓励利用数字人等技术拓展电商直播场景!
|
5月前
|
算法
VASA-1:实时音频驱动的数字人说话面部视频生成技术
【6月更文挑战第8天】VASA-1是实时音频驱动的数字人面部视频生成技术,能根据输入音频精准生成匹配的面部表情。具备实时性、高准确性和适应性,适用于虚拟主播、在线教育和影视娱乐等领域。简单示例代码展示了其工作原理。尽管面临情感理解和硬件优化等挑战,但随着技术发展,VASA-1有望在更多领域广泛应用,开启生动数字世界的新篇章。
277 5
|
5月前
|
机器学习/深度学习 人工智能 自然语言处理
【数字人】AIGC技术引领数字人革命:从制作到应用到全景解析
【数字人】AIGC技术引领数字人革命:从制作到应用到全景解析
631 0
|
传感器 人工智能 达摩院
带你读《2022技术人的百宝黑皮书》——虚拟数字人行业现状和技术研究(1)
带你读《2022技术人的百宝黑皮书》——虚拟数字人行业现状和技术研究
188 0
带你读《2022技术人的百宝黑皮书》——虚拟数字人行业现状和技术研究(1)
|
编解码 自然语言处理 算法
虚拟数字人之《手语翻译官》的技术实践
虚拟数字人之《手语翻译官》的技术实践
20282 0
虚拟数字人之《手语翻译官》的技术实践
|
对象存储 流计算 CDN
带你读《2022技术人的百宝黑皮书》——虚拟数字人行业现状和技术研究(2)
带你读《2022技术人的百宝黑皮书》——虚拟数字人行业现状和技术研究
185 0

热门文章

最新文章