阿里云智能语音交互完全对接指南:从开通服务到生产级集成

简介: 本文系统介绍阿里云智能语音交互(ISI)的完整对接流程。首先阐述产品核心能力与适用场景,明确语音识别(ASR)与语音合成(TTS)两大技术方向。然后详细讲解服务开通、项目创建、AccessToken获取等前置准备工作。接着深入剖析一句话识别、实时语音识别、录音文件识别、语音合成等核心API的调用方式,提供Java、Python、Curl等多语言代码示例。重点解析WebSocket协议的交互流程与VAD模式、Manual模式的区别。最后总结最佳实践,包括Token安全管理、音频格式规范、网络优化、成本控制等,并梳理常见错误码及排查方法。全文旨在帮助开发者快速、规范地将阿里云智能语音能力集成到各类

1. 产品概述:阿里云智能语音交互能做什么

阿里云智能语音交互(Intelligent Speech Interaction,简称ISI)是阿里巴巴集团基于多年技术积累推出的综合性语音AI服务平台。该平台整合了语音识别(ASR)、语音合成(TTS)、自然语言理解(NLU)等核心技术,为企业与开发者提供“能听、会说、懂你”的智能人机交互能力。其典型应用场景覆盖智能客服、语音导航、会议实时转写、庭审记录、访谈录音分析、有声读物制作、智能家居语音控制等多个领域。

从技术架构上看,智能语音交互系统通常由三个核心环节构成:首先通过语音识别技术将用户的语音输入转化为文本;其次借助自然语言处理技术理解文本意图并生成响应;最后通过语音合成技术将文本响应转化为语音输出。阿里云ISI产品将这三个环节封装为易用的API和SDK,开发者无需从头搭建复杂的语音处理流水线,即可快速为应用赋予语音交互能力。

阿里云智能语音交互提供了多种接入方式,包括RESTful API、服务端SDK(Java、Python、C++、Go、Node.js)、移动端SDK(iOS、Android、HarmonyOS Next)、微信小程序SDK以及WebSocket协议接入。开发者可以根据自身场景灵活选择——轻量级测试可从RESTful API入手,生产级应用建议使用SDK以获得更好的稳定性和开发效率。

需要先登录阿里云控制台,点击:阿里云控制台

2. 准备工作:开通服务与获取访问凭证

在使用阿里云智能语音交互服务之前,需要完成以下三个前置步骤:注册并实名认证阿里云账号、开通智能语音交互服务、创建项目并获取AppKey与AccessToken。

2.1 开通智能语音交互服务

登录阿里云官网后,在产品列表中找到“智能语音交互”产品,点击进入产品详情页并开通服务。首次使用的用户可享受一定的免费试用额度,具体额度以阿里云官网公布为准。需要注意的是,部分高级功能(如长文本语音合成、流式文本语音合成CosyVoice、录音文件识别极速版等)仅支持商用版,免费试用版调用这些接口会返回错误码40000010。

2.2 创建项目并获取AppKey

开通服务后,进入智能语音交互控制台,在“全部项目”页面点击“创建项目”。创建项目时需要选择项目类型,可选“语音识别+语音合成+语音分析”或“仅语音识别”等。项目创建成功后,系统会为每个项目分配一个唯一的AppKey,这个AppKey是调用API时必填的身份标识。

2.3 获取AccessToken

AccessToken是调用智能语音交互API的鉴权凭证。获取Token有两种方式:

方式一:控制台临时获取(仅限测试):登录智能语音交互控制台,在总览页点击“点击获取临时AccessToken”,该Token有效期为24小时。这种方式仅适合快速体验和功能验证,不建议在生产环境中使用。

方式二:通过SDK自动获取(推荐生产环境):通过nls-sdk-common(Java/C++)或阿里云公共SDK(Python/Go/Node.js等),配置AccessKey ID和AccessKey Secret后调用CreateToken接口自动获取并定期刷新Token。这种方式更为安全可靠,且能自动处理Token过期问题。

安全提醒:AccessKey ID和AccessKey Secret相当于账号密码,严禁将其硬编码在客户端代码中(如移动App、微信小程序等),建议仅在服务端使用或通过服务端下发给客户端。

3. 核心能力一:语音识别(ASR)对接

阿里云智能语音交互提供三种语音识别服务:一句话识别、实时语音识别和录音文件识别。开发者应根据实际场景选择合适的识别方式。

3.1 一句话识别

一句话识别适用于60秒以内的短语音识别场景,如语音搜索、语音指令、语音输入法等。其特点是调用简单、响应快速,支持RESTful API和SDK两种调用方式。

3.1.1 通过Curl命令快速体验

对于初次体验的开发者,阿里云官方推荐从Curl命令调用一句话识别RESTful接口开始。以下是一个完整的调用示例:

curl -X POST 'https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/asr' \
  -H 'Content-Type: audio/wav' \
  -H 'X-NLS-Token: YOUR_ACCESS_TOKEN' \
  --data-binary @/path/to/your/audio.wav

该请求将音频文件通过POST方式发送至服务端,服务端返回识别结果的JSON格式文本。需要注意的是,音频格式需为16kHz采样率、16bit位深的PCM或WAV格式,时长不超过60秒。

3.1.2 Java SDK调用示例

在正式项目中,推荐使用SDK进行集成。以下是Java SDK的Maven依赖配置和核心调用代码:

<dependency>
  <groupId>com.alibaba.nls</groupId>
  <artifactId>nls-sdk-recognizer</artifactId>
  <version>2.2.1</version>
</dependency>
import com.alibaba.nls.client.AccessToken;
import com.alibaba.nls.client.NlsClient;
import com.alibaba.nls.client.SpeechRecognizer;
import com.alibaba.nls.client.SpeechRecognizerListener;
public class SpeechRecognizerDemo {
    private static String appKey = "YOUR_APPKEY";
    private static String akId = "YOUR_ACCESS_KEY_ID";
    private static String akSecret = "YOUR_ACCESS_KEY_SECRET";
    
    public static void main(String[] args) throws Exception {
        // 获取Token
        AccessToken token = new AccessToken(akId, akSecret);
        token.apply();
        String accessToken = token.getToken();
        
        // 创建NlsClient,建议全局仅创建一个实例
        NlsClient client = new NlsClient(accessToken);
        
        // 创建识别监听器
        SpeechRecognizerListener listener = new SpeechRecognizerListener() {
            @Override
            public void onResult(String result) {
                System.out.println("识别结果: " + result);
            }
        };
        
        // 创建识别请求
        SpeechRecognizer recognizer = new SpeechRecognizer(client, appKey, listener);
        recognizer.setFormat("wav");
        recognizer.setSampleRate(16000);
        
        // 发送音频数据
        recognizer.start();
        recognizer.sendAudioFile("/path/to/audio.wav");
        recognizer.stop();
        
        client.shutdown();
    }
}

关键注意事项:NlsClient是线程安全的,建议在应用程序生命周期内仅创建一次;而SpeechRecognizer对象不可复用,每个识别任务对应一个实例;SpeechRecognizerListener与SpeechRecognizer是一一对应的关系。

3.2 实时语音识别(WebSocket)

实时语音识别适用于需要“边说边出文字”的流式场景,如实时会议转写、直播字幕、语音助手等。阿里云实时语音识别基于WebSocket协议,支持接收实时音频流并实时返回转写结果。

3.2.1 WebSocket协议概述

实时语音识别通过wss://协议建立长连接。客户端与服务端的交互遵循严格的协议规范:指令和事件通过WebSocket的Text类型DataFrame传输,音频流数据通过Binary Frame发送。鉴权在WebSocket握手阶段完成,在请求头中携带Authorization字段,格式为Bearer {API_Key}。

服务端点根据地域有所不同:

  • 华北2(北京):wss://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model={model_name}
  • 新加坡:wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/realtime?model={model_name}

阿里云百炼为上述地域推出了业务空间专属域名,能够提供更优的性能和更高的稳定性,建议优先使用。

3.2.2 两种交互模式

实时语音识别支持VAD模式和Manual模式两种交互流程:

VAD模式(默认):服务端通过语音活动检测(Voice Activity Detection)技术自动检测语音的起点和终点。开发者只需持续发送音频流,服务端在检测到一句话结束时自动返回最终识别结果。该模式适用于实时对话、会议记录等场景,开发工作量较小。

Manual模式:由客户端主动控制断句时机,适用于客户端能明确判断语句边界的场景,如聊天软件中的按住说话功能。

3.2.3 Java SDK实现实时语音识别

以下是基于DashScope Java SDK调用Qwen-ASR-Realtime模型的示例:

import com.alibaba.dashscope.audio.qwen_omni.OmniRealtimeConversation;
import com.alibaba.dashscope.audio.qwen_omni.OmniRealtimeParam;
import com.alibaba.dashscope.audio.qwen_omni.OmniRealtimeConfig;
import com.alibaba.dashscope.audio.qwen_omni.OmniRealtimeTranscriptionParam;
public class RealtimeASRDemo {
    public static void main(String[] args) {
        // 构建请求参数
        OmniRealtimeParam param = OmniRealtimeParam.builder()
            .model("qwen3-asr-flash-realtime")
            .url("wss://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime")
            .apikey(System.getenv("DASHSCOPE_API_KEY"))
            .build();
        
        // 配置识别参数
        OmniRealtimeTranscriptionParam transcriptionParam = 
            new OmniRealtimeTranscriptionParam();
        transcriptionParam.setLanguage("zh");
        transcriptionParam.setInputSampleRate(16000);
        transcriptionParam.setInputAudioFormat("pcm");
        
        // 配置VAD参数
        OmniRealtimeConfig config = OmniRealtimeConfig.builder()
            .modalities(Collections.singletonList(OmniRealtimeModality.TEXT))
            .enableTurnDetection(true)
            .turnDetectionType("server_vad")
            .turnDetectionThreshold(0.0f)
            .turnDetectionSilenceDurationMs(400)
            .transcriptionConfig(transcriptionParam)
            .build();
        
        // 创建会话并开始识别
        OmniRealtimeConversation conversation = 
            new OmniRealtimeConversation(param, config);
        conversation.start();
        
        // 持续发送音频流...
        // conversation.sendAudio(audioData);
        
        // 结束识别
        conversation.stop();
    }
}

上述代码中,enableTurnDetection设为true开启服务端VAD,turnDetectionSilenceDurationMs控制静默时长阈值(单位毫秒),当静默超过该值时服务端自动断句。

3.2.4 Python SDK实现实时语音识别

Python开发者可以使用DashScope Python SDK:

from dashscope.audio.qwen_omni import OmniRealtimeConversation, OmniRealtimeCallback
class MyCallback(OmniRealtimeCallback):
    def on_transcription_result(self, result):
        print(f"识别结果: {result}")
# 创建会话
conversation = OmniRealtimeConversation(
    model="qwen3-asr-flash-realtime",
    url="wss://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    callback=MyCallback()
)
# 配置识别参数
conversation.set_transcription_config(
    language="zh",
    input_sample_rate=16000,
    input_audio_format="pcm"
)
# 开启VAD
conversation.enable_turn_detection(True)
# 启动会话
conversation.start()
# 发送音频数据(例如从麦克风读取)
# conversation.send_audio(audio_chunk)
# 结束会话
conversation.stop()

Python SDK同样支持VAD模式和Manual模式,enable_turn_detection参数控制是否开启服务端VAD。

3.3 录音文件识别

录音文件识别适用于对已录制好的音频文件进行离线转写,支持较长的音频文件(最长可达数小时),适用于访谈录音分析、会议纪要生成、质检等场景。录音文件识别为异步任务模式:开发者提交音频文件后获得任务ID,然后轮询查询识别结果。

录音文件识别支持多种音频格式和采样率,单个文件大小一般不超过512MB。调用方式上,各语言SDK均提供了CommonRequest或专用接口来提交识别请求和查询结果。

4. 核心能力二:语音合成(TTS)对接

语音合成(Text-to-Speech,TTS)是将文本转换为自然流畅的语音输出。阿里云智能语音交互提供多种TTS服务,包括短文本语音合成、流式文本语音合成和长文本语音合成。

4.1 短文本语音合成(RESTful API)

短文本语音合成支持通过HTTPS GET或POST请求将不超过300字符的文本合成为语音。支持PCM、WAV、MP3等多种音频格式输出。以下是一个GET请求示例:

GET https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/tts?
  appkey=YOUR_APPKEY&
  text=你好世界&
  token=YOUR_ACCESS_TOKEN&
  format=wav&
  sample_rate=16000&
  voice=xiaoyun&
  volume=50&
  speech_rate=0&
  pitch_rate=0

请求参数说明:appkey为项目标识;text为待合成的UTF-8编码文本(GET请求需URL编码);token为访问令牌;format可选PCM/WAV/MP3,默认PCM;sample_rate可选8000/16000,默认16000;voice指定发音人,默认xiaoyun;volume音量范围0-100,默认50;speech_rate语速范围-500至500,默认0;pitch_rate语调范围-500至500,默认0。

服务端返回合成的音频二进制数据,开发者需要将响应体保存为音频文件或直接播放。

4.2 流式文本语音合成(CosyVoice)

流式文本语音合成可以将流式文本实时合成为语音二进制数据并流式返回。这一特性特别适用于大语言模型流式输出的场景——LLM返回的流式文本无需拼接整合,可直接送入TTS服务获得实时音频流。

流式文本语音合成仅提供商用版,不支持试用。在同一个会话中,单次合成不超过1万字符,总计不超过20万字符(1个汉字计为2个字符)。支持设置语速、语调、音量以及多种发音人。CosyVoice-V2系列提供了丰富的音色选择,如龙橙(阳光男声)、龙华(活泼女童)、龙书(新闻男声)、Bella2.0(新闻女声)、龙婉(普通话女声)等。

4.3 长文本语音合成

长文本语音合成适用于将超长文本(千字甚至万字)合成为语音,如有声书制作、在线教育配音等场景。该功能同样仅支持商用版。调用方式与短文本合成类似,但支持更大的文本输入,服务端会自动进行文本分段和拼接处理。

5. 最佳实践与性能优化

5.1 Token安全管理

AccessToken是API调用的关键凭证,其安全管理至关重要。推荐的做法是使用RAM子账号(RAM用户)来访问智能语音交互服务。RAM用户由主账号创建,并可在获得授权后登录控制台或使用API访问资源。通过RAM可以精细控制权限范围,即使密钥泄露也能将风险限制在可控范围内。

在生产环境中,Token的获取和刷新应由服务端完成。移动端或前端应用不应直接使用AccessKey ID和AccessKey Secret获取Token,而应由服务端生成Token后下发给客户端。服务端SDK内置了Token自动刷新机制,开发者只需配置好AccessKey即可。

5.2 音频格式规范

不同识别服务对音频格式有不同要求,遵循规范能显著提高识别准确率。一句话识别和实时语音识别通常要求音频为16kHz采样率、16bit位深的PCM或WAV格式。录音文件识别支持更多格式,但仍建议使用标准PCM格式以获得最佳效果。开发者在上传音频前应进行必要的格式转换和重采样处理。

5.3 网络与性能优化

对于实时语音识别等对延迟敏感的场景,网络优化尤为关键。建议采取以下措施:使用同地域的服务端点以减少网络延迟;复用WebSocket长连接避免频繁握手;合理设置VAD参数以平衡识别实时性和准确性。对于高并发场景,可考虑使用连接池和批处理传输来提升吞吐量。

5.4 成本控制

智能语音交互服务按量计费,主要费用来自API调用次数和音频处理时长。开发者应合理规划调用频率,避免不必要的重复调用。不同服务之间不共享并发额度,同一服务下的不同项目共享并发额度。建议根据业务需求选择合适的服务类型和并发数,避免资源浪费。对于非实时场景(如批量录音转写),可选择闲时版以降低成本。

6. 常见错误码与排查

智能语音交互API调用失败时,服务端会返回错误码和错误信息。以下是几个常见错误码及排查方法:

  • 40000010:免费试用已过期。调用了仅支持商用版的服务(如长文本合成、流式TTS等),需在控制台升级为商用版。
  • 403:AccessToken无效或已过期。检查Token是否在有效期内,或重新获取Token。
  • 40000004:空闲超时。长时间(如10秒)未向服务端发送数据,建议检查网络连接或调整发送频率。
  • 401/403(WebSocket握手):API Key无效或缺失。检查Authorization请求头格式是否正确。

遇到错误时,建议记录请求中的task_id(如有),便于提交工单时提供给技术支持团队快速定位问题。

7. 总结

阿里云智能语音交互为开发者提供了一套完整、易用、高性能的语音AI能力集。从短语音的快速识别到长音频的离线转写,从基础的文本合成到流式的实时语音输出,覆盖了绝大多数语音交互场景。通过本文的讲解,开发者应能掌握从服务开通、项目创建、Token获取到各类API调用的全流程。在实际集成中,建议遵循Token安全管理、音频格式规范、网络优化等最佳实践,以确保应用的稳定性、安全性和成本可控性。

常见问题问答

问1:一句话识别和实时语音识别有什么区别?

答:一句话识别针对60秒以内的短语音,采用HTTP请求-响应模式,调用简单。实时语音识别基于WebSocket长连接,支持持续发送音频流并实时返回识别结果,适用于会议转写、直播字幕等流式场景。

问2:AccessToken过期了怎么办?

答:生产环境中应使用SDK内置的Token自动获取和刷新机制。若使用控制台临时Token(有效期24小时),过期后需重新获取。建议在服务端实现Token的定期刷新逻辑,避免因Token过期导致调用失败。

问3:语音合成支持哪些发音人和语言?

答:阿里云TTS提供数十种发音人,涵盖男女声、童声、新闻播报、温柔姐姐等多种风格。支持中文、英文及中英文混合,部分音色还支持方言。具体音色列表可在语音合成产品详情页或接口文档中查询。

问4:实时语音识别的VAD模式是什么?

答:VAD(Voice Activity Detection)模式即服务端自动检测语音活动。开发者只需持续发送音频流,服务端自动判断一句话的起点和终点,在句末返回识别结果。该模式简化了客户端逻辑,适合大多数实时对话场景。

问5:免费试用版和商用版有什么区别?

答:免费试用版提供有限的服务调用额度,适合功能验证和开发测试。部分高级功能(长文本合成、流式TTS、录音文件识别极速版等)仅支持商用版。商用版需在控制台升级,按调用量或时长计费。

问6:如何在移动端集成智能语音交互?

答:阿里云提供了Android、iOS和HarmonyOS Next的移动端NUI SDK。开发者可在控制台获取对应平台的SDK和接入文档。需要注意的是,移动端不应直接使用AccessKey,而应通过服务端获取Token后下发给客户端使用。

相关实践学习
达摩院智能语音交互 - 声纹识别技术
声纹识别是基于每个发音人的发音器官构造不同,识别当前发音人的身份。按照任务具体分为两种: 声纹辨认:从说话人集合中判别出测试语音所属的说话人,为多选一的问题 声纹确认:判断测试语音是否由目标说话人所说,是二选一的问题(是或者不是) 按照应用具体分为两种: 文本相关:要求使用者重复指定的话语,通常包含与训练信息相同的文本(精度较高,适合当前应用模式) 文本无关:对使用者发音内容和语言没有要求,受信道环境影响比较大,精度不高 本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。 讲师介绍: 郑斯奇,达摩院算法专家,毕业于美国哈佛大学,研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。
相关文章
|
2月前
|
人工智能 Java API
阿里云文档智能(Document Mind)对接使用全攻略:从开通到API深度集成
本文系统性地介绍了阿里云文档智能(Document Mind)服务的完整对接与使用流程。首先阐述了文档智能的产品定位与核心能力,包括文档理解、文档格式转换和OCR文档自学习三大板块。随后详细说明了服务开通步骤、控制台五大模块的功能布局以及轻应用的可视化体验方式。在API集成层面,深入剖析了异步任务提交与结果轮询的标准调用模式,并分别提供了Java和Python两种主流语言的完整SDK代码示例。文章还重点介绍了信息抽取模板的两种类型(Prompt模板与Key-Value模板)及其配置方法,探讨了文档智能与RAG结合构建企业知识库的最佳实践路径。最后从权限管理、计费方式、常见错误排查等维度给出了实
|
文字识别 自然语言处理 达摩院
一文上手文档智能Document Mind
简要讲述文档智能Document Mind以及文档智能的功能测试
一文上手文档智能Document Mind
|
2月前
|
人工智能 运维 数据可视化
阿里云百炼全链路对接实操指南:账号、API、订阅、应用开发完整教程
阿里云百炼是面向个人开发者、中小企业、大型政企打造的一站式大模型MaaS服务底座,整合自研通义千问全系列模型,同时兼容DeepSeek、Kimi等多款第三方优质开源与商用大模型,统一提供模型推理、API调用、包月订阅、智能体开发、可视化工作流、私有知识库、MCP工具集成等全栈AI能力。整套平台打通从账号开通、密钥创建、算力付费、模型调用到应用上线完整链路,提供零代码、低代码、高代码三层开发模式,兼顾零基础业务人员与专业研发团队,2026年迭代后完善计费管控、权限隔离、数据合规体系,成为国内落地通用AI、编码智能、私有知识库应用的主流服务平台。下文按照前置账号准备、三类接入计费方案、代码调用实操
353 0
|
2月前
|
网络协议 应用服务中间件 网络安全
阿里云SSL证书自动续签与部署完全指南:从托管服务到开源工具全方案解析
本文系统性地剖析了阿里云SSL证书自动续签与部署的完整技术方案。随着SSL证书有效期普遍缩短至一年甚至三个月,手动管理证书已成为运维痛点。文章首先介绍阿里云数字证书管理服务V2.0的托管服务——通过购买证书时开启托管、配置域名免验证授权、创建云产品部署任务,即可实现证书全生命周期自动化。随后深入讲解acme.sh这一开源ACME客户端的安装、阿里云DNS API配置、证书签发与自动续期Cron任务设置,并提供Nginx配置示例。进一步探讨基于阿里云OpenAPI的自定义脚本方案,展示Python SDK调用示例。还介绍了函数计算、Certimate等高级自动化工具。最后详细讨论ECS可信实例一
|
28天前
|
弹性计算 运维 安全
一文看懂阿里云低价云服务器,38 元轻量与 99 元 ECS 选购与实操指南
对于个人开发者、学生站长、小微企业来说,云服务器采购最关心的永远是性价比,在满足业务基础运行需求的前提下,尽可能压低年度算力成本。阿里云当前正在进行的实时特惠活动,推出两款极具吸引力的入门算力产品:轻量应用服务器低至38元1年,标准ECS云服务器99元1年,覆盖个人博客、小程序后端、开发测试、静态站点等绝大多数轻负载场景。本文会完整梳理两款特价机型的硬件规格、购买资格、抢购规则、适用场景,同时附上远程连接、系统初始化、安全配置的实操命令,帮助大家快速上手,避开低价云服务器常见的规则陷阱,按需选择最合适的机型。
276 0
|
2月前
|
存储 分布式计算 Java
阿里云MaxCompute云原生大数据计算服务全方位对接使用指南
本文系统性地阐述了阿里云MaxCompute(云原生大数据计算服务)的多种对接与使用方式。从服务开通、项目创建等基础准备工作入手,详细讲解了命令行客户端odpscmd、DataWorks数据集成与开发平台、Java SDK、PyODPS Python SDK、JDBC驱动以及开放存储Storage API等六大核心对接路径。针对每种方式均提供了完整的配置步骤与代码示例,涵盖批量数据上传、流式数据写入、跨源数据同步、第三方BI工具集成等典型场景。文章还深入探讨了Endpoint选择策略、RAM权限管理体系、开放存储架构等关键技术要点,并结合生产环境给出了成本优化与性能调优建议,旨在帮助数据工程师
|
2月前
|
存储 API 数据处理
阿里云智能媒体管理(IMM)对接使用全攻略:从开通到生产级实践
本文全面解析阿里云智能媒体管理(IMM)的对接与使用。首先介绍IMM的产品定位与服务架构,阐明其与OSS的深度集成关系。然后详细说明开通服务、创建项目、绑定Bucket的全流程操作,并给出Java和Python两种主流语言的SDK初始化与API调用示例。接着深入讲解文档格式转换、文档预览、视频截帧、图片智能检测等核心功能的实现方法,涵盖同步与异步处理两种模式。同时针对权限配置、新旧版本差异、计费规则、性能优化等关键问题进行专项剖析,帮助读者构建生产级的媒体处理能力。全文基于新版IMM(API版本2020-09-30)撰写,适合开发者、架构师及技术决策者阅读。
|
2月前
|
机器学习/深度学习 弹性计算 人工智能
阿里云轻量应用服务器、ECS云服务器、GPU云服务器最新配置与价格说明
阿里云弹性计算产品体系持续优化迭代,形成轻量应用服务器、ECS云服务器、GPU云服务器三级标准化算力体系,覆盖个人轻量化应用、企业通用生产业务、AI高性能计算三大核心场景。全系产品完成硬件升级、网络优化与资费调整,定价梯度清晰、场景划分明确,同时配套常态化优惠与节点大促权益,兼顾普惠入门与高阶算力需求。本文结合2026年最新官方配置标准与定价规则,全面解析三类服务器的硬件参数、能力特性、计费模式与适用场景,为不同用户的云上算力选型提供完整参考。
228 0
|
2月前
|
缓存 人工智能 运维
GPT-5.6 Terra与GPT-5.5实测对比:定价、性能、迁移落地全解析
2026年7月OpenAI正式推出GPT-5.6全系列模型,分为Sol旗舰、Terra均衡、Luna轻量三个版本,其中Terra作为对标前代GPT-5.5的主力均衡模型,最受研发与AI智能体团队关注。Terra最核心的特征是全套计费标准恰好为GPT-5.5的一半,输入、输出、缓存读取全部实现五折优惠,在统一上下文窗口与输出上限的前提下,大幅降低编码、长文档、智能体业务的月度算力支出。但官方并未单独披露Terra编码类基准分数,仅公布旗舰Sol的评测数据,企业无法仅凭宣传直接切换生产流量,必须通过自建A/B测试完成效果验证。本文从定价体系、算力成本测算、公开基准数据对比、不同业务场景适配逻辑、可
712 0
|
2月前
|
弹性计算 人工智能 运维
阿里云云监控对接使用完全指南:从入门到智能化运维
本文提供了一份完整的阿里云云监控(CloudMonitor 2.0)对接使用指南。作为融合了日志服务SLS、云监控CMS和应用实时监控服务ARMS的一站式可观测平台,云监控2.0提供了从基础设施到业务层的全栈监控能力。文章详细介绍了工作空间的创建与管理、接入中心的多源数据接入流程、告警规则与通知策略的配置方法、OpenAPI与SDK的调用示例、自定义监控数据上报方案,以及基于CLI和AI Agent Skill的智能化运维实践。同时涵盖了Prometheus集成、日志探索、仪表盘可视化等高级功能。通过本文,读者可以系统掌握云监控的对接使用技巧,构建高效、智能的可观测运维体系。