你的 AI 应用,该有一个流量入口了:AI 网关 Serverless 免费公测

简介: 阿里云 AI 网关 Serverless 新版免费公测:0 元起步,主模型故障自动兜底,一张拓扑图管好所有 Agent,智能路由即将上线,为 AI 应用提供统一流量入口。

作者:班壮(旭山),邵丹(营火)


阿里云 AI 网关 Serverless 新版正式开启免费公测。全新架构、0 元起步,Agent 管理升级为一张拓扑图,AI fallback 让主模型限流时业务不中断。公测期间网关自身费用全免。

AI 应用开发者的三个真实困境


如果你正在开发 AI 应用,大概率遇到过这些问题:


  • 模型账单越来越看不懂。 不管是简单的文本摘要还是复杂的代码生成,所有请求都发给同一个旗舰模型,账单月月上涨,却说不清钱花在了哪。
  • 主模型一限流,业务就宕。 模型服务限速、抖动是常态,没有自动切换能力,用户看到的就是报错。
  • Agent 越来越多,入口越来越乱。 百炼应用、AgentTeams 应用、Dify、Claude Code、自研 Agent……每个都有自己的接入方式、鉴权配置和日志,管理成本随数量线性上涨。


这些问题的本质是一样的:AI 应用缺一个统一的流量入口。


这正是 AI 网关要解决的事——统一接入 LLM API、Agent API、MCP Server,统一做路由、认证、限流、安全防护和用量观测。


在完整的 AI 应用链路里,AI 网关存在于两个位置:外部流量进入 Agent 时的入口,以及 Agent 访问模型时的出口。

AI 应用整体架构中 AI 网关的位置示意


全新 Serverless 架构:0 元起步,按实际用量付费

过去,使用 AI 网关需要先付一笔起步费用,这让很多刚起步、流量还不大的业务望而却步。


本次公测的 AI 网关 Serverless 新版完成了架构升级:基于全新架构重构,资源使用效率更高,开通更快,用多少付多少。新版提供两种实例形态:


Serverless 标准版 Serverless 企业版
定位 小规模生产、低流量业务 正式生产、规模化业务
起步成本 0 元起步,无实例费 实例费 + 按量
访问入口 平台分配入口 独立入口、支持自定义域名和证书
服务等级 99.9% 99.95%


标准版让你零成本把小规模业务跑起来,不为闲置资源付费;业务规模增长后,可以选择企业版获得独立入口、自定义域名、更高 QPS 和更高服务等级。后续还规划支持标准版一键升级为企业版,无需资源迁移。

相比原 Serverless 版本,新版升级了什么

  • 0 元起步: 标准版取消起步费用,纯按实际用量付费,小规模业务的成本更可控。
  • 版本分层: 新增标准版和企业版两种形态,分别面向小规模生产和规模化生产,可以按业务规模选择,不用为用不上的规格付费。
  • 插件体系: 新版支持平台提供的插件体系,可以扩展认证鉴权、安全防护、流量治理和观测分析能力。
  • 能力演进: LLM API、Agent 管理、MCP Server、观测分析等核心能力统一在新版承载,后续新增能力也优先在新版落地。


已有原 Serverless 实例可以继续使用,不强制迁移;新开通建议优先选择新版。

AI Fallback:主模型出问题,请求自动落到备用模型

回到开头的第二个困境。模型服务限速、抖动是常态,这件事在网关侧可以直接消掉——对应的能力叫 AI Fallback。


它做的事情也很简单:当主模型服务因异常、故障或高负载无法正常响应时,网关自动切换到你预先配置的备用模型,调用成功就立即返回。应用侧感知不到这次抖动,用户也看不到那个报错。


一个 Model API 可以配置一到多个 Fallback 模型,网关按顺序依次调用。所以你能搭出「主模型 → 同能力备用模型 → 轻量兜底模型」这样的多级链路,逐级降级,而不是一次失败就把错误抛给用户。同一个服务也可以复用在多条策略里,不用为每个 API 重复建一遍。


什么情况下会切走,覆盖三类:


  • 后端返回错误: 调用模型服务返回任意 4xx、5xx 状态码时触发,限流、鉴权失败、服务端错误都在里面。
  • 首包响应过慢: 流式场景下,首个响应包超过设定时间还没来就直接换一家,单位毫秒,设为 0 表示不启用。用户等的是第一个字什么时候出现,主模型排队排太久时,网关不会陪着一起等。
  • 网关侧限流或拦截: 默认同样触发;如果你只想在后端真的出错时才兜底,开启「仅 Fallback 后端服务错误」就能把这类情况排除在外。


配置同样不需要改应用——在 Model API 上打开 Fallback 开关,从服务列表里选一个备用服务即可。模型名称默认透传,主备模型名不一致时也可以指定具体模型。


稳定性策略和业务代码从此解耦。 备用模型换了、顺序调了、超时阈值改了,都是控制台上的一次配置变更,不用每个应用各写一套重试逻辑,也不用为了改一个兜底策略发一次版。

Agent 管理升级:一张拓扑图管好所有 Agent

Agent 时代的流量有两个方向:外部业务如何访问你的 Agent,以及 Agent 自己如何访问模型。过去这两侧配置分散在不同入口,这次新版把它们收敛成了一个资源:Agent


在控制台的「Agent管理」中,创建 Agent 只需要两步:起个名字,选择类型——支持百炼、AgentTeams、Dify、Claude Code 和自定义等多种 Agent 类型。

创建后进入 Agent 拓扑页,以你的 Agent 为中心:


  • 左侧是 Agent 访问: 配置外部业务访问 Agent 的域名、路由和消费者认证,让百炼应用、Dify 应用以标准 API 的形式对外服务。
  • 右侧是模型访问: 配置 Agent 通过网关调用模型的链路,Claude Code 用户按接入指引几分钟即可把模型调用切换到网关上。

Agent 资源将 Agent 访问与模型访问收敛到同一个资源下管理


调用量、错误、Token 消耗和请求日志都按 Agent 维度聚合展示。你的每一个 Agent,流量从哪来、到哪去,一张拓扑图看得清清楚楚。

公测权益与开放范围

公测时间: 7 月 31 日至 8 月 31 日。

公测地域: 北京、上海、杭州、深圳、香港。

公测优惠: 公测期间,AI 网关 Serverless 新版的网关自身费用不收费,仅公网流量按照 CDT(云数据传输)计费。模型服务、日志服务等其他云产品费用按对应产品规则收取。

重磅新能力预告:智能路由

上线节奏说明:智能路由功能将先在实例型独享版(专享实例)上线,Serverless 版本随后推出,敬请期待。


智能路由做的事情很简单:在能力足够的前提下,自动为每个任务选择更省、更快或更强的模型。简单任务走轻量模型,复杂任务才用旗舰模型,模型成本随任务结构自然下降。

智能路由根据任务在候选模型中自动选择


使用方式也足够简单——无需额外 SDK,无需改造应用,把模型名换成 auto/<模式> 即可。提供四种开箱即用的路由模式:


  • 综合均衡: 在成本、速度、质量之间自动权衡,适合大多数场景。
  • 成本优先: 任务能力充分的前提下选择最省的模型。
  • 速度优先: 优先响应更快的模型,适合交互式场景。
  • 质量优先: 关键任务始终使用能力最强的候选。


新版智能路由还解决了两个真实场景中的难题:


多轮对话和 Agent 工具链不“中途换脑”。 继续同一个任务时保持模型稳定,Agent 的工具调用链路全程绑定同一个执行模型;只有确认切换到新任务时才重新选择。从独立请求、多轮聊天到 Agent 工具链,一次接入全覆盖。


平台模型与自有模型统一决策。 候选池既可以一键开启平台内置的不同档位模型,也可以纳入你自己已配置的模型服务。自有模型继续走你自己的服务和凭据,账单归属不变——路由更聪明,但边界不含糊。

结语

从 0 元起步的标准版开始,不需要重写你的应用,也不需要迁移已有的模型服务。


你的 AI 应用,是时候有一个真正的流量入口了。


立即体验: 阿里云控制台搜索「AI 网关」,或访问产品官网了解详情。


注:本文所述功能可用范围、地域、价格、服务等级、Agent 类型、模型档位和实例规格,均以产品控制台、官网价格页和相关公告展示为准。公测期间部分能力可能陆续开放。

相关文章
|
7天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1774 117
|
8天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1306 11
|
14天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1960 9
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
8天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
544 112
缓存 安全 IDE
1174 2
|
20天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
3043 4
|
8天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
6天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
13天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
755 111

热门文章

最新文章