企业落地 AI,真正的分水岭,早已不是“有没有模型”,而是能否把模型变成一条接得快、跑得稳、成本可控、风险可防的业务生产链路。
过去,每新增一种 AI 能力,往往都要重新对接模型平台、拼装数据处理流程,再补齐鉴权、路由、监控、审计和安全治理;模型越多、场景越复杂,链路就越长,规模化落地也越难。
现在,作为 AI Native 的 Milvus 云服务,阿里云 Milvus 用一套原生架构把数据、向量检索与模型能力真正串在了一起:Embedding、Rerank、Generate 和多模态处理原生进入数据链路,AI-Gateway 提供统一模型出口,并与 Milvus Auth、配额、审计、观测和模型切换无缝协同。
本次升级一次带来 15 项 AI 能力和 24 款新增模型;Batch 调用成本低至 50%,重复 Embedding 内容可节省 100% Token 并获得 4~6 倍加速;同时补齐内网调用、多账号负载均衡、异常 Key 故障切换以及输入输出安全护栏。
从能力集成到产品化落地,企业不必再为每一种 AI 能力重复建设一套复杂链路。从数据进入 Milvus 的那一刻起,理解、加工、检索、生成与治理,就可以在一条原生链路中完成。
AI Native:让 AI 能力原生进入数据链路
传统方案通常需要应用、ETL、模型服务、向量数据库和业务数据库共同完成一条 AI 数据链路。数据要在多个系统之间流转,Embedding 需要额外调用,检索结果还要回到应用层拼装;组件越多,数据同步、链路维护和一致性保障就越复杂。
AI Native 的目标,是让 AI 能力进入数据处理主链路,让应用少对接系统、数据少跨平台搬运。
阿里云Milvus AI Function 将 Embedding、Rerank 和 Generate 等能力统一为原生 AI Function,并通过 AI 中心连接模型调度、用量统计、集群绑定、监控与告警。应用只需通过统一 REST 网关,即可调用不同模型与能力。
Milvus AI Function 原生能力架构
从业务架构看,传统方案需要多个组件串联;Milvus AI Function 则把 AI 能力放回统一数据链路,通过原生调用减少数据搬运和应用适配。
传统方案与 Milvus AI Function 对比
原生 AI Function 覆盖 AI 应用最核心的三条处理链路:
- Embedding:将文本或多模态内容转换为向量,为语义检索和 RAG 提供基础。
- Rerank:对召回结果进行二次排序,让更相关的内容优先进入后续链路。
- Generate:在同一能力体系内完成文本生成、翻译、纠错、摘要以及图像和视频编辑等任务。
与 AI 中心的统一治理能力结合后,模型接入、能力调用、运行监控和成本统计不再分散在多套系统中。Milvus 的 AI Native,不是继续给架构增加组件,而是通过原生函数与统一治理,让 AI 应用的落地链路更短、更简单。
产品化:让 AI 能力看得见、管得住
新版 AI 中心界面及监控大盘正式上线。
从创建 AI Function 到查看模型运行状态,关键操作都可以在统一界面中完成。AI 能力不再隐藏在接口背后,而是成为可配置、可观测、可持续运营的产品化服务。
监控更完备:从整体用量到单模型表现,一屏掌握
AI 中心提供按 Milvus 集群、按模型两种监控视角,并支持选择采样间隔、快捷时间范围及自定义时间窗口。从总览到下钻,从用量到趋势,AI 服务运行得怎么样、资源消耗在哪里,都能直观看见。
- 用量可统计:集中查看 Token 总量、文本输入 Token、平均 Token 及调用次数。
- 趋势可追踪:通过时间趋势快速识别调用高峰和用量变化。
- 维度可切换:既能掌握集群整体消耗,也能下钻到具体模型,定位用量和调用表现。
按 Milvus 集群查看 Token 用量与调用趋势
按模型查看用量、调用次数与平均 Token
创建更直观:AI Function 直接可视化选择
为了从“编写配置”变成“界面选择”,让 AI Function 的创建过程更直观,上手路径更短。我们扩展了阿里云Milvus Manager的功能。
阿里云Milvus Manager:https://help.aliyun.com/zh/milvus/user-guide/what-is-milvus-manager
创建 Collection 时,可以直接可视化配置 AI Function:选择函数类型、子任务和模型,填写 Prompt,并指定输入、输出字段;相应参数同步呈现在配置区域中。
多模态生成、音频转写、图像编辑等能力均可按需选择,无需先记住复杂的模型参数和调用方式。
创建 Collection 时可视化配置 AI Function
AI 能力:15 项功能,一站覆盖文本与多模态场景
阿里云Milvus AI Function 已形成覆盖内容生产、信息处理、智能分析和多模态创作的完整能力组合:
- 文本生产与治理:文本生成、文本翻译、文本纠错、PII 敏感信息脱敏、文本摘要。
- 信息提取与分析:标签提取、命名实体提取、关键词提取、文本分类、情感分析。
- 多模态与检索:多模态生成、音频转写、图像编辑、视频编辑、重排序。
无论是内容生产、知识加工、智能客服,还是 RAG 检索与多媒体创作,都可以在同一套能力体系中完成。
AI 中心中不仅展示能力清单,还把每项功能支持哪些模型、如何调用,一并清晰呈现:
- 模型支持列表:每个功能均提供详细的可用模型列表,并标明输入、输出模态,选型更直接。
- AI-Gateway REST 模式:通过 cURL 选项卡即可查看 REST 调用示例,应用通过统一 HTTP 入口接入,无需为不同模型重复维护调用方式。
- Python SDK 代码:通过 Python 选项卡可以查看完整 SDK 示例,涵盖 AI Function、输入输出字段、参数及索引配置,便于开发者直接参考和集成。
每项 AI 能力均提供模型清单、REST 与 Python SDK 示例
详细的AI Function使用,请参考官网地址。
官网地址:https://help.aliyun.com/zh/milvus/user-guide/ai-function
AI-Gateway 模式:从“数据服务”到“AI 原生 BaaS”的关键拼图
阿里云Milvus 正式上线 AI-Gateway(大模型访问)能力,其他产品只需对接阿里云 Milvus,无需直接调用百炼。 AI 请求先进入阿里云Milvus AI-Gateway,再由网关调用百炼及其模型服务,并通过统一 REST 接口返回结果。与阿里云 Milvus Auth 无缝粘合,复用阿里云 Milvus 的登录态,在前端无需暴露模型 Key 的情况下调用大模型;而配额、审计、观测、模型切换等操作都放到控制台里处理。这样就省去了很多原先需要自己补的工作。这条调用链可以概括为:
其他产品 / 应用 → 阿里云 Milvus AI-Gateway → 百炼及上游模型
其他产品通过 Milvus AI-Gateway 统一调用百炼模型
这样,其他产品可以继续只依赖阿里云Milvus 这一项基础服务:数据写入、向量检索与 AI 调用使用同一个产品出口。阿里云Milvus 向下为应用提供统一的 Data + AI 服务,向上集中完成百炼调用、凭证托管和模型路由,从“数据库”进一步演进为 AI 原生 BaaS(Backend-as-a-Service)。
前文已经介绍的 Embedding、Rerank、Generate、多模态能力以及用量统计、监控和安全治理,都可以沿用这一出口,产品侧无需重复建设。
成本与性价比:让规模化调用更有底气
阿里云Milvus支持以下功能,当任务越多、重复内容越多,成本优化带来的价值就越明显。
- Batch 模型:成本低至 50%。在不追求实时性能的离线场景中,可用常规模型服务 50% 的成本完成历史数据加工、批量内容处理等任务。
- Embedding Cache:重复内容节省 100% Token。命中缓存后无需再次消耗 Token,同时获得 4~6 倍执行加速。
性能和稳定性:为持续运行筑牢底座
阿里云Milvus在AI的调用性能和稳定性上也做了强化,主要包含以下两项。
- AI Function服务与百炼实现内网打通,进一步缩短调用链路,减少了公网调用下的性能损失以及不稳定。
- 支持多账号负载均衡和异常Key故障切换,以降低单账号限流对业务连续性的影响。
其他:更全面的模型矩阵,更安心的生产环境
阿里云Milvus AI Function 已集成AI 数据安全防护护栏,在模型输入和输出环节提供精准的风险检测与主动防御,让企业在释放 AI 生产力的同时,更从容地应对内容与数据安全风险。
AI 数据安全防护护栏:https://help.aliyun.com/zh/document_detail/2873209.html
本次还新增 24 款模型,覆盖图像生成、文本生成、Embedding、Rerank、语音识别及视频生成与编辑:
- 图像生成:wan2.7-image-pro、wan2.7-image。
- Embedding:tongyi-embedding-vision-plus、qwen3.7-text-embedding、text-embedding-v4、text-embedding-v3、text-embedding-v2、qwen3-vl-embedding。
- Rerank:qwen3-vl-rerank、qwen3-rerank。
- 语音识别:qwen3-asr-flash。
- 文本生成:qwen3.7-plus、qwen3.7-max、qwen3.6-plus、qwen3.6-flash、qwen3.5-flash、kimi-k2.6、glm-5.2、deepseek-v4-pro、deepseek-v4-flash。
- 视频生成与编辑:happyhorse-1.1-t2v、happyhorse-1.1-i2v、happyhorse-1.1-r2v、happyhorse-1.0-video-edit。
典型场景:让 AI 能力真正进入业务
AI 能力的价值,最终要在真实业务中体现。围绕多模态数据处理、内容理解和智能检索,阿里云Milvus AI Function 可以灵活组合不同能力,服务以下典型场景。
智能驾驶:从海量路采数据中快速发现关键样本
把车型、天气、时段等业务字段与图片、视频、音频一起交给阿里云Milvus AI Function,自动完成场景理解、分类、标签提取和向量化;再结合 Embedding 与 Rerank,快速定位长尾场景与关键训练样本。
具身智能:让机器人轨迹更容易理解和复用
将任务指令、环境视觉、动作序列和运行日志通过阿里云Milvus AI Function加工成可检索的轨迹摘要与标签,并通过相似度检索发现相似任务和失败轨迹,服务训练集构建、复盘与复用。
内容、电商与广告:加速多模态素材生产与理解
通过阿里云Milvus AI Function对商品标题、详情、图片和视频统一完成生成、翻译、摘要、标签与素材编辑,并利用多模态检索和重排序快速找到更匹配的商品与营销素材。
企业知识库与 RAG:把分散内容变成可用知识
把分散在文档、图片、录音和视频中的内容通过阿里云Milvus AI Function自动转写、摘要、抽取并向量化,再结合 Rerank 提升召回排序,为 RAG 与 Agent 提供更完整、更相关的上下文。
个人开发者做 AI 应用:不再担心 API Key 暴露在前端
前端应用直接复用阿里云 Milvus Auth 登录态,通过 Milvus AI-Gateway 调用大模型,无需暴露模型 Key;配额、审计、观测和模型切换统一在控制台处理,不必自建 AI 转发后端。
让 AI 落地,不必再从复杂链路开始
阿里云 Milvus 是目前唯一支持 AI Native 的 Milvus 云服务。它不仅提供高性能、全托管的向量检索能力,更将 AI Function 与 AI-Gateway 原生嵌入数据链路,让模型能力真正成为数据库的一部分。
从数据进入阿里云 Milvus 的那一刻起,理解、加工、检索和生成便可以在一条原生链路中完成。阿里云 Milvus 正在把“接入 AI”变成“原生拥有 AI”——AI Native, Now。