阿里云国际如何在无公网环境下完成多模态 AI 模型私有化部署?
版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。
本文由阿里云国际云服务器代理商:翼龙云yilongcloud撰写。
前置准备
同地域准备:GPU 实例(EGS/ECS‑GPU)、OSS Bucket、独立隔离 VPC;
外部有网环境:提前下载好多模态模型权重文件、离线 docker 推理镜像(vLLM/SGLang);
隔离 VPC不分配 EIP,不创建 NAT 网关,彻底关闭外网出口。
实操简单步骤
步骤 1:配置隔离网络,开通 OSS VPC Endpoint
阿里云国际控制台创建独立 VPC 与交换机,不配置 NAT 网关,GPU 实例部署在此 VPC 内,不绑定公网 EIP。
VPC 控制台创建 OSS 接口端点,绑定当前隔离 VPC,开启内网访问 OSS 权限,配置 RAM 策略仅允许内网 Bucket 读写。
步骤 2:离线模型与镜像上传 OSS(有网络的环境操作)
在本地或者另一个有公网的阿里云国际实例,下载完整多模态模型文件、离线推理 docker 镜像。
使用 ossbrowser 工具,把模型权重、离线镜像上传至同一地域的私有 OSS Bucket,Bucket 设置私有读写,不开放外网访问。
步骤 3:无公网 GPU 实例内网获取模型与镜像
通过网页 Workbench 跳板登录无公网 GPU 实例(不使用公网 SSH)。
通过 OSS 内网域名,把模型文件下载到实例本地数据盘;从内网镜像仓库导入离线 docker 推理镜像。
注意:大模型建议挂载高性能数据盘,存储空间大于模型 1.5 倍以上。
步骤 4:内网启动多模态推理服务
加载离线 docker 镜像,读取本地已经导入的多模态模型文件,启动 vLLM/SGLang 推理服务。
服务仅监听内网地址,不监听 0.0.0.0 对外暴露端口。
仅 VPC 内部业务系统,使用实例内网 IP 调用多模态推理 API。
步骤 5:业务访问与运维
外部人员调试:依靠 Workbench 网页终端登录实例,禁止开放公网端口。
后续模型更新:依旧在外部有网环境上传 OSS,再由内网实例拉取,隔离环境本身不能联网下载任何资源。