阿里云国际ECS如何部署 Qwen3 大模型?
版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。
本文由阿里云国际云服务器代理商:云枢国际yunshuguoji撰写。
前期做好准备后就创建并登录 ECS:
阿里云国际控制台→ECS→Create Instance,选对应 GPU 规格、Ubuntu22.04 GPU 镜像,设置登录密码。
SSH 远程连接 ECS 公网 IP(端口 22)。
一键安装依赖(复制整条运行)
apt update && apt install git python3-pip -y
pip3 install torch transformers accelerate vllm streamlit modelscope
高速下载 Qwen3(阿里 ModelScope 国际镜像,无需 HF 翻墙)
以 Qwen3-8B-Instruct 举例:
from modelscope import snapshot_download
下载模型到本地
model_dir = snapshot_download('Qwen/Qwen3-8B-Instruct')
执行方式:输入python3进入交互窗口,粘贴上面代码,等待下载完成。
方式 1:可视化 Web 对话(本地调试)
新建chat.py
from transformers import AutoTokenizer, AutoModelForCausalLM
model_dir = "./Qwen3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_dir)
model = AutoModelForCausalLM.from_pretrained(model_dir, device_map="auto")
import streamlit as st
st.title("Qwen3 对话")
prompt = st.text_input("输入提问")
if prompt:
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=512)
st.write(tokenizer.decode(outputs[0], skip_special_tokens=True))
启动 Web 服务:
streamlit run chat.py --server.address=0.0.0.0 --server.port=8501
浏览器访问 ECS公网IP:8501 即可对话。
方式 2:OpenAI 标准 API(业务程序调用,推荐生产)
vLLM 高性能启动接口:
python -m vllm.entrypoints.openai.api_server \
--model ./Qwen3-8B-Instruct \
--port 8000 \
--host 0.0.0.0