AI回答采集系统上云:ECS部署FastAPI+Celery的验证步骤与成本控制

简介: 本文详解AI回答采集系统从本地到阿里云的迁移实践,基于Python+FastAPI,集成ECS、RDS、OSS与日志服务,实现高并发、可追溯、低成本的云上部署。含环境配置、异步任务、性能优化与避坑指南,适合有Python基础的云上开发者。

本文解决AI回答采集系统从本地原型迁移到云上生产环境时遇到的部署、配置、性能和成本问题。系统基于Python和FastAPI构建,使用阿里云ECS、RDS MySQL、OSS和日志服务。最终实现一个可稳定运行、支持并发采集、数据可追溯、成本可控的云上服务。适合有Python开发经验、需要将AI应用部署到云上的开发者。前提是已开通阿里云账号并完成实名认证,了解ECS、RDS、OSS的基本概念。本文不涉及模型训练和调优。
整体方案

系统架构如下:

flowchart LR
A[采集任务调度] --> B[FastAPI应用]
B --> C[阿里云百炼模型服务]
C --> D[结果解析与清洗]
D --> E[(RDS MySQL)]
D --> F[(OSS存储)]
B --> G[日志服务]

采集任务由Celery调度,FastAPI提供API接口,调用阿里云百炼模型服务获取AI回答,解析后存入RDS,原始数据存OSS,日志采集到日志服务。
环境与资源准备

操作系统:Ubuntu 22.04 LTS
Python 3.10+
FastAPI、Celery、Redis、SQLAlchemy
阿里云ECS(2核4GB)、RDS MySQL(1核1GB)、OSS、日志服务
地域:华东1(杭州)

在ECS上安装Python依赖:

pip install fastapi uvicorn celery redis sqlalchemy pymysql oss2

账号与权限配置

创建RAM用户,授予以下权限:

ECS相关:无特殊权限,使用AccessKey调用API
RDS:连接数据库
OSS:读写Bucket
日志服务:写入日志

将AccessKey配置为环境变量:

export ALIBABA_CLOUD_ACCESS_KEY_ID=""
export ALIBABA_CLOUD_ACCESS_KEY_SECRET=""

不要将密钥写入代码仓库。
核心实现
模型调用

使用阿里云百炼的DashScope SDK调用通义千问模型:

import dashscope
from dashscope import Generation

dashscope.api_key = os.getenv("DASHSCOPE_API_KEY")

def get_ai_answer(question):
response = Generation.call(
model="qwen-turbo",
prompt=question,
max_tokens=500
)
if response.status_code == 200:
return response.output.text
else:
raise Exception(f"API error: {response.code}")

数据存储

使用SQLAlchemy定义模型,将采集结果存入RDS:

class AnswerRecord(Base):
tablename = "answers"
id = Column(Integer, primary_key=True)
question = Column(String(500))
answer = Column(Text)
created_at = Column(DateTime, default=datetime.utcnow)

原始回答JSON存入OSS:

import oss2

auth = oss2.Auth(os.getenv("ALIBABA_CLOUD_ACCESS_KEY_ID"), os.getenv("ALIBABA_CLOUD_ACCESS_KEY_SECRET"))
bucket = oss2.Bucket(auth, "oss-cn-hangzhou.aliyuncs.com", "my-answer-bucket")

def save_raw(question, response):
key = f"raw/{datetime.now():%Y%m%d}/{uuid4().hex}.json"
bucket.put_object(key, json.dumps(response))

异步任务

使用Celery处理采集任务,避免阻塞API:

from celery import Celery

app = Celery("tasks", broker="redis://localhost:6379/0")

@app.task
def collect_answer(question):
try:
answer = get_ai_answer(question)
save_raw(question, answer)

    # 解析并存入数据库
except Exception as e:
    log_error(e)

部署到ECS

使用systemd管理FastAPI服务:

[Unit]
Description=FastAPI App
After=network.target

[Service]
User=ubuntu
WorkingDirectory=/home/ubuntu/ai-collector
ExecStart=/usr/bin/uvicorn main:app --host 0.0.0.0 --port 8000
Restart=always

[Install]
WantedBy=multi-user.target

启动服务:

sudo systemctl start fastapi
sudo systemctl enable fastapi

验证服务启动

检查服务状态:

sudo systemctl status fastapi

正常情况下应显示 active (running)。

查看应用日志:

sudo journalctl -u fastapi -f

应看到类似 Uvicorn running on http://0.0.0.0:8000 的日志。

调用健康检查接口(如果实现了):

curl http://localhost:8000/health

应返回 {"status":"ok"}。
验证采集任务

手动触发一个测试任务:

from tasks import collect_answer
result = collect_answer.delay("什么是RAG?")
print(result.id)

查看任务状态:

celery -A tasks status

检查数据库和OSS:

在RDS中查询 answers 表,应出现对应记录。
在OSS Bucket中查看 raw/ 目录,应有对应JSON文件。

性能优化与监控
数据库连接池配置

使用SQLAlchemy连接池,调整 pool_size 和 max_overflow 参数:

from sqlalchemy import create_engine

engine = create_engine(
"mysql+pymysql://user:pass@host:3306/dbname",
pool_size=10,
max_overflow=20,
pool_pre_ping=True
)

pool_size 设置连接池大小,max_overflow 设置最大溢出连接数,pool_pre_ping 在每次连接前检查连接是否有效。
模型调用超时与重试

为模型调用设置超时和重试,避免因限流导致任务失败:

import time
from tenacity import retry, stop_after_attempt, wait_exponential

@retry(stop=stop_after_attempt(3), wait=wait_exponential(multiplier=1, min=2, max=10))
def get_ai_answer_with_retry(question):
return get_ai_answer(question)

日志与监控告警

使用阿里云日志服务收集应用日志,并设置告警:

在日志服务中创建Project和Logstore。
在ECS上安装Logtail并配置采集。
设置告警规则,例如当错误日志出现时触发告警。

成本控制

ECS按量付费,测试完成后释放。
RDS选择最小规格,使用按量付费。
OSS存储费用根据实际存储量计费,具体费用请参考官方定价。
模型调用按Token计费,控制请求频率和Token数量。

常见问题与避坑
API Key未生效

现象:调用模型时返回401或InvalidApiKey。
排查:检查环境变量是否设置正确:

echo $DASHSCOPE_API_KEY

解决:重新设置环境变量,并重启服务。

数据库连接失败

现象:应用启动时报数据库连接错误。
排查:检查RDS白名单是否包含ECS公网IP。
解决:在RDS控制台添加ECS公网IP到白名单。

任务重复执行

现象:同一任务被多次执行。
解决:在Celery任务中设置幂等性,使用唯一ID去重。

日志丢失

现象:日志服务中看不到日志。
排查:检查Logtail配置和网络连通性。
解决:确认日志服务Project和Logstore配置正确。

总结

本文介绍了AI回答采集系统上云的完整流程,从环境准备、代码实现到部署监控。通过合理规划资源和成本控制,可以实现稳定、可维护的云上系统。关键点包括:使用RAM最小权限、配置环境变量、使用异步任务、设置监控告警。希望本文能帮助开发者顺利完成上云迁移。

相关文章
|
存储 缓存 文件存储
如何保证分布式文件系统的数据一致性
分布式文件系统需要向上层应用提供透明的客户端缓存,从而缓解网络延时现象,更好地支持客户端性能水平扩展,同时也降低对文件服务器的访问压力。当考虑客户端缓存的时候,由于在客户端上引入了多个本地数据副本(Replica),就相应地需要提供客户端对数据访问的全局数据一致性。
33079 82
如何保证分布式文件系统的数据一致性
|
前端开发 容器
HTML5+CSS3前端入门教程---从0开始通过一个商城实例手把手教你学习PC端和移动端页面开发第8章FlexBox布局(上)
HTML5+CSS3前端入门教程---从0开始通过一个商城实例手把手教你学习PC端和移动端页面开发第8章FlexBox布局
17819 24
|
设计模式 存储 监控
设计模式(C++版)
看懂UML类图和时序图30分钟学会UML类图设计原则单一职责原则定义:单一职责原则,所谓职责是指类变化的原因。如果一个类有多于一个的动机被改变,那么这个类就具有多于一个的职责。而单一职责原则就是指一个类或者模块应该有且只有一个改变的原因。bad case:IPhone类承担了协议管理(Dial、HangUp)、数据传送(Chat)。good case:里式替换原则定义:里氏代换原则(Liskov 
36801 22
设计模式(C++版)
|
存储 编译器 C语言
抽丝剥茧C语言(初阶 下)(下)
抽丝剥茧C语言(初阶 下)
|
机器学习/深度学习 人工智能 自然语言处理
带你简单了解Chatgpt背后的秘密:大语言模型所需要条件(数据算法算力)以及其当前阶段的缺点局限性
带你简单了解Chatgpt背后的秘密:大语言模型所需要条件(数据算法算力)以及其当前阶段的缺点局限性
24874 15
|
机器学习/深度学习 弹性计算 监控
重生之---我测阿里云U1实例(通用算力型)
阿里云产品全线降价的一力作,2023年4月阿里云推出新款通用算力型ECS云服务器Universal实例,该款服务器的真实表现如何?让我先测为敬!
36787 15
重生之---我测阿里云U1实例(通用算力型)
|
SQL 存储 弹性计算
Redis性能高30%,阿里云倚天ECS性能摸底和迁移实践
Redis在倚天ECS环境下与同规格的基于 x86 的 ECS 实例相比,Redis 部署在基于 Yitian 710 的 ECS 上可获得高达 30% 的吞吐量优势。成本方面基于倚天710的G8y实例售价比G7实例低23%,总性价比提高50%;按照相同算法,相对G8a,性价比为1.4倍左右。
|
存储 算法 Java
【分布式技术专题】「分布式技术架构」手把手教你如何开发一个属于自己的限流器RateLimiter功能服务
随着互联网的快速发展,越来越多的应用程序需要处理大量的请求。如果没有限制,这些请求可能会导致应用程序崩溃或变得不可用。因此,限流器是一种非常重要的技术,可以帮助应用程序控制请求的数量和速率,以保持稳定和可靠的运行。
29926 52

热门文章

最新文章