AI回答采集系统上云:ECS部署FastAPI+Celery的验证步骤与成本控制

简介: 本文详解AI回答采集系统从本地到阿里云的迁移实践,基于Python+FastAPI,集成ECS、RDS、OSS与日志服务,实现高并发、可追溯、低成本的云上部署。含环境配置、异步任务、性能优化与避坑指南,适合有Python基础的云上开发者。

本文解决AI回答采集系统从本地原型迁移到云上生产环境时遇到的部署、配置、性能和成本问题。系统基于Python和FastAPI构建,使用阿里云ECS、RDS MySQL、OSS和日志服务。最终实现一个可稳定运行、支持并发采集、数据可追溯、成本可控的云上服务。适合有Python开发经验、需要将AI应用部署到云上的开发者。前提是已开通阿里云账号并完成实名认证,了解ECS、RDS、OSS的基本概念。本文不涉及模型训练和调优。
整体方案

系统架构如下:

flowchart LR
A[采集任务调度] --> B[FastAPI应用]
B --> C[阿里云百炼模型服务]
C --> D[结果解析与清洗]
D --> E[(RDS MySQL)]
D --> F[(OSS存储)]
B --> G[日志服务]

采集任务由Celery调度,FastAPI提供API接口,调用阿里云百炼模型服务获取AI回答,解析后存入RDS,原始数据存OSS,日志采集到日志服务。
环境与资源准备

操作系统:Ubuntu 22.04 LTS
Python 3.10+
FastAPI、Celery、Redis、SQLAlchemy
阿里云ECS(2核4GB)、RDS MySQL(1核1GB)、OSS、日志服务
地域:华东1(杭州)

在ECS上安装Python依赖:

pip install fastapi uvicorn celery redis sqlalchemy pymysql oss2

账号与权限配置

创建RAM用户,授予以下权限:

ECS相关:无特殊权限,使用AccessKey调用API
RDS:连接数据库
OSS:读写Bucket
日志服务:写入日志

将AccessKey配置为环境变量:

export ALIBABA_CLOUD_ACCESS_KEY_ID=""
export ALIBABA_CLOUD_ACCESS_KEY_SECRET=""

不要将密钥写入代码仓库。
核心实现
模型调用

使用阿里云百炼的DashScope SDK调用通义千问模型:

import dashscope
from dashscope import Generation

dashscope.api_key = os.getenv("DASHSCOPE_API_KEY")

def get_ai_answer(question):
response = Generation.call(
model="qwen-turbo",
prompt=question,
max_tokens=500
)
if response.status_code == 200:
return response.output.text
else:
raise Exception(f"API error: {response.code}")

数据存储

使用SQLAlchemy定义模型,将采集结果存入RDS:

class AnswerRecord(Base):
tablename = "answers"
id = Column(Integer, primary_key=True)
question = Column(String(500))
answer = Column(Text)
created_at = Column(DateTime, default=datetime.utcnow)

原始回答JSON存入OSS:

import oss2

auth = oss2.Auth(os.getenv("ALIBABA_CLOUD_ACCESS_KEY_ID"), os.getenv("ALIBABA_CLOUD_ACCESS_KEY_SECRET"))
bucket = oss2.Bucket(auth, "oss-cn-hangzhou.aliyuncs.com", "my-answer-bucket")

def save_raw(question, response):
key = f"raw/{datetime.now():%Y%m%d}/{uuid4().hex}.json"
bucket.put_object(key, json.dumps(response))

异步任务

使用Celery处理采集任务,避免阻塞API:

from celery import Celery

app = Celery("tasks", broker="redis://localhost:6379/0")

@app.task
def collect_answer(question):
try:
answer = get_ai_answer(question)
save_raw(question, answer)

    # 解析并存入数据库
except Exception as e:
    log_error(e)

部署到ECS

使用systemd管理FastAPI服务:

[Unit]
Description=FastAPI App
After=network.target

[Service]
User=ubuntu
WorkingDirectory=/home/ubuntu/ai-collector
ExecStart=/usr/bin/uvicorn main:app --host 0.0.0.0 --port 8000
Restart=always

[Install]
WantedBy=multi-user.target

启动服务:

sudo systemctl start fastapi
sudo systemctl enable fastapi

验证服务启动

检查服务状态:

sudo systemctl status fastapi

正常情况下应显示 active (running)。

查看应用日志:

sudo journalctl -u fastapi -f

应看到类似 Uvicorn running on http://0.0.0.0:8000 的日志。

调用健康检查接口(如果实现了):

curl http://localhost:8000/health

应返回 {"status":"ok"}。
验证采集任务

手动触发一个测试任务:

from tasks import collect_answer
result = collect_answer.delay("什么是RAG?")
print(result.id)

查看任务状态:

celery -A tasks status

检查数据库和OSS:

在RDS中查询 answers 表,应出现对应记录。
在OSS Bucket中查看 raw/ 目录,应有对应JSON文件。

性能优化与监控
数据库连接池配置

使用SQLAlchemy连接池,调整 pool_size 和 max_overflow 参数:

from sqlalchemy import create_engine

engine = create_engine(
"mysql+pymysql://user:pass@host:3306/dbname",
pool_size=10,
max_overflow=20,
pool_pre_ping=True
)

pool_size 设置连接池大小,max_overflow 设置最大溢出连接数,pool_pre_ping 在每次连接前检查连接是否有效。
模型调用超时与重试

为模型调用设置超时和重试,避免因限流导致任务失败:

import time
from tenacity import retry, stop_after_attempt, wait_exponential

@retry(stop=stop_after_attempt(3), wait=wait_exponential(multiplier=1, min=2, max=10))
def get_ai_answer_with_retry(question):
return get_ai_answer(question)

日志与监控告警

使用阿里云日志服务收集应用日志,并设置告警:

在日志服务中创建Project和Logstore。
在ECS上安装Logtail并配置采集。
设置告警规则,例如当错误日志出现时触发告警。

成本控制

ECS按量付费,测试完成后释放。
RDS选择最小规格,使用按量付费。
OSS存储费用根据实际存储量计费,具体费用请参考官方定价。
模型调用按Token计费,控制请求频率和Token数量。

常见问题与避坑
API Key未生效

现象:调用模型时返回401或InvalidApiKey。
排查:检查环境变量是否设置正确:

echo $DASHSCOPE_API_KEY

解决:重新设置环境变量,并重启服务。

数据库连接失败

现象:应用启动时报数据库连接错误。
排查:检查RDS白名单是否包含ECS公网IP。
解决:在RDS控制台添加ECS公网IP到白名单。

任务重复执行

现象:同一任务被多次执行。
解决:在Celery任务中设置幂等性,使用唯一ID去重。

日志丢失

现象:日志服务中看不到日志。
排查:检查Logtail配置和网络连通性。
解决:确认日志服务Project和Logstore配置正确。

总结

本文介绍了AI回答采集系统上云的完整流程,从环境准备、代码实现到部署监控。通过合理规划资源和成本控制,可以实现稳定、可维护的云上系统。关键点包括:使用RAM最小权限、配置环境变量、使用异步任务、设置监控告警。希望本文能帮助开发者顺利完成上云迁移。

相关文章
|
1天前
|
人工智能 搜索推荐 新能源
制造业B2B工厂如何通过GEO让AI主动推荐你:3步落地指南
传统搜索引擎流量被AI蚕食,采购决策者正转向生成式AI初筛供应商。本文拆解GEO(生成式引擎优化)逻辑,提供工厂老板可落地的3步实操法与3个效果监测指标,助你信息进入AI推荐名单。
50 1
|
1天前
|
JSON API 数据格式
发票勾选认证-发票认证-进项发票勾选认证-进项发票认证API接口介绍
本API提供增值税进项发票智能认证服务,支持免插盘、多税号、集中批量勾选与状态查询。涵盖抵扣、退税、不抵扣等13类勾选类型,兼容专票、普票、全电票等14种发票类型,助力企业高效完成税务认证全流程。
26 0
|
1天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
|
1天前
|
数据采集 Web App开发 JSON
某站用户画像爬虫:爬取UP主粉丝数据,揭秘平台生态
本文详解B站UP主粉丝数据爬取与用户画像构建:涵盖API接口调用、反爬策略(UA轮换、随机延迟、Referer伪装)、隧道代理集成(如站大爷),以及粉丝增长分析、跨圈层传播、影响力评估等实战应用,助内容创作者、品牌方和研究者科学洞察平台生态。(239字)
28 0
|
1天前
|
SQL 测试技术 数据库
上线前2小时发现少了3个字段:手动改表引发的CI/CD实践
手动改表导致环境不一致、多人协作冲突、回滚无门。从设计师的版本控制思维出发,讲清楚Flyway迁移脚本原理、GitOps漂移检测机制,以及CI/CD流水线落地和回滚的完整方案。
|
1天前
|
人工智能 API 调度
企业 Agent 资产化:用 OpenAgentPack 把百炼 Agent 纳入 Git 管理
2026年AI Agent企业落地关键在资产治理。OpenAgentPack(Apache-2.0,Beta)首创Agent层IaC范式,通过`agents.yaml`声明模型、工具、技能、调度等全要素,支持validate→plan→apply工作流,实现提示词/知识/配置的版本化、可审计、可回滚管理,已兼容百炼、Qoder等四大平台。(239字)
|
1天前
|
API 开发工具 容器
[鸿蒙从零到一] ArkUI 动画与转场实战:状态驱动、组件过渡与页面衔接
本文系统讲解鸿蒙ArkUI动画与转场实战,涵盖状态驱动动画、组件过渡(`transition`)、列表增删、共享元素(`geometryTransition`)及Navigation页面衔接,强调语义化、性能与无障碍设计。
21 0
|
1天前
|
自然语言处理 搜索推荐 关系型数据库
企业知识库一站式方案怎么选?向量 + 全文一体检索详解
企业知识库的推荐解法是"向量语义 + 全文关键词一体化"。阿里云 PolarDB 在一套系统内提供混合检索并可结合业务过滤,免去多系统拼接,是企业知识库一站式方案的推荐选择。具体能力请以官方文档为准。
28 0
|
1天前
|
人工智能 持续交付
未来五年,OPC会成为主流创业模式吗?一个更冷静的判断
OPC(一人公司)兴起不意味全员创业,而是推动组织形态多元化:个人、小团队与企业边界更灵活。技术降低协作成本,专业深度比流量更重要;OPC适用于知识服务等领域,但不取代需复杂协作的传统行业。它带来选择自由,也伴随收入波动等风险。核心是培养可迁移的独立解决问题能力。(239字)
|
1天前
|
Java 数据处理 调度
以为 asyncio.run() 就是简单的启动?它和 loop.run_until_complete() 的区别让我项目崩了3次
本文以三次通宵调试为线索,深入剖析 `asyncio.run()` 与 `loop.run_until_complete()` 的本质区别:前者是“一站式服务”,自动创建并关闭事件循环,仅限主入口调用一次;后者是“底层工具”,需手动管理循环生命周期,适用于复用场景。核心铁律:**一个线程同一时间只能有一个运行中的事件循环**。(239字)
27 0