阿里云日志服务 SLS + 函数计算:给商会系统做一次线上慢接口排查实战

简介: 商会系统上线后,会员反馈接口“卡顿”“导出慢”,但本地无法复现。我们接入阿里云SLS日志分析+函数计算(FC)实现自动巡检:统一采集JSON日志、索引关键字段,SQL秒级统计P95耗时与慢请求明细,FC定时告警并联动钉钉。实战中1小时内定位导出接口瓶颈,优化后P95从8s降至1s内。低成本、免运维、高时效。(239字)

商会系统上线后,会员反馈"列表偶尔卡好几秒""导出报表半天"。这类"慢"本地复现不了,只能上线上看真实日志,我们之前靠文本日志 grep 半天,效率很低。

后来把日志接进 SLS,再用函数计算 FC 跑定时排查,慢接口一目了然。

一、先说边界

我们的诉求三点:查任意窗口的接口耗时分布、慢接口自动告警、排查任务按需跑不养服务器。

基于这三条,我们排除了两套:自己搭 ELK 运维太重,只打点又没法聚合查询。

最终方案:日志统一采集到 SLS,用其查询分析做耗时统计,用 FC 定时跑慢接口巡检并告警。

二、日志采集:Logtail 统一打点

后端每个接口在入口出口记录耗时,按统一 JSON 输出,Logtail 自动采集进 SLS。

{
   
  "level": "info",
  "trace_id": "a1b2c3",
  "method": "GET",
  "path": "/api/members",
  "status": 200,
  "cost_ms": 1820,
  "org_id": 1024,
  "ts": "2026-09-07T10:22:01Z"
}

关键是 cost_ms 和 path 两个字段,Logtail 设成索引 SLS 才能统计。

三、SLS 查询:耗时分布

查某个接口在过去一小时的 P95 耗时,用 SLS 的 SQL 分析:

* and path: "/api/members" and status: 200
| select
    date_trunc('minute', ts) as minute,
    avg(cost_ms) as avg_ms,
    approx_percentile(cost_ms, 0.95) as p95_ms,
    count(*) as qps
  group by minute
  order by minute

这条查询画出每分钟平均耗时和 P95 曲线,哪个分钟突然抬高一眼可见。

还加了一条"慢请求明细"查询,专门捞耗时超一秒的:

* and cost_ms > 1000
| select path, cost_ms, org_id, ts
  order by cost_ms desc
  limit 100

这根查询排在前面的,就是当天响应慢的接口,排查就从这里入手。

四、函数计算:定时巡检 + 告警

SLS 查询要手动跑,我们希望每天自动跑、超阈值告警,于是用 FC 定时触发器跑巡检函数。

const {
    Client } = require('@alicloud/sls20201230');

exports.handler = async (event) => {
   
  const client = new Client({
    accessKeyId: process.env.AK, accessKeySecret: process.env.SK, endpoint: process.env.SLS_EP });
  const query = `* and cost_ms > 1000 | select path, approx_percentile(cost_ms,0.95) as p95, count(*) as cnt group by path having cnt > 20`;

  const res = await client.ExecuteQuery({
   
    projectName: process.env.SLS_PROJECT,
    logStoreName: 'app-access',
    query,
    from: Date.now() - 3600 * 1000,
    to: Date.now()
  });

  const slow = (res.body.results || []).filter((r) => r.p95 > 800);
  if (slow.length) {
   
    // 推到钉钉/短信,这里只示意
    await notify({
    title: '慢接口告警', detail: slow.map((s) => `${
     s.path} p95=${
     s.p95}ms 次数=${
     s.cnt}`) });
  }
  return {
    slowCount: slow.length };
};

FC 按调用计费,巡检每天跑几次费用可忽略。

五、实战:一次导出接口变慢

上个月排查"导出报表卡半天",按上面流程先捞慢请求明细,发现 /api/reports/export 的 P95 到八秒,且卡在一个 org_id 上。

顺着 org_id 查发现导出时后台在跑全量会员聚合查询,重查询和定时任务撞车。

解决办法:导出任务改异步扔进消息队列,后端限流控制同时只跑两个导出。改完再跑巡检,P95 回到一秒以内。

走 SLS 加 FC,从告警到定位不到一小时。

六、几个细节

一是索引字段别太多。SLS 按索引字段计费,只把 path、status、cost_ms、org_id、ts 设索引,其余当原文存,省钱。

二是采样,高峰全量采集量大,对 info 级采样、error 级全采,存储成本降六成。

三是告警阈值:P95 超八百毫秒且持续十分钟才告警,避免偶发抖动误报。

四是 trace_id 串联,慢请求顺 trace_id 看完整调用链,前端到数据库都能追。

我们这边在跑的商会管理系统叫未来漫城·商会互联平台,线上可观测就是这套 SLS 加 FC 的组合,会员反馈"卡"时秘书处不用等我们远程,告警已先到,慢接口在哪个商会、哪个接口、卡多久,打开 SLS 一看就清楚。

相关文章
|
3天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1102 0
|
12天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3689 3
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
24天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13477 93
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
17天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1956 5
|
3天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
885 0
|
12天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
9天前
|
人工智能 并行计算 数据可视化
秋叶ComfyUI-AKI最新整合包|完整部署教程+核心指令手册
秋叶ComfyUI-AKI一键整合包,国内适配最优、稳定性最强的商用/学习级版本:全封装虚拟环境、预装90%常用节点、内置绘世启动器与成熟工作流,免配置、零依赖、解压即用,完美兼顾新手入门与专业批量生产需求。(239字)
|
9天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。

热门文章

最新文章