函数计算 + API Gateway:从 ECS 迁到 Serverless 的成本与冷启动实测
分类:云原生 | 角度:工程/成本视角
素材依据:阿里云函数计算 FC 公开产品文档与计费说明
一、为什么要把「常驻 ECS」换成「按需 Serverless」
很多团队的第一反应是:一台 ECS 跑 HTTP 服务,简单、可控、按月包年也不贵。但把账算细一点,常驻虚拟机的成本大头其实是「为峰值买单、为闲置空转」:
- 为了扛住每天几次的流量峰值,CPU/内存规格必须按峰值预留;
- 夜间、周末、节假日,服务几乎没有请求,但 ECS 依然 7×24 计费;
- 扩容要手动、缩容舍不得,长期处于「规格偏高但利用率很低」的状态。
函数计算(FC)的解法是把「资源」变成「按调用计费」:有请求才创建实例、无请求缩容到 0、按实际使用时长与规格计费。配合 API Gateway 做 HTTP 入口,可以把一个原本需要常驻 ECS 的 Web 服务,改造成完全按量付费的形态。
二、成本账:从「月付几百元」到「百元级甚至更低」的逻辑
这里不吹「省 90%」这种绝对数字——真实降本幅度取决于你的调用密度。FC 降本的底层逻辑是「让闲置归零」:
- 缩容到 0 不计费:阿里云官方 FAQ 明确,只要函数单小时内没有调用、或没有占用计算资源,实例数量可保持为 0,享受真正的按需付费。
- 浅休眠(原闲置)低计价:当设置最小实例数 ≥1 时,未处理请求阶段的弹性实例进入「浅休眠」,此时 vCPU 资源使用不收费,GPU 资源仅收 1/5 费用。这比「常驻实例全程按活跃计费」省得多。
- 按量弹性:业务请求越频繁、资源利用率越高,相对虚拟机的降本幅度越高。
需要诚实指出的一点是:2025-12-09 起,FC 新增了「小时级最低消费 0.01 元」和「按请求弹出实例默认延时 1 分钟释放」两条计费优化。也就是说,「绝对零成本」只在单小时内完全无调用、无占用时成立;一旦有调用,最低也会产生 0.01 元的小额消费,且实例会在最后一次请求结束后延时约 1 分钟再回收。这对大多数业务可忽略,但对「极低频、大规模小规格函数」这类边缘场景,需要重新评估。
三、冷启动实测:CPU 百毫秒级,GPU 分钟级
冷启动是 Serverless 绕不开的话题。FC 的公开规格给出了明确预期:
- CPU 业务:冷启动效率为百毫秒级。对绝大多数 Web/API 场景,配合「最小实例数 ≥1」提前锁定弹性资源,可以进一步消除冷启动。
- GPU 业务:冷启动效率为分钟级。这也是为什么 GPU 函数提供「常驻实例」「常驻 + 弹性混合」模式——用预付费锁定资源换取零冷启动,适合对时延和费用稳定性要求高的 AI 推理场景。
所以「5s 冷启动」是过去的老印象,现在 CPU 函数已经能做到百毫秒级。真正需要关注的冷启动优化手段有三:
- 设置最小实例数 ≥1:提前锁定弹性资源,请求到达时迅速唤醒,避免冷启动;代价是 7×24 持续计费,需配合「浅休眠」降低闲置成本。
- 定时伸缩 / 水位伸缩:按业务周期(如工作日 10:00 扩容、22:00 收缩)动态调整最小实例数,兼顾性能与成本。
- 减少镜像体积:CPU 实例镜像 ≤10GB(未解压)、GPU ≤15GB,大模型等重资产放 NAS/OSS,缩小镜像能直接降低冷启动拉取耗时。
四、适合 vs 不适合:五类高 ROI 与三类需谨慎
适合迁到 FC + API Gateway 的场景(高 ROI):
- 有明确峰谷的 Web 服务(白天高峰、夜间闲置);
- 低频但需快速响应的 API/回调/Webhook;
- 事件驱动、定时任务、文件处理等「来活才干活」的负载;
- 需要快速弹性扩容、不想提前规划容量的新业务;
- 希望免运维、聚焦业务逻辑的小团队。
需谨慎或暂不建议的场景:
- 对时延极度敏感、且无法接受任何冷启动的关键链路(需评估常驻实例成本);
- GPU 密集推理且对费用稳定性要求极高(需为常驻实例预算);
- 单小时内「大规模超低频小规格函数」这类极边缘负载(受最低消费与延时释放机制影响)。
五、迁移落地要点(工程侧)
- 入口改造:用 API Gateway 承接 HTTP,把路由/鉴权/限流放在网关层,函数只做业务逻辑。
- 无状态化:函数实例可能被回收,状态放外部(数据库/OSS/缓存),避免依赖本地文件。
- 配置弹性策略:先按最小实例数 0 跑,观测冷启动与延迟,再按需设置定时伸缩。
- 成本监控:用费用中心 + 函数监控,重点盯「浅休眠时长占比」和「活跃实例峰值」,持续调优。
六、小结
从 ECS 迁到「FC + API Gateway」的核心收益不是某个「省多少」的魔法数字,而是把「为峰值预留的常驻资源」换成「按实际调用付费的弹性资源」。CPU 业务百毫秒级冷启动、缩容到 0 不计费、浅休眠低价闲置,这三条机制决定了它对「有峰谷、非持续高负载」的业务有真实的降本空间;而 GPU 分钟级冷启动与 2025 年底的计费优化,则提醒你在边缘场景下要算清楚账再动手。
参考资料:阿里云函数计算帮助中心——「计费概述」「实例类型与规格」「配置最小实例数弹性策略」「关于优化函数计费模式的说明」。