官方博客-第20页-阿里云开发者社区

亦达

2025-02-20

746

破解 vLLM + DeepSeek 规模化部署的“不可能三角”

vLLM 是一种便捷的大型语言模型（LLM）推理服务，旨在简化个人和企业用户对复杂模型的使用。通过 vLLM，用户可以轻松发起推理请求，享受高效、稳定的 LLM 服务。针对大规模部署 vLLM 的挑战，如大模型参数量、高效推理能力和上下文理解等，阿里云函数计算（FC）提供了 GPU 预留实例闲置计费功能，优化了性能、成本和稳定性之间的平衡。此外，FC 支持简便的部署流程和多种应用集成方式，帮助企业快速上线并管理 vLLM 服务。总结来说，vLLM 结合 FC 的解决方案为企业提供了强大的技术支持和灵活的部署选项，满足不同业务需求。

亦达

746

尹斌斌周絮

2025-03-21

774

解决隐式内存占用难题

本文详细介绍了在云原生和容器化部署环境中，内存管理和性能优化所面临的挑战及相应的解决方案。

尹斌斌周絮

774

阿里云云原生

2025-04-17

1277

通义灵码 Rules 库合集来了，覆盖Java、TypeScript、Python、Go、JavaScript 等

通义灵码新上的外挂 Project Rules 获得了开发者的一致好评：最小成本适配我的开发风格、相当把团队经验沉淀下来，是个很好功能……

阿里云云原生

1,277

阿里云云原生

2025-04-28

731

StrmVol 存储卷：解锁 K8s 对象存储海量小文件访问性能新高度

本文介绍了阿里云容器服务（ACK）支持的StrmVol存储卷方案，旨在解决Kubernetes环境中海量小文件访问性能瓶颈问题。通过虚拟块设备与内核态文件系统（如EROFS）结合，StrmVol显著降低了小文件访问延迟，适用于AI训练集加载、时序日志分析等场景。其核心优化包括内存预取加速、减少I/O等待、内核态直接读取避免用户态切换开销，以及轻量索引快速初始化。示例中展示了基于Argo Workflows的工作流任务，模拟分布式图像数据集加载，测试结果显示平均处理时间为21秒。StrmVol适合只读场景且OSS端数据无需频繁更新的情况，详细使用方法可参考官方文档。

阿里云云原生

731

阿里云云原生

2025-05-23

582

MCP Server 实践之旅第 3 站：MCP 协议亲和性的技术解析

本文将以 MCP Server 在函数计算平台的深度集成为研究载体，解构基于 SSE 长连接通信模型，剖析会话亲和、优雅升级等关键技术，揭示 Serverless 架构在 MCP 场景中的亲和性创新实践。

阿里云云原生

582

ModelScope

2024-05-15

1155

LISA微调技术解析：比LoRA更低的显存更快的速度

LISA是Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning的简写，由UIUC联合LMFlow团队于近期提出的一项LLM微调技术，可实现把全参训练的显存使用降低到之前的三分之一左右，而使用的技术方法却是非常简单。

ModelScope

1,155

阿里云云原生

2024-09-02

698

西游再现，一键部署 Flux 文生图大模型生成西游人物

从花果山的灵石出世，到取经路上的九九八十一难，再到大闹天宫的惊心动魄……这些耳熟能详的西游场景，如今都能通过 Flux 模型，以超乎想象的细节和真实感呈现在你眼前。本次实验在函数计算中内置的 flux.1-dev-fp8 大模型，搭配 Lora 模型，无需复杂的配置，一键部署，你就能成为这场视觉盛宴的创造者。

阿里云云原生

698

张浩然郭小兵

2024-11-25

537

智能调度、秒级弹性｜一文带你探索Compaction Service的进化之路

ADB MySQL的Compaction Service功能通过将Compaction任务从存储节点解耦至独立的弹性资源池执行，解决了资源隔离性弱、并发度低等问题，实现了资源消耗降低50%，任务执行时间平均减少40%，并支持按量付费，提升了系统的稳定性和成本效益。

张浩然郭小兵

537

望宸

2025-02-20

681

大模型推理服务全景图

推理性能的提升涉及底层硬件、模型层，以及其他各个软件中间件层的相互协同，因此了解大模型技术架构的全局视角，有助于我们对推理性能的优化方案进行评估和选型。

望宸

681

官方博客-第20页-阿里云开发者社区

类目筛选

内容类型

破解 vLLM + DeepSeek 规模化部署的“不可能三角”

解决隐式内存占用难题

通义灵码 Rules 库合集来了，覆盖Java、TypeScript、Python、Go、JavaScript 等

StrmVol 存储卷：解锁 K8s 对象存储海量小文件访问性能新高度

MCP Server 实践之旅第 3 站：MCP 协议亲和性的技术解析

LISA微调技术解析：比LoRA更低的显存更快的速度

西游再现，一键部署 Flux 文生图大模型生成西游人物

智能调度、秒级弹性｜一文带你探索Compaction Service的进化之路

大模型推理服务全景图

官方博客-第20页-阿里云开发者社区

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

类目筛选

内容类型

破解 vLLM + DeepSeek 规模化部署的“不可能三角”

解决隐式内存占用难题

通义灵码 Rules 库合集来了，覆盖Java、TypeScript、Python、Go、JavaScript 等

StrmVol 存储卷：解锁 K8s 对象存储海量小文件访问性能新高度

MCP Server 实践之旅第 3 站：MCP 协议亲和性的技术解析

LISA微调技术解析：比LoRA更低的显存更快的速度

西游再现，一键部署 Flux 文生图大模型生成西游人物

智能调度、秒级弹性｜一文带你探索Compaction Service的进化之路

大模型推理服务全景图