并行计算

首页 标签 并行计算
# 并行计算 #
关注
5547内容
|
1月前
|
跨模型复用 KV Cache:如何复用 Prefill 结果
NVIDIA提出跨模型KV Cache映射技术,通过线性转换复用小模型生成的缓存,使大模型跳过重复Prefill,加速2.7–25倍;实验证明误差在注意力敏感方向的影响远大于整体重建精度,为高效低成本模型切换提供新范式。
从 FP32 到 INT4:基于 GPTQ 的大模型量化实战——以 Llama-2-7B 为例
本文详述一次真实Llama-2-7B模型量化实战:从28GB显存压缩至6GB(INT4-GPTQ),精度损失仅约7.3%,推理速度反提升50%。含环境配置、量化代码、精度评测及五大避坑指南,全流程可复现。(239字)
|
1月前
| |
分层配额显存共享方案:RTX4090运行ChatGLM2/3双模型,显存池化应用实践.194
本文提出显存池化分片调度技术,解决单张RTX4090(24GB)无法同时运行ChatGLM2-6B与ChatGLM3-6B的难题。通过将显存切分为64MB Chunk,划分“保底锁定”(承载权重,不可抢占)与“弹性共享”(承载KV缓存,可抢占回收)双区,并引入优先级抢占、后台碎片合并与统一适配封装,实现两模型逻辑隔离、物理共用,显存利用率提升超50%,无需额外购卡。
|
1月前
| |
RTX4090单卡跑Qwen3-32B实践:4bit量化+Transformers与vLLM双方案部署差异.193
本文详解RTX4090(24GB显存)部署Qwen3-32B大模型的实战方案:聚焦4bit量化(NF4+双量化)突破显存瓶颈,对比Transformers与vLLM框架——后者推理快2倍、显存利用率更高,实测生成质量无损,为消费级显卡运行32B模型提供可落地的最优解。
|
1月前
| |
单卡4090显存优化实践:模型单卡分片加载、推理链路拆解、延迟与吞吐平衡调优.190
本文详解RTX 4090单卡高效运行大模型的底层方案:通过张量并行(降低单次计算显存峰值)与分层分片(CPU存权重、GPU逐层加载释放),以时间换空间,突破24G显存瓶颈。结合BF16量化、KV缓存优化与异步调度,实现百亿参数模型稳定推理,兼顾延迟、吞吐与成本。
聚搜云运维团队:HPC 集群云上迁移 数据调度作业实操详解
去年下半年,一家做分子模拟的创业团队发现,本地集群的排队时间从2小时拉长到8小时,而补一组节点需要审批、采购、上架,三个月起步。他们的故事不是孤例:当算力直逼物理极限,越来越多的研究机构和制造企业开始重新审视本地 HPC 的经济性。这份传统HPC集群迁移上云指南,正是为这类决策者准备的一份实操参照,而不是一张软硬件采购清单。
72GB 专业显卡能否撑起长上下文 Agent?一场面向软件测试人的大模型推理性能评测
本文从软件测试视角,深度剖析Agent时代硬件选型新标准:以四卡RTX PRO 5000(72GB×4)工作站实测为例,揭示长上下文、高并发下显存瓶颈远超模型权重加载——KV Cache、多轮状态、RAG文档与工具调用共同推高显存需求。强调性能测试需覆盖TTFT/ITL/吞吐率,并补充质量验证,告别“能跑即可用”。
聚搜云运维团队:阿里云E-HPC作业报错日志节点排查技巧
阿里云E-HPC作业失败的原因很少藏在应用代码里,更多是调度层与节点层的配合出了问题。一台上百核的集群上,一次OOM、一个错误的分区配置、甚至一条被忽略的Event通知,都能让作业在Slurm队列里无声卡死或直接CANCELLED。要把排查从“碰运气”变成有章可循的方法,得先理解作业在E-HPC里真正经历了什么。
聚搜云专业运维团队:阿里云E-HPC MPI任务集群配置性能实战
阿里云E-HPC把集群调度、MPI运行环境和RDMA网络打包成一项托管服务,研发团队不用从零配置SLURM或编译OpenMPI,就能直接提交并行作业。对于那些跑仿真、做计算化学或者训练中小规模模型、希望把“阿里云E-HPC运行MPI并行任务”这件事变得像提交命令一样简单的团队,这层封装可以大幅缩短从硬件到上线的时间窗口。
同样32GB显存,RTX 5090和魔改4080 Super怎么选
本地大模型推理,显存常成瓶颈。RTX 5090原生32GB GDDR7显存,性能强劲但价格高昂;魔改RTX 4080 Super 32G以Ada架构+32GB GDDR6X显存,实测达5090约70%推理速度,性价比突出,专为30B级模型本地部署优化。
免费试用