PyTorch

首页 标签 PyTorch
# PyTorch #
关注
5022内容
|
3天前
| |
来自: 云原生
阿里云亮相开源 AI 三大顶会!我们上海见
2026 年 9 月 5 日至 9 日,AGNTCon + MCPCon、PyTorch Conf China、KubeCon + CloudNativeCon China 等开源 AI 顶会即将在上海举办。 阿里云技术专家们将在大会上,为广大开发者带来 Agent 运行时、模型训练和推理、云原生基础设施等领域的开源项目最新进展分享。
|
12天前
| |
为什么大模型不会读乱语序:从绝对座位号、高维时针到RoPE旋转位置编码全解析
本文深度解析大模型自注意力机制的时序盲区,揭示RoPE旋转位置编码如何通过复数旋转变二维向量为“高维时钟”,使相对距离自然浮现于内积计算中,并详解其支持百万Token长文本外推的几何原理与PyTorch实现。
极端天气目标识别的工程化补强:本地检测、视觉模型复核与人工闭环
本文提出面向极端天气(雨雪、雾霾、夜间等)的目标识别分层方案:本地检测器高效定位,规则层动态分流低置信/关键目标,视觉模型语义复核,人工闭环高风险样本。强调可落地性——不依赖“更大模型”,而通过职责分离、阈值校准、接口解耦与合规管控,实现鲁棒、可控、可演进的工业级识别系统。(239字)
|
26天前
| |
来自: 云原生
模型能装进显存,训练为什么还是 OOM?把 PyTorch 显存拆成 5 笔账
模型权重能够装进显存,不代表训练就能正常运行。本文拆解 PyTorch 训练中的参数、梯度、优化器状态、激活值和临时工作区,并给出显存监测代码及 OOM 排查顺序,覆盖梯度累积、混合精度、Gradient Checkpointing 和 LoRA 等常用方案。
从 FP32 到 INT4:基于 GPTQ 的大模型量化实战——以 Llama-2-7B 为例
本文详述一次真实Llama-2-7B模型量化实战:从28GB显存压缩至6GB(INT4-GPTQ),精度损失仅约7.3%,推理速度反提升50%。含环境配置、量化代码、精度评测及五大避坑指南,全流程可复现。(239字)
|
1月前
| |
RTX4090单卡跑Qwen3-32B实践:4bit量化+Transformers与vLLM双方案部署差异.193
本文详解RTX4090(24GB显存)部署Qwen3-32B大模型的实战方案:聚焦4bit量化(NF4+双量化)突破显存瓶颈,对比Transformers与vLLM框架——后者推理快2倍、显存利用率更高,实测生成质量无损,为消费级显卡运行32B模型提供可落地的最优解。
免费试用