Windows 环境下 llama.cpp 编译运行指南

简介: 本文详解Windows下用llama.cpp本地部署大模型:从VS2026编译(支持CPU/GPU)、ModelScope下载GGUF格式Qwen2.5-1.5B模型,到启动llama-server API服务及Python调用验证,全程轻量、低延迟、高隐私,助力开发者快速落地。

在大模型落地场景中,本地轻量化部署因低延迟、高隐私性、无需依赖云端算力等优势,成为开发者与 AI 爱好者的热门需求。本文聚焦 Windows 环境,详细拆解 llama.cpp 工具的编译流程,并指导如何通过 modelscope 下载 GGUF 格式的模型,最终实现模型本地启动与 API 服务搭建。

1、编译源码之前需要自行安装 Visual Studio 18 2026 开发工具,并打开VS2026 x64 兼容工具命令提示,执行如下命令克隆仓库。

Microsoft Visual Studio 18.0> git clone https://github.com/ggml-org/llama.cpp
Microsoft Visual Studio 18.0> mkdir build
Microsoft Visual Studio 18.0> cd build

2、基础编译(仅 CPU 支持)或者选用GPU 加速编译(已安装 CUDA Toolkit)版。

如果只使用 CPU 模式则执行如下配置

Microsoft Visual Studio 18.0> cmake .. -G "Visual Studio 18 2026" -A x64 -DLLAMA_CURL=OFF
Microsoft Visual Studio 18.0> cmake --build . --config Release

如果已安装 CUDA Toolkit 工具包,则添加 -DLLAMA_CUDA=ON 开启 GPU 加速支持

Microsoft Visual Studio 18.0> cmake .. -G "Visual Studio 18 2026" -A x64 -DLLAMA_CUDA=ON
Microsoft Visual Studio 18.0> cmake --build . --config Release

编译完成后则会在build目录生成对应的可执行文件,其中的llama-server.exe则为主程序

3、下载 GGUF 格式的模型权重文件,模型权重已同步上线两大主流渠道,开发者任选其一即可。

以魔搭社区为例,直接使用官方PIP包拉取仓库内容到本地,下载后的保存位置为 C:\Users\Admin\dir 执行以下命令完成模型下载。

# 安装魔搭
C:> pip install -i https://mirrors.tuna.tsinghua.edu.cn/pypi/web/simple modelscope

# 下载 Qwen2.5-1.5B-Instruct-GGUF 完整仓库模型文件
C:> modelscope download --model Qwen/Qwen2.5-1.5B-Instruct-GGUF

# 下载 Qwen2.5-1.5B-Instruct-GGUF 仓库下 qwen2.5-1.5b-instruct-q4_k_m.gguf 模型文件
C:> modelscope download --model Qwen/Qwen2.5-1.5B-Instruct-GGUF qwen2.5-1.5b-instruct-q4_k_m.gguf --local_dir ./dir

4、将下载好的qwen2.5-1.5b-instruct-q4_k_m.gguf模型文件,放在llama-server.exe同级目录下,同时打开命令行工具,执行启动命令:

# 执行命令行启动
C:> chcp 65001
C:> llama-cli.exe -m qwen2.5-1.5b-instruct-q4_k_m.gguf -i -c 4096

# 执行启动CPU版本服务端
C:> llama-server.exe -m qwen2.5-1.5b-instruct-q4_k_m.gguf --host 127.0.0.1 --port 11433 -c 4096

# 执行驱动GPU加速版服务端
C:> llama-server.exe -m qwen2.5-1.5b-instruct-q4_k_m.gguf --host 127.0.0.1 --port 11433 -c 1024 --n-gpu-layers 32

5、直接调用 /completion 接口,原生Python标准库,无需额外第三方包,验证服务可用性。

import json
from urllib import request, error

url = "http://127.0.0.1:11433/completion"
headers = {
   "Content-Type": "application/json"}

prompt = """<|im_start|>user
你好,简单介绍一下自己<|im_end|>
<|im_start|>assistant
"""

data = {
   
    "model": "qwen2.5-1.5b-instruct-q4_k_m.gguf",
    "prompt": prompt,
    "temperature": 0.7,
    "max_tokens": 512,
    "ctx_size": 4096,
    "stop": ["<|im_end|>"],
    "stream": False
}

try:
    data_json = json.dumps(data).encode("utf-8")
    req = request.Request(url, data=data_json, headers=headers, method="POST")
    with request.urlopen(req, timeout=60) as response:
        result = json.loads(response.read().decode("utf-8"))

    print("生成结果:")
    print(result["content"].strip())

except error.HTTPError as e:
    print(f"调用失败(HTTP错误):{e.code} - {e.reason}")
except error.URLError as e:
    print(f"调用失败(连接/网络错误):{e.reason}")
except Exception as e:
    print(f"调用失败(其他异常):{e}")

运行main.py,正常输出示例如下,代表本地大模型服务部署完成,可以对外提供推理服务。

C:> main.py
生成结果:
您好!我是来自阿里巴巴的AI助手,我叫通义千问。
目录
相关文章
|
10小时前
|
JSON 人工智能 监控
LangChain 消息流输出与结构化处理
LangChain 是大模型应用开发主流框架,本文基于最新稳定版,详解其四大核心能力:标准化消息机制(角色/内容/元数据)、闭环工具调用、多场景流式传输(文本/工具/推理分片)、规范化结构化输出(Pydantic/JSON Schema等),直击原生LLM落地痛点,夯实智能体开发基石。(239字)
28 0
|
10小时前
|
人工智能 Ubuntu 数据可视化
Ubuntu 本地部署Ollama+OpenWebUI教程
本文详解Ubuntu下零基础部署Ollama+OpenWebUI:一键安装Ollama(支持CPU/GPU)、拉取轻量qwen3.5:0.8b模型、虚拟环境隔离安装OpenWebUI、配置systemd自启服务,最终建成可远程访问、离线运行、稳定易用的本地AI对话网页。
27 0
|
存储 人工智能 JSON
不用云端付费!Qwen 本地 + ComfyUI AI 漫剧实操全流程,小白零基础上手,零成本无限生成,角色一致性
2026全网唯一零成本、纯本地AI漫剧全自动流水线:Ollama离线运行Qwen大模型写剧本,ComfyUI+专属插件实现跨镜头角色100%统一、高清原画与动态短片批量生成。8G显存低配电脑30分钟可搭,全程断网、隐私可控,适配小说推文、短剧创作等全场景。(239字)
|
2月前
|
人工智能 缓存 固态存储
零基础本地AI漫剧搭建指南:阿里云通义千问Qwen大模型+ComfyUI剧本分镜成片完整流程
2026年本地AI漫剧流水线方案以通义千问(Qwen)本地大模型搭配ComfyUI绘图引擎为双核心,整套流程完全离线运行、全程零额外计费、无平台审核限流,同时解决AI漫剧最核心的角色形象跳变问题,最低8G独立显卡即可完整运行,零基础创作者30分钟就能搭建完整自动化漫剧生产链路,实现从文字故事自动生成完整分镜、静态漫画画面、动态短视频成片,适配自媒体日更、小说改编、原创短剧等各类内容创作需求。整套本地方案区别于各类线上AI漫生成平台,所有剧本、人设、图像素材全部保存在本地设备,不存在内容上传泄露风险,批量生成无次数上限,长期创作大幅降低内容制作成本,下文从硬件门槛、环境部署、自动化工作流、角色一
1188 0
|
12天前
|
机器学习/深度学习 人工智能 自然语言处理
轻量化小模型MiniMind从训练到落地指南
本文基于Ubuntu 22.04与RTX显卡,手把手教你用原生PyTorch从零训练MiniMind(26M–200M)轻量大模型:涵盖环境配置、预训练、SFT微调、LoRA垂域适配、DPO对齐、Web服务搭建及GGUF量化全流程。3小时可跑通基础对话,低成本、可复现、适合新手入门与私有化部署。(239字)
188 2
|
10天前
|
JSON Ubuntu 物联网
千问大模型二次LoRA‑SFT指令微调指南
大模型微调是实现模型领域定制的核心方案。本文基于 Ubuntu 22.04 服务器环境,依托 NVIDIA RTX 家用高性能显卡,选用千问 Qwen3.5‑0.8B‑Instruct 指令模型,完整演示二次 LoRA‑SFT 微调全流程,包含环境搭建、模型选型、ChatML 数据集制作校验、LoRA 参数配置、SFT 训练、效果验证、权重合并,附带可直接运行的工程脚本,便于开发者快速实现千问模型轻量化定制与上线部署。
169 2
|
数据采集 缓存 自然语言处理
CDN云课堂 |可编程CDN – EdgeScript应用场景、语言速览和实操演示
5月8日下午15:00,CDN云课堂的第二期,阿里云CDN团队技术专家拓山为大家带来了《可编程CDN – EdgeScript实践》主题技术分享。本次分享通过对阿里云CDN成长到当前体量的挑战以及对应的解法,阐述EdgeScript为何而生,同时也快速对ES语言进行速览,并通过官网EdgeScript控制台去进行实操,帮助用户十分钟上手EdgeScript。
5025 0
CDN云课堂 |可编程CDN – EdgeScript应用场景、语言速览和实操演示
|
1天前
|
存储 SQL 运维
【服务器数据恢复】基于不同机型的服务器RAID5容错原理与数据恢复策略
随着信息技术的持续迭代,服务器硬件架构与阵列技术不断升级,不同型号服务器的RAID5故障表现、处理逻辑及恢复方法存在明显差异。当前,大型业务系统的网络架构多采用C/S或B/S模式,核心业务数据库均部署在中心机房的专用服务器中。为保障数据存储的安全性、稳定性与可靠性,行业内普遍采用RAID磁盘阵列技术实现磁盘冗余备份。
49 26
|
2天前
|
人工智能 数据挖掘 BI
QwenWork千问办公完整解析:依托Qwen3.8大模型,六大核心能力重构企业自动化办公流与计费选型实操
综合来看,千问办公QwenWork依托Qwen3.8基座,六大核心能力打通文档处理、数据分析、浏览器自动化、技能编排、多端Agent、企业业务系统,将AI能力从简单对话升级为完整任务交付,解决企业大量重复性办公工作。但办公智能体属于效率辅助工具,无法替代业务人员专业判断,财务、法务关键业务输出必须人工审核。企业落地需要区分上层SaaS产品和底层API两条路线,普通业务直接使用平台,高并发定制化业务调用底层API开发,做好版本选型和积分成本管控,最大化释放AI办公自动化生产力。
69 1
|
22小时前
|
缓存 人工智能 自然语言处理
阿里云Qwen3.8-Flash模型最新介绍:百万级多模态上下文,高并发生产级落地选型指南
本文全面拆解阿里云Qwen3.8-Flash多模态大模型:其依托MOE架构实现旗舰级能力与低时延平衡,搭载百万级上下文窗口,覆盖编程辅助、智能体搭建、多模态解析全场景,兼容OpenAI与Anthropic双协议。内容同步梳理多地域部署合规方案、缓存半价等极致优惠定价,附多语言可复用API示例,是开发者与企业高并发AI落地的高性价比选型指南。