Ollama零基础完整实战:本地离线部署开源大模型,全平台安装、API调用与排坑全指南

简介: 随着大模型技术普及,很多开发者、科研人员、普通爱好者开始关注本地私有化大模型。云端接口虽然使用便捷,但会产生持续调用费用,业务数据需要外传,存在隐私泄露风险。Ollama作为一款免费开源的本地大模型运行框架,支持Windows、macOS、Linux全操作系统,可以在个人电脑、服务器本地运行各类开源大模型,断网环境依旧可以正常提供AI能力,业务数据完全保留在本机,不需要上传外部服务。当前主流版本为v0.32.x,汇集Qwen、DeepSeek‑R1、Llama、Gemma、Qwen2.5‑VL多模态等海量开源模型,一条终端命令就可以完成模型拉取、启动运行,同时原生兼容OpenAI标准API,各

随着大模型技术普及,很多开发者、科研人员、普通爱好者开始关注本地私有化大模型。云端接口虽然使用便捷,但会产生持续调用费用,业务数据需要外传,存在隐私泄露风险。Ollama作为一款免费开源的本地大模型运行框架,支持Windows、macOS、Linux全操作系统,可以在个人电脑、服务器本地运行各类开源大模型,断网环境依旧可以正常提供AI能力,业务数据完全保留在本机,不需要上传外部服务。当前主流版本为v0.32.x,汇集Qwen、DeepSeek‑R1、Llama、Gemma、Qwen2.5‑VL多模态等海量开源模型,一条终端命令就可以完成模型拉取、启动运行,同时原生兼容OpenAI标准API,各类AI客户端、Agent开发框架几乎不用修改代码,就可以对接本地模型,是本地大模型开发调试的主流工具。

很多新手初次接触Ollama,常常会遇到安装失败、C盘被模型文件占满、硬件内存不足程序闪退、下载模型速度缓慢、无法局域网访问服务、API接口调用不通等各类问题。本文完整讲解Ollama的安装部署、存储路径修改、常用命令集合、热门开源模型选型参考,提供curl、Python完整可运行代码示例,同时讲解局域网开放访问、环境变量配置,梳理大量实操踩坑点,帮助不同硬件配置的用户顺利完成本地大模型落地。
阿里云部署AI Agent:OpenClaw/Hermes Agent全网最简单,只需两步,详情👉访问阿里云OpenClaw/Hermes一键部署专题页面了解。
OpenClaw1.png
OpenClaw2.png
OpenClaw02.png
openClaw3.png
OpenClaw031.png
OpenClaw03.png
OpenClaw04.png
OpenClaw5.png
Openclaw6.png
Token Plan Token 最便宜/支持多模型切换:👉访问订阅阿里云百炼Token Plan AI大模型服务 。支持多模型切换,用于多模态模型灵活调用,实现多模型、多工具、多场景下的额度共享与统一管理,兼顾灵活性、稳定性与安全性,大幅降低企业使用大模型的门槛与成本。
tokenplan1.png
tokenplan1.png
tokenplan2.png
tokenplan3.png
![tokenplan4.png](https://ucc.alicdn.com/pic/

一、Ollama核心优势与硬件基础要求

Ollama的核心特点可以总结为三点:模型生态丰富、完全本地离线运行、标准化API易于集成。
第一,模型库资源丰富,官方模型库收录上千款开源模型,中文、推理、代码、多模态看图类模型齐全,一行命令自动下载启动;
第二,全部计算在本机硬件完成,敏感文档、业务对话数据不会外传,断网状态依旧可以对话推理,适合处理内部机密资料;
第三,兼容OpenAI协议,原有对接云端大模型的业务代码,只需要修改base_url地址,即可切换成本地Ollama服务,降低迁移改造成本。

硬件条件直接决定能够运行多大参数规模的模型,模型参数越大,逻辑推理、长文本理解效果越强,但对内存、显存的消耗会同步升高。

  • 8GB内存电脑:适合运行7B、8B档位量化模型,日常问答、翻译、简单脚本编写;
  • 16GB内存电脑:可以流畅运行8B‑14B模型,处理中等长度文档、代码开发;
  • 32GB及以上内存:可以尝试32B参数规模的高阶模型,复杂推理任务;
  • NVIDIA显卡支持CUDA、Apple Silicon芯片会自动硬件加速,推理速度大幅提升;纯CPU环境同样可以运行,但是生成回复速度会明显变慢。

重要提醒:模型文件磁盘占用大,7B量化版本大约4‑5GB,14B约8‑10GB,32B模型会达到20GB以上,需要磁盘预留充足空间。

二、全平台安装部署实操

Windows系统安装

方式一,图形化安装包,适合绝大多数普通使用者。前往官网下载OllamaSetup.exe安装包,双击运行,跟随指引点击Install完成安装,安装完成后系统托盘会出现小羊驼图标,后台服务自动启动。

方式二,PowerShell管理员模式一键脚本安装,无图形界面服务器环境适用:

irm https://ollama.com/install.ps1 | iex

安装结束打开CMD或者PowerShell,执行下面命令校验版本,输出版本号即为安装成功:

ollama --version

Windows系统默认模型存储路径位于C盘用户目录,电脑C盘空间紧张,建议修改模型存储位置。操作方式:打开设置面板,找到Model location,点击Browse选择D盘或者其他非系统盘文件夹;也可以通过系统环境变量OLLAMA_MODELS配置路径。修改完成之后,完全退出托盘Ollama程序,重新启动服务配置生效。

macOS系统安装

macOS支持dmg图形包安装,也可以终端一键脚本:

curl -fsSL https://ollama.com/install.sh | sh

安装完成终端校验版本:

ollama --version

Linux(Ubuntu/Debian)服务器环境安装

服务器无桌面环境,直接执行官方一键脚本:

curl -fsSL https://ollama.com/install.sh | sh

服务会自动注册systemd服务,开机自动后台运行。查看服务状态:

systemctl status ollama

三、核心环境变量配置实操

Ollama依靠环境变量实现自定义行为,几个高频使用的环境变量:

  1. OLLAMA_MODELS:模型文件存储目录,解决C盘空间爆满;
  2. OLLAMA_HOST:绑定服务监听地址,设置0.0.0.0:11434开启局域网其他设备访问;
  3. OLLAMA_ORIGINS:配置跨域访问来源;
  4. OLLAMA_KEEP_ALIVE:设置模型在内存中保持驻留的时长。

Linux服务器开启局域网访问,编辑systemd服务单元:

sudo vim /etc/systemd/system/ollama.service

在[Service]段落添加环境变量:

Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=*"

重载配置并且重启服务:

sudo systemctl daemon‑reload
sudo systemctl restart ollama

macOS zsh终端永久配置示例:

echo 'export OLLAMA_MODELS=/Volumes/data/ollama/models' >> ~/.zshrc
echo 'export OLLAMA_HOST=0.0.0.0:11434' >> ~/.zshrc
source ~/.zshrc

Windows系统,打开高级系统设置,新建系统环境变量,填写变量名与目标路径,保存之后完全退出Ollama托盘程序重新启动。

四、常用命令集合与模型拉取运行

Ollama整套工具依靠终端命令完成模型管理,核心常用命令清单:

# 自动拉取并且直接运行模型,模型不存在就自动下载
ollama run qwen3:8b

# 仅仅下载模型,不进入交互对话
ollama pull deepseek‑r1:8b

# 列出本机全部已经下载的模型
ollama list

# 查看当前正在内存运行的模型、资源占用
ollama ps

# 停止正在运行的模型,释放内存资源
ollama stop qwen3:8b

# 删除本地模型文件,释放磁盘
ollama rm qwen3:8b

# 查看模型详细参数、Modelfile信息
ollama show qwen3:8b

# 查看工具版本
ollama --version

热门模型选型参考

模型 推荐命令 最低内存 特点说明
qwen3:8b ollama run qwen3:8b 8GB 中文能力优秀,适合新手日常问答、写代码
qwen3:14b ollama run qwen3:14b 16GB 更强综合推理能力,长文档处理
deepseek‑r1:8b ollama run deepseek‑r1:8b 8GB 数学、逻辑推理、代码能力突出
deepseek‑r1:32b ollama run deepseek‑r1:32b 32GB 高阶复杂推理任务
qwen2.5‑vl:7b ollama run qwen2.5‑vl:7b 8GB 多模态,可以识别图片截图内容
gemma3:4b ollama run gemma3:4b 6GB 轻量模型,低配电脑优先选择

选型建议:新手优先从8B档位模型入手,硬件跑起来卡顿、内存溢出,就切换更小参数版本,不要直接上超大模型。执行ollama run 模型名,首次执行会自动下载模型文件,下载完成进入交互式对话终端,直接输入提问内容即可和本地AI对话,输入/bye退出交互会话。

五、API接口调用实操(curl + Python)

Ollama默认本地服务地址http://localhost:11434,同时提供两套接口:原生api接口,以及OpenAI兼容/v1接口,原有云端业务代码只需要修改base‑url就可以切换本地模型。

curl直接调用OpenAI兼容接口示例:

curl -X POST http://localhost:11434/v1/chat/completions \
‑H "Content‑Type: application/json" \
‑d '{
"model":"qwen3:8b",
"messages":[
{"role":"system","content":"你是专业开发助手,回答简洁清晰。"},
{"role":"user","content":"写一段shell脚本实现日志定期清理"}
],
"max_tokens":1024
}'

Python使用openai库对接本地Ollama服务,不需要真实API‑Key,字段填任意字符串占位:

# pip install openai
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama" # 参数占位,不会做鉴权校验,不能为空字符串
)

def local_chat(prompt:str,model:str="qwen3:8b"):
    resp = client.chat.completions.create(
        model=model,
        messages=[
            {
   "role":"system","content":"你是本地运行的大模型助手。"},
            {
   "role":"user","content":prompt}
        ],
        temperature=0.4,
        max_tokens=2048
    )
    return resp.choices[0].message.content

if __name__ == "__main__":
    output = local_chat("解释Agent智能体的基础概念")
    print(output)

使用原生ollama官方Python库调用:

pip install ollama
import ollama

resp = ollama.chat(
    model="qwen3:8b",
    messages=[{
   "role":"user","content":"给出快速排序Python实现代码"}]
)
print(resp["message"]["content"])

简单shell脚本封装调用,适合自动化脚本场景:

#!/bin/bash
API_URL="http://localhost:11434/api/chat"
prompt="简单介绍Ollama本地大模型框架"

curl -s ${API_URL} \
‑H "Content‑Type:application/json" \
‑d "{
\"model\":\"qwen3:8b\",
\"messages\":[{\"role\":\"user\",\"content\":\"${prompt}\"}],
\"stream\":false
}"

六、典型业务适用场景与能力边界

✅适合的场景:

  1. 本地隐私处理文档,企业内部资料、涉密文档,数据不上传到外网;
  2. 开发调试AI应用、Agent框架,不用消耗云端Token额度;
  3. 离线内网环境,没有互联网的工作站、内网服务器使用AI能力;
  4. 学习研究开源大模型,自定义模型微调、测试不同量化版本效果;
  5. 个人日常问答、写脚本、翻译、简单文档总结。

❌不适合的场景:

  1. 超高并发公网线上生产业务,硬件资源有限,并发能力弱;
  2. 想要达到顶尖商用闭源模型效果,同等参数开源模型能力存在差距;
  3. 硬件配置过低,强行运行超大参数模型,会出现卡顿、内存溢出闪退。

客观认知能力边界:7B‑8B本地模型擅长日常任务,超长文档、复杂数学推演、深度工程任务效果有限,需要合理预期输出质量。

七、高频问题排查与避坑总结

  1. 模型下载缓慢、中断失败
    优先检查网络;可以更换镜像源环境变量;大模型下载中途中断,重新执行ollama pull命令会断点续传,不需要全部重新下载。磁盘剩余空间一定要大于模型文件大小。

  2. 运行模型电脑卡顿、程序闪退、内存溢出OOM
    内存不足以支撑当前模型,降低模型参数档位;关闭电脑后台大量占用内存的软件;NVIDIA显卡确认CUDA驱动正常,开启硬件加速。

  3. C盘空间被占满
    修改OLLAMA_MODELS环境变量,把模型存储迁移到其他大容量磁盘;已经下载完成的模型,需要手动迁移文件夹文件,再重启Ollama服务。

  4. 局域网其他设备无法访问本机Ollama服务
    确认环境变量OLLAMA_HOST=0.0.0.0:11434;本机防火墙放行11434端口;Linux服务器检查firewalld、iptables防火墙策略。

  5. OpenAI兼容接口调用报错
    确认ollama后台服务正常运行;base_url地址填写正确;api_key参数不能为空字符串,可以随便填写占位字符。

  6. 升级版本注意事项
    Windows/macOS直接重新安装新版本;Linux执行安装脚本会自动升级;升级完成执行ollama --version确认版本。已经下载的模型文件不会被删除。

  7. 多模态图片模型使用注意
    qwen2.5‑vl等看图模型,对内存显存要求更高,图片尺寸过大会加剧硬件消耗,输入图片建议做适当压缩。

总结

Ollama降低了本地运行开源大模型的门槛,普通个人电脑就可以离线运行Qwen、DeepSeek‑R1、Llama等主流开源模型,数据保存在本地,保障隐私安全。整套工具由图形界面、终端命令、REST API三部分组成,支持Windows、macOS、Linux三大平台。

部署核心流程:安装软件→修改模型存储路径避免系统盘爆满→根据自己电脑内存显存硬件选择合适大小的模型,使用ollama pull/ollama run命令下载运行;开发业务可以直接使用OpenAI兼容接口,少量修改代码就把云端业务迁移到本地离线环境。

本地大模型并不是越大参数就越好,硬件配置决定模型上限,低配设备优先选择7B、8B轻量化版本。同时要客观看待本地模型的能力边界,普通日常任务可以胜任,超复杂推理任务效果对比顶尖闭源云端模型依旧存在差距。

开发者在实操的时候,善用环境变量完成存储路径、局域网访问配置,遇到闪退、下载失败优先从硬件资源、磁盘空间、防火墙、网络几个维度排查。不管是个人学习、内网项目开发、隐私文档处理,Ollama都是一套值得掌握的本地大模型部署工具。

目录
相关文章
|
20小时前
|
人工智能 缓存 前端开发
开源AI编程新标杆:DeepSeek Harness安装、模式详解、插件开发全流程
在Agent技术高速演进的当下,只拥有强大推理能力的大模型并不足以完成真实世界复杂任务。模型负责思考生成,但想要让AI真正读写本地文件、执行终端命令、调试项目代码、完成多步骤长链路工程任务,还需要一套完整的运行调度环境,这就是Harness的价值所在。随着DeepSeek V4‑Pro正式版发布,配套的DeepSeek Harness同步对外开源,基于MIT开源协议对外放出开发者预览版,发布短短一天就在代码托管平台收获海量Star,成为AI开发者圈子热议的工具。DeepSeek Harness不只是一款AI编程助手,更是一套高度可重组、插件优先的Agent运行底座,官方核心理念概括为**Age
34 0
|
Kubernetes NoSQL Redis
Kubernetes 入门教程
本文是一篇 kubernetes(下文用 k8s 代替)的入门文章,将会涉及 k8s 的架构、集群搭建、一个 Redis 的例子,以及如何使用 operator-sdk 开发 operator 的教程。在文章过程中,会穿插引出 Pod、Deployment、StatefulSet 等 k8s 的概念,这些概念通过例子引出来,更容易理解和实践。
Kubernetes 入门教程
|
2月前
|
人工智能 NoSQL 关系型数据库
见证|从 Redis 到 Valkey:开源社区的延续与新生
Valkey 的定位很清晰:不做大而全的万能数据库,而是专注于做 AI 基础设施中那个速度最快、离应用最近的数据层。
|
2月前
|
网络协议 API 数据安全/隐私保护
阿里云百炼API Key创建及获取方法,API调用先创建API Key
阿里云百炼API Key是调用大模型服务的鉴权凭证。需先开通百炼服务,登录控制台→选择地域(推荐北京)→进入API Key管理页→创建密钥(归属默认空间,权限选“全部”或自定义IP/模型限制)→立即复制保存(仅显示一次)。注意:按量付费Key以`sk-`开头,Token/Coding Plan则为`sk-sp-`开头。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
672 2
|
9月前
|
运维 监控 安全
拆解大厂标准测试流程:从需求到上线的全链路质量守护指南
大厂标准测试流程的核心是“全链路质量管控”,从需求阶段开始,通过标准化的流程、规范化的文档、高效的工具链,确保产品质量在每个环节都得到有效保障。其底层逻辑是“预防为主、早期发现、快速闭环”,通过单元测试、接口测试等早期测试手段,减少后期缺陷修复成本;通过严格的缺陷管理和回归测试,确保缺陷闭环且不引入新问题;通过上线前的多轮验证和上线后的实时监控,降低上线风险。
1193 2
|
2月前
|
人工智能 Ubuntu API
Ollama的安装和升级使用实践
Ollama 是一款开源本地LLM运行框架,让在Ubuntu等系统上一键部署、下载(支持国内镜像)和运行大模型(如DeepSeek-R1)变得简单。支持命令行交互、端口配置、服务管理,并可对接Open WebUI与OpenClaw。
766 0
Ollama的安装和升级使用实践
|
5天前
|
人工智能 Linux iOS开发
Ollama 保姆级实操教程:2026最新版本Windows/macOS/Linux本地离线部署开源大模型完整指南
随着开源大模型生态快速发展,越来越多开发者、AI爱好者不再单纯依赖线上AI接口,更倾向于在本地设备运行大模型,实现数据完全本地留存,保护业务与个人隐私。Ollama作为当下主流免费开源本地大模型运行工具,能够在Windows、macOS、Linux操作系统之上离线运行Qwen、DeepSeek、Llama、Mistral等各类主流开源模型,全程数据不会向外传输,断网环境依旧可以正常对话交互,同时提供兼容OpenAI标准的API接口,便于第三方开发工具、Agent程序接入调用本地大模型能力。2026年Ollama迭代到v0.32.x版本,三端同步更新,优化显卡推理加速、内存调度逻辑,降低普通电脑
185 0
|
1月前
|
数据可视化 PyTorch 算法框架/工具
ComfyUI电脑版EXE文件下载、安装、配置、使用全流程图解,点击可直接运行
ComfyUI是Stable Diffusion最流行的可视化工作流工具,以节点连线方式精准控制文生图、图生图、ControlNet等全流程。官方推出免命令行的Comfy Desktop桌面版,内置环境,一键安装启动,新手也能快速上手。(239字)
|
前端开发 JavaScript 编译器
聊聊那个逐渐淡出大家视野的 React 替代品:Preact
聊聊那个逐渐淡出大家视野的 React 替代品:Preact
1754 0
|
13天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)

热门文章

最新文章