Ollama完成本地模型的运行

本文涉及的产品
容器镜像服务 ACR,镜像仓库100个 不限时长
应用实时监控服务-可观测链路OpenTelemetry版,每月50GB免费额度
MSE Nacos/ZooKeeper 企业版试用,1600元额度,限量50份
简介: # Ollama完成本地模型的运行

Ollama完成本地模型的运行

简介

Ollama 是一个开源的大型语言模型(LLM)服务工具,它允许用户在本地运行和使用各种大型语言模型。Ollama 提供了一个命令行界面,支持多种流行的模型,如 Llama 3、Qwen 1.5、Mixtral、Gemma 等,并且用户可以根据自己的需求定制和创建模型。Ollama能够实现模型的本地运行,降低了模型开发的复杂度,无聊时AI开发的高手还是新人都可以快速使用Ollama完成模型本地运行。同时可以识别Nvidia、AMD的GPU,AVX、AVX2指令集的CPU。同时Ollama也支持MacOS、Windows,Linux主要的操作系统。

安装

进入Ollama官网,下载对应的Ollama客户端后安装即可。

安装完成后,打开powershell,输入ollama有help的内容输出就是安装成功了。

本地运行模型

这里有一个小技巧:Ollama默认大模型的目录在C盘当前用户目录下.ollama
目录下,非常占地方,所以我们要修改环境变量OLLAMA_MODELS为一个想存大模型的地方。

运行ollama命令完成模型下载和运行

ollama run llama3:8b

Ollama都支持什么模型

进入ollama官网的Models目录,可以看到所有的模型,点击任意一个模型(以llama3 为例),点击后可以看到支持的模型的介绍,以及通过Ollama运行的方法。

Ollama 在局域网内部署访问

Ollama的一些配置是通过环境变量控制的,那么无论是什么操作系统,都可以通过配置系统的环境变量或者通过设置临时的环境变量达到想要的结果,一些常用的环境变量如下:

  • OLLAMA_HOST:用来绑定OLLAMA的访问的IP和端口,这个其实很重要,用一些 Langchain、LLamaIndex等调用Ollama部署的模型的时候,都是通过这个配置的内容访问的。默认值“127.0.0.1:11434”,如果我们配置成“0.0.0.0:11434”,就可以让你局域网内的其他主机可以访问,但是要配合下面的环境变量一起使用。
  • OLLAMA_ORIGINS:这个是跨域源列表,说白了就是允许谁来访问,双引号中用英文都好分割。默认进本地可以访问,如果想让局域网内都可以访问,最好设置成“*”。
  • OLLAMA_MODELS:本地模型文件存储的位置,这个就按自己实际的模型位置设置,默认是存在当前用户目录下的.ollama/models或者/usr/share/ollama/.ollama/models
  • OLLAMA_KEEP_ALIVE:模型在现存中保持加载的持续时长,这个默认“5m”,按需加载或者释放显卡显存可以降低显卡的压力,但是会带来磁盘IO的增加。
  • OLLAMA_DEBUG:调试日志,默认是关闭的。如果设置成1,就是开始,会看到很多调试日志。

Windows的设置

Windows的环境变量的设置(windows10为例):
选择我的电脑点击右键,选择属性后点击高级系统设置就可以看到环境变量的按钮了,点击进入后可以看到有上下两部分,上面是用户变量,下面是系统变量。

  • 用户变量:设置的改环境变量仅仅在当前用户登录才生效。
  • 系统变量:任何用户登录该操作系统都生效。

img_v3_02ad_45b9bb99-bca6-4c55-909d-e3836c52bc9g

完成设置后需要重启或者按照如下方法操作才能让环境变量生效。

在任何一个命令窗口(cmd.exe)中输入set PATH=C,然后关闭全部的命令窗口,再打开一个命令窗口重新启动Ollama就好了。

MacOS的设置

在MacOS可以通过launchctl设置环境变量,这个和Linux就很相似。launchctl 是一个在 macOS 系统中用于管理后台进程(也称为守护进程或服务)的命令行工具。它是 launchd 系统的一部分,launchd 是 macOS 的初始化系统和服务管理守护进程。使用 launchctl,用户和系统管理员可以加载、卸载、启动、停止和调试守护进程。launchctl常用命令如下:

加载一个守护进程:launchctl load [plist文件]
卸载一个守护进程:launchctl unload [plist文件]
启动一个守护进程:launchctl start [标签名]
停止一个守护进程:launchctl stop [标签名]
列出所有加载的守护进程:launchctl list
设置环境变量:launchctl setenv [环境变量]

那么,设置Ollama的环境变量如下:

launchctl setenv OLLAMA_HOST="0.0.0.0:11434"
launchctl setenv OLLAMA_ORIGINS="*"
launchctl setenv OLLAMA_MODELS="/models/"

完成如上设置后,需要重启Ollama,才能生效。

Linux的设置

Linux上我们需要讲Ollama配置到 systemd 服务运行,这样方便后续的使用。如果Linux可以链接互联网,那么运行如下命令。

curl -fsSL https://ollama.com/install.sh | sh

否则,我们需要手工下载Ollama,地址:https://ollama.com/download/ollama-linux-amd64,然后将下载的ollama复制到/usr/bin/位置,重命名为ollama,并修改一下全县sudo chmod +x /usr/bin/ollama

然后修改一下service文件,在其中加上环境变量。

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=*"
Environment="OLLAMA_MODEL=/home/syadmin/models/"

[Install]
WantedBy=default.target

然后通过systemctl deamon reload重新载入配置,再通过systemctl start ollama启动服务。

Ollama 常用命令

  • serve:启动ollama服务
  • create:从Modelfile中创建一个model(ollama create 模型名字 -f modelfile名字)
  • show:显示Model的信息
  • run:运行一个model,如果本地没有那么回去Ollama的中央仓库下载
  • pull:从中央仓库下载一个model
  • push:讲一个本地model推到中央仓库
  • list:显示本地模型列表,表头包含了模型名字(就是create命令中的模型名字,ID,大小和修改时间)
  • cp:本地复制一个Model
  • rm:删除一个本地Model
  • help:帮助

但是如果我们修改了启动端口,也就是我们设置了OLLAMA_HOST这个参数,那么我们直接运行Ollama的命令并不能生效,而是需要在前面加上OLLAMA_HOST的内容,具体如下:

OLLAMA_HOST=0.0.0.0:9000 olllama list

其他常用命令一样处理。

Ollama的模型导入

我们平时面对的场景中,服务器往往并不能链接互联网,因此我们就不能用上面介绍的Ollama的命令一样,运行命令直接获从Ollama中央仓库下载一个模型,Ollama为我们提供了一个导入模型的办法。最为直接的是导入量化后的模型,也就是GGUF格式。GGUF(GGML Universal File Format)是一种用于量化大语言模型(LLM)的格式,它允许模型在不同的硬件配置上运行,包括CPU和GPU。GGUF量化意味着将模型的权重和激活数据转换成一种更紧凑的表示形式,这样可以减少模型的内存占用和提高运行效率,这也叫量化模型。GGUF支持多种量化级别,包括FP16(16位浮点数)、int4(4位整数)等,通过量化可以减少模型的大小,使其更适合在资源受限的环境中运行。GGUF格式的设计旨在快速加载和保存模型,同时保持模型性能,它允许用户根据硬件条件选择不同的量化级别,以平衡模型的精度和效率。在很多下载模型的网站上可以下载到量化以后的模型,都是以.gguf作为扩展名。一般量化模型都会在名字后面加上一些量化选项的内容,例如我们有时候会看到q3_k.gguf的写法,这意味着权重或激活值将被量化为三位精度,即具有8个可能的取值(2^3 = 8)。

在Ollama中我们只要下载需要的.gguf文件,然后创建一个Modelfile文件,文件写入如下内容:

FROM ./Meta-Llama-3-8B.q4_0.gguf

然后运行如下命令就可以完成模型的导入了。

ollama create llama3:8b -f Modelfile

成功完成后,就可以使用该模型了。那么如果有些模型没有量化的模型的话,就需要自己动手了,这个主要是借助llama.cpp完成的,具体操作就不做详细说明了,需要的时候,在网上学习吧。

目录
相关文章
|
自然语言处理
Ollama部署本地模型
Ollama 是一个用于本地部署大型语言模型的平台。首先关闭 ollama 服务,在环境变量中设置 `OLLAMA_MODELS` 为目标模型路径,`OLLAMA_ORIGINS` 为 `"*"`,重启服务和 VSCode。启动服务 `ollama serve`,运行 `ollama run codegeex4`。配置插件接口地址为 `http://localhost:11434/v1/chat/completions`,并在模型名称处填入 `codegeex4` 启用高级模式。可能需优化下载速度并解决其他问题。
1236 4
|
8月前
|
机器学习/深度学习 自然语言处理
Deepseek开源R1系列模型,纯RL助力推理能力大跃升!
近期Deepseek正式发布 DeepSeek-R1,并同步开源模型权重。DeepSeek-R1 遵循 MIT License,允许用户通过蒸馏技术借助 R1 训练其他模型。
2675 25
|
7月前
|
人工智能 搜索推荐 Docker
手把手教你使用 Ollama 和 LobeChat 快速本地部署 DeepSeek R1 模型,创建个性化 AI 助手
DeepSeek R1 + LobeChat + Ollama:快速本地部署模型,创建个性化 AI 助手
5202 119
手把手教你使用 Ollama 和 LobeChat 快速本地部署 DeepSeek R1 模型,创建个性化 AI 助手
|
10月前
|
开发者 异构计算
现在,一行命令使用Ollama运行任意魔搭GGUF模型
为了让开发者更方便地把这些模型用起来,社区最近支持了Ollama框架和ModelScope平台的链接,通过简单的 ollama run命令,就能直接加载运行ModelScope模型库上的GGUF模型。
|
8月前
|
Linux iOS开发 MacOS
deepseek部署的详细步骤和方法,基于Ollama获取顶级推理能力!
DeepSeek基于Ollama部署教程,助你免费获取顶级推理能力。首先访问ollama.com下载并安装适用于macOS、Linux或Windows的Ollama版本。运行Ollama后,在官网搜索“deepseek”,选择适合你电脑配置的模型大小(如1.5b、7b等)。通过终端命令(如ollama run deepseek-r1:1.5b)启动模型,等待下载完成即可开始使用。退出模型时输入/bye。详细步骤如下图所示,轻松打造你的最强大脑。
14260 86
|
10月前
|
人工智能 C++ iOS开发
ollama + qwen2.5-coder + VS Code + Continue 实现本地AI 辅助写代码
本文介绍在Apple M4 MacOS环境下搭建Ollama和qwen2.5-coder模型的过程。首先通过官网或Brew安装Ollama,然后下载qwen2.5-coder模型,可通过终端命令`ollama run qwen2.5-coder`启动模型进行测试。最后,在VS Code中安装Continue插件,并配置qwen2.5-coder模型用于代码开发辅助。
17659 7
|
11月前
|
人工智能 并行计算 搜索推荐
ollama本地部署llama3(window系统)
这篇文章详细介绍了如何在Windows系统上本地部署Ollama框架来运行Llama 3大模型,并提供了具体的安装步骤和注意事项,以便实现离线使用高级AI模型进行对话。
953 0
ollama本地部署llama3(window系统)
|
8月前
|
程序员 API 开发者
实战阿里qwen2.5-coder 32B,如何配置Cline的Ollama API接口。
阿里Qwen2.5大模型开源免费,适合编程应用。在Ollama平台下载时,推荐选择带有“cline”字样的Qwen2.5-Coder版本,仅需额外下载适配文件,无需重复下载模型文件。Ollama环境永久免费,配置简单,效果出色,适合开发者使用。
4963 77
|
8月前
|
Linux Docker 异构计算
基于Dify +Ollama+ Qwen2 完成本地 LLM 大模型应用实战
尼恩,一位拥有40年经验的老架构师,通过其丰富的行业经验和深入的技术研究,为读者提供了一套系统化、全面化的LLM大模型学习圣经。这套学习资料不仅帮助许多从业者成功转型,还助力多位工程师获得了高薪工作机会。
|
7月前
|
机器学习/深度学习 监控 Linux
ollama+openwebui本地部署deepseek 7b
Ollama是一个开源平台,用于本地部署和管理大型语言模型(LLMs),简化了模型的训练、部署与监控过程,并支持多种机器学习框架。用户可以通过简单的命令行操作完成模型的安装与运行,如下载指定模型并启动交互式会话。对于环境配置,Ollama提供了灵活的环境变量设置,以适应不同的服务器需求。结合Open WebUI,一个自托管且功能丰富的Web界面,用户可以更便捷地管理和使用这些大模型,即使在完全离线的环境中也能顺利操作。此外,通过配置特定环境变量,解决了国内访问限制的问题,例如使用镜像站来替代无法直接访问的服务。
1836 9