别再给 API 打工:我用 Dify + Ollama + DeepSeek 搭了一套「本地优先、云端兜底」的私有 AI 平台

简介: 15 个 Docker 容器跑起来的私有 AI 平台:本地 Ollama 零成本处理日常任务,DeepSeek API 只兜复杂推理的底,Dify 做编排大脑,双层记忆让 AI 记得住上下文也翻得动历史资料。本文复盘整套架构的分流设计、记忆方案与部署踩坑实录。

15 个 Docker 容器,双层记忆,本地零成本跑日常任务,云端 API 只兜复杂推理的底。这套架构我实际跑了一段时间,把踩过的坑和取舍一次讲清。

一、为什么自建,而不是直接用 SaaS?

市面上的 AI 助手很好用,但当你把简历、求职材料、个人项目数据反复喂给它的时候,三个问题就暴露了:

  • 隐私:敏感个人信息上传到第三方服务器,心里始终不踏实;
  • 成本:日常问答、文本整理这类简单任务,用云端大模型属于「高射炮打蚊子」,token 费纯属浪费;
  • 可控:SaaS 说改版就改版、说限流就限流,自己的平台自己说了算。

但纯本地也有硬伤:小模型跑复杂推理(比如长文分析、多步规划)能力明显不够。所以我的答案是——不二选一,两条通道都要。

二、总体架构:一张图看懂

燎原火 AI 平台分层架构图

整个平台分四层:

  1. 用户入口层:统一的对话界面,用户只管提问,不感知后端用了哪个模型;
  2. Dify 编排层:整个平台的「大脑」,负责工作流编排、Prompt 管理、模型路由,全部容器化部署;
  3. 双通道执行层:本地通道(Ollama)+ 云端通道(DeepSeek API),按任务复杂度自动分流;
  4. 双层记忆层:对话短期记忆 + 向量检索长期记忆,让 AI 记得住上下文、也翻得动历史资料。

三、双通道设计:本地优先,云端兜底

这是整套架构里最核心的一个决策。分流逻辑如下:

维度 本地通道 · Ollama 云端通道 · DeepSeek API
成本 电费,约等于零 按 token 计费
隐私 数据不出本机 出网到第三方
延迟 无网络往返,首 token 快 受网络波动影响
能力上限 小模型,复杂推理吃力 强推理,长文本稳
适合任务 日常问答 / 文本整理 / 格式化 深度分析 / 多步规划 / 代码生成

分流原则一句话:简单任务本地跑满,复杂任务才交给云端。 这样一来,90% 的日常请求成本归零,API 费只花在刀刃上。

四、双层记忆:短期会话 + 长期向量

只用聊天记录做上下文,AI 是「金鱼记忆」;只做向量检索,AI 又「失忆」于当前对话。所以做了双层:

  • 第一层 · 对话短期记忆:当前会话的滚动窗口,保证多轮对话连贯;
  • 第二层 · 向量长期记忆:历史资料、往期对话切片后向量化,检索时按语义相关性召回。

两层叠加的效果是:AI 既知道「我们刚才聊到哪」,也知道「你上周让我准备过什么」。

五、部署踩坑实录(都是真实坑)

坑 1:Ollama 模型用完即卸载

本地模型默认推理完就释放显存/内存,下一轮对话要重新加载,延迟暴涨。解法是设置 OLLAMA_KEEP_ALIVE 让模型常驻,代价是常驻内存占用——我按机器配置做了权衡。

坑 2:输出长度被截断

num_predict 参数没调,长回答总是半途而废。这个参数控制最大生成 token 数,默认值偏保守,做长文任务必须显式调大。

坑 3:Docker 容器编排

Dify 全家桶 + Ollama + 向量库 + 中间件,最终跑起来 15 个容器。一开始没理清依赖关系,容器启动顺序错乱导致服务起不来,后来靠 depends_on + 健康检查理顺。

六、写在最后

这套平台的真正价值不在技术多炫,而在于想清楚了一个平衡:

隐私、成本、能力,三者不必全选,分层即可兼得。

如果这篇文章对你有帮助,点赞收藏是最大的支持。有问题欢迎评论区交流。

相关文章
|
7天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
6950 9
|
5天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1400 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
6天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
869 5
|
19天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3440 10
|
14天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1515 1
|
18天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1898 9
Qoder 上线 Sonus 模型,Computer Use 能力全面增强

热门文章

最新文章