别再给 API 打工:我用 Dify + Ollama + DeepSeek 搭了一套「本地优先、云端兜底」的私有 AI 平台

简介: 15 个 Docker 容器跑起来的私有 AI 平台:本地 Ollama 零成本处理日常任务,DeepSeek API 只兜复杂推理的底,Dify 做编排大脑,双层记忆让 AI 记得住上下文也翻得动历史资料。本文复盘整套架构的分流设计、记忆方案与部署踩坑实录。

15 个 Docker 容器,双层记忆,本地零成本跑日常任务,云端 API 只兜复杂推理的底。这套架构我实际跑了一段时间,把踩过的坑和取舍一次讲清。

一、为什么自建,而不是直接用 SaaS?

市面上的 AI 助手很好用,但当你把简历、求职材料、个人项目数据反复喂给它的时候,三个问题就暴露了:

  • 隐私:敏感个人信息上传到第三方服务器,心里始终不踏实;
  • 成本:日常问答、文本整理这类简单任务,用云端大模型属于「高射炮打蚊子」,token 费纯属浪费;
  • 可控:SaaS 说改版就改版、说限流就限流,自己的平台自己说了算。

但纯本地也有硬伤:小模型跑复杂推理(比如长文分析、多步规划)能力明显不够。所以我的答案是——不二选一,两条通道都要。

二、总体架构:一张图看懂

燎原火 AI 平台分层架构图

整个平台分四层:

  1. 用户入口层:统一的对话界面,用户只管提问,不感知后端用了哪个模型;
  2. Dify 编排层:整个平台的「大脑」,负责工作流编排、Prompt 管理、模型路由,全部容器化部署;
  3. 双通道执行层:本地通道(Ollama)+ 云端通道(DeepSeek API),按任务复杂度自动分流;
  4. 双层记忆层:对话短期记忆 + 向量检索长期记忆,让 AI 记得住上下文、也翻得动历史资料。

三、双通道设计:本地优先,云端兜底

这是整套架构里最核心的一个决策。分流逻辑如下:

维度 本地通道 · Ollama 云端通道 · DeepSeek API
成本 电费,约等于零 按 token 计费
隐私 数据不出本机 出网到第三方
延迟 无网络往返,首 token 快 受网络波动影响
能力上限 小模型,复杂推理吃力 强推理,长文本稳
适合任务 日常问答 / 文本整理 / 格式化 深度分析 / 多步规划 / 代码生成

分流原则一句话:简单任务本地跑满,复杂任务才交给云端。 这样一来,90% 的日常请求成本归零,API 费只花在刀刃上。

四、双层记忆:短期会话 + 长期向量

只用聊天记录做上下文,AI 是「金鱼记忆」;只做向量检索,AI 又「失忆」于当前对话。所以做了双层:

  • 第一层 · 对话短期记忆:当前会话的滚动窗口,保证多轮对话连贯;
  • 第二层 · 向量长期记忆:历史资料、往期对话切片后向量化,检索时按语义相关性召回。

两层叠加的效果是:AI 既知道「我们刚才聊到哪」,也知道「你上周让我准备过什么」。

五、部署踩坑实录(都是真实坑)

坑 1:Ollama 模型用完即卸载

本地模型默认推理完就释放显存/内存,下一轮对话要重新加载,延迟暴涨。解法是设置 OLLAMA_KEEP_ALIVE 让模型常驻,代价是常驻内存占用——我按机器配置做了权衡。

坑 2:输出长度被截断

num_predict 参数没调,长回答总是半途而废。这个参数控制最大生成 token 数,默认值偏保守,做长文任务必须显式调大。

坑 3:Docker 容器编排

Dify 全家桶 + Ollama + 向量库 + 中间件,最终跑起来 15 个容器。一开始没理清依赖关系,容器启动顺序错乱导致服务起不来,后来靠 depends_on + 健康检查理顺。

六、写在最后

这套平台的真正价值不在技术多炫,而在于想清楚了一个平衡:

隐私、成本、能力,三者不必全选,分层即可兼得。

如果这篇文章对你有帮助,点赞收藏是最大的支持。有问题欢迎评论区交流。

相关文章
|
25天前
|
人工智能 安全 测试技术
DeepSeek Harness首发实测保姆级教程:一切皆插件的开源Agent运行环境完整实操解析
在AI智能体快速迭代的当下,很多开发者都有这样的体验:调用大模型API只能完成对话,想要让AI真正操作本地文件、执行终端命令、完成完整项目重构、自动跑单元测试,仅仅依靠模型本身远远不够。大模型只负责思考输出内容,但读写磁盘、调用终端、管理会话上下文、任务拆解、结果校验、安全沙箱管控,这一系列外部执行能力,都需要一套配套运行底座来承接。行业内提出了Harness工程的概念,有一个经典公式 **Agent = Model + Harness**,模型负责思考推理,Harness负责构建运行环境,串联工具、流程、安全护栏,让大模型可以在真实计算机环境中完成完整任务。
316 1
|
1月前
|
人工智能 定位技术 API
高德汽车业务 AI Native 工程实践|基于 Qoder 的业务知识工程建设实践
高德企业业务通过 Qoder 知识引擎构建业务知识的"生产—调优—更新—消费"体系,同一类错误不再发生第二次,任务一次性通过率从 37.3% 提升至 61.5%。
365 0
高德汽车业务 AI Native 工程实践|基于 Qoder 的业务知识工程建设实践
|
2月前
|
缓存 Prometheus 监控
大模型API调用成本控制:Token估算、缓存策略与模型选择实践
本文介绍面向高频查询(日数百次)的大模型成本控制方案,涵盖Token估算、Redis缓存、多模型分级选型(Turbo/Plus/Max)及Prometheus费用监控告警。基于阿里云百炼与DashScope实现,需Python基础及API Key
443 2
|
7月前
|
JSON 安全 API
Flask 入门指南
Flask是轻量级Python Web微框架,核心仅提供路由与模板功能,按需通过扩展集成数据库、认证等模块。学习曲线平缓、结构简洁、扩展灵活,适合从API、博客到企业应用的全阶段开发,是入门Web开发与构建定制化技术栈的理想起点。(239字)
|
2月前
|
Java 应用服务中间件 数据库连接
Spring Boot这5个配置项默认值就是错的,高并发第1天就502
Spring Boot上线前5项关键配置必查:Tomcat线程数(建议≥500)、HikariCP连接池(单实例≤30)、Actuator端点最小暴露(禁用env/heapdump)、生产日志分级(业务INFO+第三方WARN)、强制激活prod profile。缺一即可能导致502、超时或安全风险。
|
5月前
|
弹性计算 监控 负载均衡
技术实践:使用阿里云ECS部署高可用Web应用架构
本文为阿里云云大使撰写的实战指南,详解如何用阿里云ECS搭建高可用电商应用:涵盖架构设计、环境部署、负载均衡、成本优化(月省27%)及故障处理。含完整脚本与性能数据,助力开发者高效上云。新用户通过链接享专属优惠👉https://www.aliyun.com/benefit?userCode=iakscw7s
656 13
|
5月前
|
SQL 存储 关系型数据库
MySQL 生产级备份与恢复全攻略:全量 / 增量 / 逻辑 / 物理备份深度拆解 + 误删数据秒级恢复实战
本文系统讲解MySQL备份与恢复体系,涵盖全量/增量、逻辑/物理备份的底层原理与核心差异;详解mysqldump、mydumper、XtraBackup等工具的生产级实战;提供误删数据的多场景快速恢复方案(闪回、延迟从库、回收站);并附Java备份管理模块完整实现。
733 2
|
6月前
|
SQL 人工智能 BI
从 SQL 到 OSI:当“数据是什么意思”也有了标准答案
当企业开始将“指标定义”视为与“财务制度”同等重要的治理资产,当语义描述变成一种可交换、可审计、可版本管理的协议——我们就真正站在了智能决策的新起点上。 从 SQL 到 OSI,间隔了四十年。SQL 让机器听懂了人类的查询指令,OSI 要让机器理解人类的业务语言。 这一步,比上一步更难,也更值得。
|
8月前
|
弹性计算 人工智能 安全
阿里云服务器:ECS介绍、费用价格、功能优势及使用全解析,2026有问必答FAQ
阿里云ECS是国产份额第一的弹性云服务器,安全可靠、弹性伸缩、按需付费。2026年推经济型e实例(¥99/年起)、通用u1/u2i等新规格,支持免费试用、新老同享优惠,适配建站、AI、游戏等全场景。
680 1
|
机器学习/深度学习 传感器 物联网
数字孪生技术框架:从数据到决策的桥梁
随着科技的飞速发展,数字孪生技术作为一种创新的信息化手段,正逐步渗透到各个行业领域,成为推动数字化转型的重要力量。数字孪生技术框架,作为支撑这一技术体系的核心架构,以其独特的层级结构,实现了从数据接入到决策控制的全面覆盖,为现实世界与数字世界的深度融合提供了坚实的基础。
1032 5

热门文章

最新文章