一个端点接 290 家 AI 服务商--我拆解了周增 7700 Star 的 OmniRoute

简介: OmniRoute 是一款 MIT 协议的本地 AI 网关(TS 编写),聚合 290+ 服务商、500+ 模型,提供 OpenAI 兼容接口。支持智能 Combo 路由、12 因子 auto 选模、三层弹性容错与 RTK 等 12 种 Token 压缩引擎,显著提升免费额度利用率与稳定性。(239 字)

最近在折腾 AI 编程工具链的时候,我遇到一个很烦的问题:Claude Code 用 Anthropic 的 key,Cursor 用 OpenAI 的 key,Aider 又接的 DeepSeek,每个工具一套配置,免费额度散落在各家手里根本用不顺。

然后我在 GitHub Trending 上看到 OmniRoute--MIT 协议,TypeScript 写的,号称一个端点对接 290+ 服务商、500+ 模型,还自带负载均衡和故障回退。周增 7700 Star,38k+ 总星。

花了一天半把文档和源码结构翻了一遍,这东西确实解决了我遇到的问题,但设计思路比我预期的要深。聊聊我的发现。


一、它到底干了什么事

一句话:把分散的 AI 服务商聚合成一个 OpenAI 兼容的本地端点。

你的编码工具(Claude Code、Cursor、Codex CLI 等)不再需要分别配置不同服务商的 API Key,全部指向 http://localhost:20128/v1 就行。

image.png

其中 90+ 家提供免费层级,40+ 家永久免费。文档里说聚合后大约有 15.3 亿免费 Token/月,仪表盘上实时显示剩余额度。


二、核心设计:Combo 路由系统

这是我最想聊的部分。OmniRoute 不只是个"转发代理",它有一套叫 Combo 的模型链路由机制。

什么是 Combo

Combo 就是一条预配置的模型链。比如你配 Claude -> GPT-4o -> Gemini -> DeepSeek,当 Claude 配额用尽,自动切 GPT-4o;GPT-4o 挂了,切 Gemini--应用层完全无感知

零配置的 auto 模式

如果你懒得配 Combo,直接把 model 设成 auto,OmniRoute 会从你连接的所有服务商里实时构建虚拟链。它有几种预设:

Model ID 干什么
auto 平衡模式,粘滞上次成功的服务商
auto/coding 代码生成质量优先
auto/fast 最低延迟优先
auto/cheap 每 Token 最便宜优先
auto/offline 优先选剩余配额最多的
auto/smart 质量优先 + 10% 探索更好的模型

auto/smart 那个 10% 探索挺有意思--大部分请求走已知最好的模型,但留 10% 去试别的,万一发现更好的就自动切换。

12 因子评分

auto 模式的背后是一个 12 因子评分引擎。我根据文档和路由策略列表推断,这 12 个因子大致覆盖:健康度、剩余配额、成本、延迟、历史成功率、配额重置时间、上下文匹配度、新鲜度等维度。每个候选模型实时打分,选分最高的路由。

19 种路由策略

除了 auto,还有 18 种可以手动组合的策略。我挑几个实用的说:

image.png

实际用的时候,我最常用的是 fill-first(先把免费额度吃干净再切付费的)和 priority(配 fallback 链保高可用)。


三、三层弹性机制:请求不会断

这个设计我觉得是整个架构里最扎实的部分。OmniRoute 有三层独立的弹性保障:

image.png

第一层处理单次请求的临时故障(网络抖动、瞬时 429),第二层处理模型级别的持续故障(配额耗尽、服务商宕机),第三层处理多账号场景下的配额分配。

配额层的 Quota-Share 支持三种策略:

  • hard:超配额直接拒绝,严格但不灵活
  • soft:超了降优先级但不拒绝,平滑过渡
  • burst:允许借用空闲份额,最大化吞吐

我一般用 soft,既不会突然断流,也不会把某个 Key 榨干。


四、Token 压缩:省钱的关键武器

这是 OmniRoute 和其他网关拉开差距的地方。它在请求到达上游模型之前,先过一遍压缩流水线。

12 引擎流水线

不是简单截断,而是 12 个引擎按顺序处理:

实际效果

模式 节省 适用场景
Lite ~15% 永远开启的安全默认
Standard (Caveman) ~30% 日常编码
Aggressive ~50% 长工具密集会话
Ultra ~75% 最大节省
RTK 60-90% Shell/测试/构建输出
RTK + Caveman 叠加 78-95% 混合提示+工具日志

RTK 那个对命令输出的压缩效果最让我印象深刻。你跑个 npm install 出来几百行日志,RTK 能压到原来的 10-40%,而且关键信息不丢。这对用 AI 编程工具的人来说太实用了--工具调用的输出经常占掉大半上下文。

有个 inflation guard 机制防止过度压缩导致语义损失,这个设计很务实。


五、实际接入:三步搞定

第一步:安装启动

npm install -g omniroute
omniroute

默认监听 20128 端口,浏览器打开就是仪表盘。

第二步:连免费服务商

仪表盘 -> Providers 页面,点连接。我连了几个永久免费的:

服务商 模型 特点
Z.AI GLM GLM-4.7 / 4.5-Flash 永久免费
SiliconFlow DeepSeek V3.2 / R1 免费层级
Cloudflare AI 50+ 模型 10K neurons/day
Cerebras GLM 4.7, GPT-OSS 1M tokens/day
Pollinations GPT, Llama, Claude 无需密钥

连完之后仪表盘上会显示聚合后的免费 Token 总量。

第三步:指向编码工具

# Claude Code
export ANTHROPIC_BASE_URL=http://localhost:20128/v1
export ANTHROPIC_API_KEY=你的OmniRoute密钥

# 或者一键配置
omniroute setup-claude
omniroute setup-cursor
omniroute setup-codex

所有工具指向同一个地址,model 填 auto 就行。

验证一下:

curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'

响应头里有 X-OmniRoute-Decision,能看到这次请求实际路由到了哪个服务商、延迟多少、成本多少。这个透明度我非常喜欢。


六、协议支持:不只是 REST

除了 OpenAI 兼容的 REST API,OmniRoute 还支持:

  • MCP(stdio / HTTP / SSE)--104 个工具,31 个作用域,可以直接接 Claude Desktop、Cursor
  • A2A(JSON-RPC 2.0 + SSE)--Agent 间通信,6 个技能
  • WebSocket bridge/v1/ws)--实时流式

接 Claude Code 的 MCP 非常简单:

claude mcp add-server omniroute --type http --url http://localhost:20128/api/mcp/stream

七、我的判断

值得用的三个理由:

  1. 免费额度聚合确实解决了实际问题。以前 Gemini 的免费额度用不完,DeepSeek 的额度也用不完,但分散在各家 SDK 里很难统一调度。OmniRoute 把它们拢到一个池子里,fill-first 策略自动轮转,利用率高很多。

  2. Token 压缩是实打实的成本节省。RTK 对工具输出的压缩效果太明显了,长会话场景下省的不只是钱,更是上下文窗口。

  3. 三层弹性让编码工作流不会因为某个服务商抽风就断了。这对依赖 AI 编程的开发者来说是刚需。

但也要说几个问题:

  • 项目标注 prototype 成熟度,版本迭代很快(v3.8.49),API 可能有变动
  • 压缩的 aggressive 模式对代码生成质量有明显影响,建议编码场景用 conservative
  • Fusion 策略(多模型并发+判官合成)成本会翻几倍,慎用
  • 需要常驻一个本地服务,对环境有一定要求
  • 290 家服务商里有不少是"薅羊毛"性质的免费资源,稳定性参差不齐

结语

OmniRoute 的核心洞察是:AI 服务商太多太碎,开发者不该为每个工具单独管理一套配置。 它用一个本地网关 + 智能路由 + 压缩省钱的组合拳把这件事做透了。

如果你同时在用多个 AI 编程工具、对成本敏感、又不想被单一服务商锁定,值得试试。

目录
相关文章
|
5天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1904 5
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
13天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2496 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
13天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1335 2
|
11天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
1127 2
|
15天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1351 52
|
12天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
625 2
|
12天前
|
SQL 关系型数据库 MySQL
【2026最新】DBeaver下载、安装、数据库管理一篇搞定(附官网社区版安装包)
DBeaver是一款免费开源的跨平台通用数据库管理工具,支持MySQL、PostgreSQL、SQLite、Oracle等几乎所有主流数据库,无需为每种数据库安装独立客户端,极大提升开发与数据分析效率。