一个端点接 290 家 AI 服务商--我拆解了周增 7700 Star 的 OmniRoute

简介: OmniRoute 是一款 MIT 协议的本地 AI 网关(TS 编写),聚合 290+ 服务商、500+ 模型,提供 OpenAI 兼容接口。支持智能 Combo 路由、12 因子 auto 选模、三层弹性容错与 RTK 等 12 种 Token 压缩引擎,显著提升免费额度利用率与稳定性。(239 字)

最近在折腾 AI 编程工具链的时候,我遇到一个很烦的问题:Claude Code 用 Anthropic 的 key,Cursor 用 OpenAI 的 key,Aider 又接的 DeepSeek,每个工具一套配置,免费额度散落在各家手里根本用不顺。

然后我在 GitHub Trending 上看到 OmniRoute--MIT 协议,TypeScript 写的,号称一个端点对接 290+ 服务商、500+ 模型,还自带负载均衡和故障回退。周增 7700 Star,38k+ 总星。

花了一天半把文档和源码结构翻了一遍,这东西确实解决了我遇到的问题,但设计思路比我预期的要深。聊聊我的发现。


一、它到底干了什么事

一句话:把分散的 AI 服务商聚合成一个 OpenAI 兼容的本地端点。

你的编码工具(Claude Code、Cursor、Codex CLI 等)不再需要分别配置不同服务商的 API Key,全部指向 http://localhost:20128/v1 就行。

image.png

其中 90+ 家提供免费层级,40+ 家永久免费。文档里说聚合后大约有 15.3 亿免费 Token/月,仪表盘上实时显示剩余额度。


二、核心设计:Combo 路由系统

这是我最想聊的部分。OmniRoute 不只是个"转发代理",它有一套叫 Combo 的模型链路由机制。

什么是 Combo

Combo 就是一条预配置的模型链。比如你配 Claude -> GPT-4o -> Gemini -> DeepSeek,当 Claude 配额用尽,自动切 GPT-4o;GPT-4o 挂了,切 Gemini--应用层完全无感知

零配置的 auto 模式

如果你懒得配 Combo,直接把 model 设成 auto,OmniRoute 会从你连接的所有服务商里实时构建虚拟链。它有几种预设:

Model ID 干什么
auto 平衡模式,粘滞上次成功的服务商
auto/coding 代码生成质量优先
auto/fast 最低延迟优先
auto/cheap 每 Token 最便宜优先
auto/offline 优先选剩余配额最多的
auto/smart 质量优先 + 10% 探索更好的模型

auto/smart 那个 10% 探索挺有意思--大部分请求走已知最好的模型,但留 10% 去试别的,万一发现更好的就自动切换。

12 因子评分

auto 模式的背后是一个 12 因子评分引擎。我根据文档和路由策略列表推断,这 12 个因子大致覆盖:健康度、剩余配额、成本、延迟、历史成功率、配额重置时间、上下文匹配度、新鲜度等维度。每个候选模型实时打分,选分最高的路由。

19 种路由策略

除了 auto,还有 18 种可以手动组合的策略。我挑几个实用的说:

image.png

实际用的时候,我最常用的是 fill-first(先把免费额度吃干净再切付费的)和 priority(配 fallback 链保高可用)。


三、三层弹性机制:请求不会断

这个设计我觉得是整个架构里最扎实的部分。OmniRoute 有三层独立的弹性保障:

image.png

第一层处理单次请求的临时故障(网络抖动、瞬时 429),第二层处理模型级别的持续故障(配额耗尽、服务商宕机),第三层处理多账号场景下的配额分配。

配额层的 Quota-Share 支持三种策略:

  • hard:超配额直接拒绝,严格但不灵活
  • soft:超了降优先级但不拒绝,平滑过渡
  • burst:允许借用空闲份额,最大化吞吐

我一般用 soft,既不会突然断流,也不会把某个 Key 榨干。


四、Token 压缩:省钱的关键武器

这是 OmniRoute 和其他网关拉开差距的地方。它在请求到达上游模型之前,先过一遍压缩流水线。

12 引擎流水线

不是简单截断,而是 12 个引擎按顺序处理:

实际效果

模式 节省 适用场景
Lite ~15% 永远开启的安全默认
Standard (Caveman) ~30% 日常编码
Aggressive ~50% 长工具密集会话
Ultra ~75% 最大节省
RTK 60-90% Shell/测试/构建输出
RTK + Caveman 叠加 78-95% 混合提示+工具日志

RTK 那个对命令输出的压缩效果最让我印象深刻。你跑个 npm install 出来几百行日志,RTK 能压到原来的 10-40%,而且关键信息不丢。这对用 AI 编程工具的人来说太实用了--工具调用的输出经常占掉大半上下文。

有个 inflation guard 机制防止过度压缩导致语义损失,这个设计很务实。


五、实际接入:三步搞定

第一步:安装启动

npm install -g omniroute
omniroute

默认监听 20128 端口,浏览器打开就是仪表盘。

第二步:连免费服务商

仪表盘 -> Providers 页面,点连接。我连了几个永久免费的:

服务商 模型 特点
Z.AI GLM GLM-4.7 / 4.5-Flash 永久免费
SiliconFlow DeepSeek V3.2 / R1 免费层级
Cloudflare AI 50+ 模型 10K neurons/day
Cerebras GLM 4.7, GPT-OSS 1M tokens/day
Pollinations GPT, Llama, Claude 无需密钥

连完之后仪表盘上会显示聚合后的免费 Token 总量。

第三步:指向编码工具

# Claude Code
export ANTHROPIC_BASE_URL=http://localhost:20128/v1
export ANTHROPIC_API_KEY=你的OmniRoute密钥

# 或者一键配置
omniroute setup-claude
omniroute setup-cursor
omniroute setup-codex

所有工具指向同一个地址,model 填 auto 就行。

验证一下:

curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'

响应头里有 X-OmniRoute-Decision,能看到这次请求实际路由到了哪个服务商、延迟多少、成本多少。这个透明度我非常喜欢。


六、协议支持:不只是 REST

除了 OpenAI 兼容的 REST API,OmniRoute 还支持:

  • MCP(stdio / HTTP / SSE)--104 个工具,31 个作用域,可以直接接 Claude Desktop、Cursor
  • A2A(JSON-RPC 2.0 + SSE)--Agent 间通信,6 个技能
  • WebSocket bridge/v1/ws)--实时流式

接 Claude Code 的 MCP 非常简单:

claude mcp add-server omniroute --type http --url http://localhost:20128/api/mcp/stream

七、我的判断

值得用的三个理由:

  1. 免费额度聚合确实解决了实际问题。以前 Gemini 的免费额度用不完,DeepSeek 的额度也用不完,但分散在各家 SDK 里很难统一调度。OmniRoute 把它们拢到一个池子里,fill-first 策略自动轮转,利用率高很多。

  2. Token 压缩是实打实的成本节省。RTK 对工具输出的压缩效果太明显了,长会话场景下省的不只是钱,更是上下文窗口。

  3. 三层弹性让编码工作流不会因为某个服务商抽风就断了。这对依赖 AI 编程的开发者来说是刚需。

但也要说几个问题:

  • 项目标注 prototype 成熟度,版本迭代很快(v3.8.49),API 可能有变动
  • 压缩的 aggressive 模式对代码生成质量有明显影响,建议编码场景用 conservative
  • Fusion 策略(多模型并发+判官合成)成本会翻几倍,慎用
  • 需要常驻一个本地服务,对环境有一定要求
  • 290 家服务商里有不少是"薅羊毛"性质的免费资源,稳定性参差不齐

结语

OmniRoute 的核心洞察是:AI 服务商太多太碎,开发者不该为每个工具单独管理一套配置。 它用一个本地网关 + 智能路由 + 压缩省钱的组合拳把这件事做透了。

如果你同时在用多个 AI 编程工具、对成本敏感、又不想被单一服务商锁定,值得试试。

目录
相关文章
|
1月前
|
存储 人工智能 前端开发
开源版"带记忆的 Claude Desktop"——我试了 Rowboat 的多 Agent 编排
Rowboat 是一款开源AI工作操作系统(Apache-2.0,TS编写),主打多Agent协同编排、本地长期记忆与自动化工作流。支持邮件处理、代码重构、会议准备等场景,所有数据存于本地Obsidian兼容知识图谱,兼顾隐私与复利式上下文积累。
187 3
|
1月前
|
人工智能 程序员 Python
让 Claude Code 少说废话、直接给答案——我试了这个 5200 Star 的技能包
i-have-adhd 是一款开源AI编程助手“输出风格技能包”,专治AI回答啰嗦、废话多、行动指引模糊的痛点。它强制AI首句给动作、步骤编号、禁用客套话,让调试/编码指令清晰可执行。MIT协议,支持Claude Code、Cursor等主流工具,安装即用。(239字)
176 2
|
1月前
|
SQL 人工智能 文字识别
阿里把内部用了两年的 AI 代码审查工具开源了——我跑了一遍 Open Code Review
阿里开源的 Open Code Review 是一款工程化 AI 代码审查工具,采用“确定性模块 + LLM Agent”混合架构,精准定位问题、严控误报率,支持 Git 差异审查与全量扫描,已落地服务数万开发者。周增星 4750,Apache-2.0 协议,轻量易集成。(239 字)
644 2
|
2月前
|
人工智能 弹性计算 API
【AI 尝鲜实验室】上新 | New API:一个入口打通全网大模型的统一网关
New API 是 QuantumNous 开源的大模型网关与 AI 资产管理系统(AGPL-3.0,GitHub 42k+ Stars),聚合 OpenAI、Claude、Qwen 等主流模型,提供统一 OpenAI 兼容接口、渠道分组、自动重试、额度管理及在线充值。本实验通过阿里云计算巢一键部署,几分钟即可搭建专属网关,支持团队令牌分发与国产模型无缝接入编程工具。
936 3
|
1月前
|
人工智能 缓存 数据可视化
阿里云百炼平台详解:官网入口、免费AI大模型领取及常见问题解答
阿里云百炼(Model Studio)是阿里云推出的一站式大模型服务平台,集成通义千问全系列及DeepSeek、Kimi等上百款主流第三方大模型,提供兼容OpenAI的API接口、可视化应用构建、模型微调与部署等全链路能力,是个人开发者与企业快速接入AI能力的首选平台。本文将从官网入口、免费AI大模型领取流程、核心功能使用,到高频常见问题解答,全方位详解阿里云百炼平台,帮助你快速上手,高效使用免费额度,避免踩坑。
991 1
|
1月前
|
人工智能 JavaScript Linux
让 Claude Code 用我已经登录的浏览器——ego-lite 这个设计太实用了
ego-lite是Citro Labs推出的AI浏览器,让Agent直接复用你的日常登录态,无需重复登录或绕过2FA。通过隔离Space实现任务隔离与状态共享,Snapshot技术将页面token降低99%,支持macOS,已获周增4700 Star。
292 1
|
1月前
|
人工智能 Rust 开发工具
当 AI Agent 不再是 Bot,而是你的"同事"——我花两天拆解了 Block 开源的 Buzz
Buzz是Block开源的Rust协作平台,基于Nostr协议,首创“Agent即成员”范式:人类与AI Agent共用统一签名事件流,各自持独立密钥对,授权可验证、审计可追溯。架构极简——一张事件表承载聊天、代码、CI等全部操作,Git存储采用对象存储+CAS指针,支持高并发Agent协同。
234 1
|
1月前
|
数据可视化 PyTorch 算法框架/工具
ComfyUI电脑版EXE文件下载、安装、配置、使用全流程图解,点击可直接运行
ComfyUI是Stable Diffusion最流行的可视化工作流工具,以节点连线方式精准控制文生图、图生图、ControlNet等全流程。官方推出免命令行的Comfy Desktop桌面版,内置环境,一键安装启动,新手也能快速上手。(239字)
|
1月前
|
人工智能 安全 Linux
零门槛搭建云端 AI 编程环境:Linux 服务器 Docker 部署 OpenCode 保姆级教程
在云原生与AI编程深度融合的当下,OpenCode凭借轻量化、浏览器访问、AI辅助编程的特性,成为开发者打造云端开发环境的优选方案。通过Docker容器化部署OpenCode,可在Linux云服务器上快速搭建跨平台、可随时访问的AI编程环境,无需本地安装复杂IDE,随时随地通过浏览器编写、调试代码,结合AI能力大幅提升开发效率。本文将从环境准备、Docker安装、OpenCode部署、配置优化到安全加固,提供保姆级全流程教程,确保零基础用户也能顺利完成部署,打造专属云端AI编程工作台。
190 0
零门槛搭建云端 AI 编程环境:Linux 服务器 Docker 部署 OpenCode 保姆级教程
|
5月前
|
人工智能 自然语言处理 安全
Claude Code 全攻略:命令大全 + 实战工作流(建议收藏)
本文介绍了Claude Code终端AI助手的使用指南,主要内容包括:1)常用命令如版本查看、项目启动和更新;2)三种工作模式切换及界面说明;3)核心功能指令速查表,包含初始化、压缩对话、清除历史等操作;4)详细解析了/init、/help、/clear、/compact、/memory等关键命令的使用场景和语法。文章通过丰富的界面截图和场景示例,帮助开发者快速掌握如何通过命令行和交互界面高效使用Claude Code进行项目开发,特别强调了CLAUDE.md文件作为项目知识库的核心作用。
50823 72
Claude Code 全攻略:命令大全 + 实战工作流(建议收藏)

热门文章

最新文章