平台侧的观察:选型焦虑的真实形态
在 Model Studio 的模型矩阵持续扩充的当下,"该用哪个模型"是开发者侧反馈最密集的问题之一。模型列表越长,这个问题的决策成本越高:qwen 系列三档主力加带日期快照版本、第三方模型目录持续接入,规格页和价格页都齐全,缺的是一个把"我的场景"映射到"具体模型"的决策层。
外部信号也印证这个判断:免费 AI 网关 OmniRoute 七月底单周涨星超过一万、当前已四万七千星,聚合 330+ provider(90+ 免费)。网关的火爆说明用户不想手工管理模型选择——但网关解决的是路由与可用性,"场景该选哪个模型"仍是一个独立且未闭环的问题。
平台 CLI(bl)里的 bl advisor recommend 正是为这一层设计的:场景描述进,排序候选出,与用量、额度、限流命令组共同构成"选型 → 用量 → 控费 → 限流"的完整闭环。与本系列上一篇(bailian-docs-llm-wiki,讲文档库怎么被 Agent 检索)正好构成"查得到 → 选得出"的两级台阶,两篇互相独立。本文以一个真实场景走一遍全链路。环境:Node.js 18+,npm install -g bailian-cli 后 bl auth login 登录,API Key 在控制台签发,CLI 安装文档。
决策层的设计:三段式
命令的官方描述是 intent analysis → candidate recall → LLM ranking:

bl advisor recommend --message "电商客服机器人,要能看懂用户上传的商品截图,日调用量5万次,优先控制成本"
实测(bailian-cli 1.4.2)约十秒返回。Top 1 推荐(真实输出节选):
{
"model": "qwen3.7-flash-2026-07-15",
"category": "Cost-optimized",
"contextWindow": 1000000,
"maxOutputTokens": 131072,
"reason": "The model is specifically designed for cost-optimized, high-concurrency scenarios ... ideal for handling 50,000 daily API calls under a low budget.",
"docUrl": "https://help.aliyun.com/document_detail/3016807.html"
}
三段各有工程含义:
- 意图分析把白话约束结构化:本例中"看懂截图"→
inputModality: Image、"日调用五万次"→high-concurrency、"预算紧"→budget: low+qualityPreference: cost-optimized - 候选召回从模型目录筛出 50 个候选并给初筛分——这一段读实时目录数据(规格与定价的当前值),不是模型训练记忆
- LLM 排序产出 Top 3,附推荐理由与
docUrl文档链接
--dry-run 可以只跑前两段观察中间态,不消耗排序调用,适合调试场景描述的写法。
场景敏感性:同命令两副面孔
对照实验能直观看到"场景化"三个字的分量。合同审阅场景(律所、精度优先、日数十份):
bl advisor recommend --message "法律合同审阅助手,输出条款风险清单,精度优先,每天只有几十份合同"
| 意图字段 | 客服机器人 | 合同审阅 |
|---|---|---|
| scenarioHints | high-concurrency / cost-sensitive / image-input | high-precision / legal-domain / accuracy-critical |
| budget | low | medium |
| qualityPreference | cost-optimized | flagship |
| Top 推荐 | qwen3.7-flash | farui-plus(法律垂类)+ qwen3.8-max |
合同场景的 Top 1 farui-plus 是法律垂类模型——这类模型不出现在通用评测榜单上,恰是场景化选型相对静态评测的价值区间。
闭环的另一半:用量、额度、限流
选型落地后,配套命令组承接运行时的观测与管控:
bl usage free --expiring 30
bl usage stats --days 30 --workspace-id <业务空间ID>
bl quota check --model qwen3.7-flash-2026-07-15

两个接入细节(均为实跑验证):这组命令走控制台凭据,需先 bl auth login --console(与 API Key 共存);usage stats 需带 --workspace-id,用 bl workspace list 查询或 bl config set workspace_id 固化。
额度口径的官方基准
免费额度的正确口径(对照官方文档 2026-08-14 复核):有效期 90 天,到期不补发不延期;每模型独立额度(通常 100 万 Token),带日期快照版与不带日期版互为独立额度;仅华北2(北京)地域模型享有;某模型额度用尽不自动切换,已认证账号继续调用将按量计费。bl usage freetier --model <模型> --on 可开启"用完即停"(额度耗尽返回 AllocationQuota.FreeTierOnly 而非计费),适合试错期与验收期。
第三方内容流传的"100 万 Tokens 永久有效"为错误口径,开发者侧做用量规划时应以官方文档与 bl usage free 的实时返回为准。
生态协同:Skill 形态与 Agent 集成
除 CLI 外,同仓库的 first-party Skill bailian-model-recommend 可装入已有 Agent:
npx skills add modelstudioai/skills
交互式选择后,在 Agent 对话中以"推荐模型 / 该用哪个 / 对比模型"等表述触发,返回适配模型与可运行示例代码。其模型目录数据读取自同仓库的文档库项目(bailian-docs-llm-wiki 的 models/,该项目关注文档的 Agent 检索,此处不展开)。
CLI 与 Skill 两个入口定位互补:终端侧拿完整 JSON 与候选池,Agent 侧零迁移成本随问随用。
边界与定位
三条边界如实说明:推荐范围限于平台目录内模型,不做跨厂商比价;排序结果是决策起点,规格与定价经 docUrl 由工程侧自行核验;网关类工具解决路由与可用性,与场景化选型正交,可叠加使用。
对平台开发者而言,这条命令链路的价值在于把选型从"不可复现的经验判断"变成"可随时重跑的工程步骤"——在模型目录月级变动的环境下,可重复性本身就是核心竞争力。入口:百炼控制台首页。
本文命令基于 bailian-cli 1.4.2 实测;两段 advisor 输出与报错信息均为真实运行结果;额度口径对照官方文档 2026-08-14 复核。