PART 7|如何选型:决策树与 checklist
决策树
你的任务本质是「分类/打分/路由」而非「生成」?
├─ 否 → 不需要决策模型,回去用生成式 LLM
└─ 是 ↓
需要用自己的数据训练(自定义类别/规则/语言)?
├─ 是 → Jev 出局(不可训)
│ ├─ 需要进程内 <50ms 热路径、且任务零样本可解?
│ │ └─ 是 → 考虑 Laya(但先验证它能否零样本达标)
│ └─ 否 → **Kev**(唯一完整微调路线)
│ ├─ 显存 ≤6GB / Mac → 0.8B 档
│ ├─ 32GB Mac / L40S / H100 → 4B(官方推荐首选)或 9B
│ └─ 80GB GPU + 长文档/最高精度 → 27B(域外 0.848,与 Jev 差 1 点)
└─ 否(标准任务,模型不训练)
├─ 在大陆、无法访问 TypeSafe → Kev(API 兼容,SDK 零改造)
└─ 否 → Jev 官方(5% 错误预算下自动化率最高:0.70 vs Kev 0.45–0.57)
选型 checklist(我实际核对过的)
- 先确认任务形状:输出是「从 N 个选项里选一个」「是非判断」「打等级」三种之一?是,才继续。
- 先量零样本:拿 50–100 条真实样本,一次前向多问题地打一遍。别用 demo 案例,用你最刁钻的真实数据。
- 再评估微调可行性:你能从业务数据里自产监督标签吗?标签是否客观(不来自你系统自身的输出)?有没有至少几百条?官方提醒:400 条以下增益可能在噪声内,示例任务用了 1050 条,真实数据场景 5219 条拿到的提升是 0.804→0.904。
- 模型档位按显存定:0.8B(4GB)/ 4B–9B(24GB+)/ 27B(80GB)。从 4B 开始,官方也是这个建议。
- 警惕三个坑:
- confidence ≠ 准确率,上线路前在你自己的数据上核对阈值;
- 选项顺序会改变答案,排序敏感场景跑一遍
/v1/systemone/permute; - 训练上下文 384 token,长文档任务直接上 27B。
- 部署路径想清楚:本地 kev.serve(免费、低延迟)还是 Modal 缩容到零(按用量计费,冷启动 35 秒)。
我为什么最终选 Kev
我在一个「知识图谱 + 决策模型」项目里,先后调研并实测了 Jev(大陆不可用出局)、Laya(零样本随机 + 微调管线走不通出局)、Von(零样本随机)、Kev(微调有效)。最终选择 Kev 的本质原因只有一条:
它有官方微调管线,
kev.train接受任何领域的 state + questions + label JSONL,而我的项目恰好能从图谱元数据自产监督数据。「图结构 + 微调决策模型」这条主线,只有 Kev 走通了。
代价我也认:0.6B 档作者级判别学不动、confidence 偏低需重标定、Windows 要打 stub、问法必须逐字同源。但这些都是在「知道边界在哪」的前提下可控的工程问题;而 Jev 和 Laya 的短板(不可训 / 微调不可用)是路线级的,不可绕。
参考与来源
- Kev 官方仓库:github.com/jaredpalmer/kev(README、model cards、PLAN.md)
- 架构出处:Archer Hume《Jev's Architecture Unmasked》(archerhume.com)
- TypeSafe System One API:docs.typesafe.ai/api
- 文中诗歌域实测数据:作者自测,RTX 3060 Laptop 6GB,Qwen3-0.6B-Base + LoRA r=16