Agent 能力分层里缺失的一层
观察 2026 年 7 月的开源生态,Agent Skills 已经从概念走向标准化。GitHub 当月飙升榜中,skill 类项目集中出现:graphify(周涨 4906 星,代码库转知识图谱)、hallmark(周涨 4810 星,输出风格治理)、i-have-adhd(周涨 3270 星,输出组织约束)。
把这些能力按作用面归类,会看到一个清晰的分层结构:
| 能力层 | 代表 skill | 输入 | 输出 |
|---|---|---|---|
| 理解层 | graphify | 代码/文档/PDF | 结构化图谱 + 分析结论 |
| 表达层 | hallmark、i-have-adhd | 文本 | 规范化文本 |
| 检索层 | find-skills | 需求描述 | skill 推荐清单 |
| 产出层 | (生态空白) | 结构化指令 | 图像/音频/视频等交付物 |
理解层与表达层已相当成熟,产出层则明显缺位。对企业场景而言,这一层的缺失意味着:Agent 能完成分析与文案,但内容资产(配图、配音、演示视频)仍需人工在其他工具中完成,工作流出现断点。
平台侧的补位方案
百炼团队维护的 modelstudioai/skills 仓库(Apache-2.0)正是覆盖产出层,底层统一调用 bl 命令行,一套凭证打通图像生成/编辑、语音合成/识别、视频生成/编辑、视觉理解。
npx skills add modelstudioai/skills
npx skills add modelstudioai/cli --all -g
环境要求 Node.js ≥ 18 与 API Key(获取 Key、CLI 安装文档)。
仓库同时维护一份第三方 skill 精选索引——从 Anthropic、Vercel、Google Labs 等社区持续跟踪,逐个在真实场景验证,仅收录标记"可用"的条目,按 skill 管理、代码开发、设计创意、文档、视频制作、测试质量六类组织。对需要统一团队 skill 基线的组织,这份经验证的索引可直接作为选型参考,省去自行试错的成本。
触发机制:影响 skill 治理策略
按 Claude Code 官方文档(截至 2026-07 口径),Agent 在会话启动时构建包含全部可用 skill 及其描述的清单,依据 description 字段判定请求是否命中。三个治理含义:
- description 是路由键。团队内自建 skill 时,描述字段需明确覆盖业务触发场景与关键词,否则命中率不可控
- 清单在会话启动时构建。批量下发 skill 后需要重启会话生效,这一点应写进内部部署说明
- 清单占用上下文。"全量装满"策略有隐性成本,按角色分发比统一分发更经济
此外,Claude Code 的 skills 遵循 Agent Skills 开放标准,该标准适用于多个 AI 工具。对企业意味着 skill 资产具备跨 harness 迁移能力,不必因工具选型变化而重建。
能力实测
以下命令基于 bl 1.4.2 实测,供搭建标准作业流程参考。实际使用中由 Agent 依自然语言请求组织,使用方无需记忆命令签名。
图像:文字渲染进画面
bl image generate --prompt "简洁的技术类文章封面,深色背景,画面中央是清晰醒目的中文标题文字:装了一堆 skill 之后,标题下方一行小字:Agent 还是交不出一张图,背景有淡淡的几何线条与终端窗口元素,扁平设计风格" --size 16:9 --model qwen-image-2.0-pro --watermark false --out-dir ./covers
实测结果:两行中文标题准确渲染进画面,无缺字错字,中英混排位置正常。对营销物料、内部宣导材料这类需要中文字在图上的场景,避免了"出图 + 二次叠字"的两段式流程。
工程注意点:--size 接受比例或星号连接的像素(1280*720);写成 1280x720 时 CLI 不做本地校验、原样转发服务端,接入自动化流水线时需在上游做参数规范化。--watermark 默认开启,正式物料须显式设为 false。
语音:音色需从枚举中选取
bl speech synthesize --list-voices --model cosyvoice-v3-flash
bl speech synthesize --text-file ./script.txt --voice longxiaochun_v3 --rate 0.9 --out ./output.mp3
实测 cosyvoice-v3-flash 返回二十余个音色,含 voice ID、风格描述与语言支持(如 longxiaochun_v3 知性积极女、longcheng_v3 智慧青年音、longtian_v3 磁性理智男,均支持中英文)。语速参数为 --rate(0.5-2.0),非 --speed。
适用于内部培训材料、产品说明、公告播报等标准化口播场景;多角色情绪演播需通过 --instruction 迭代调整。
视觉理解与异步视频
bl vision describe --image ./screenshot.png --prompt "读出图中的报错信息与关键堆栈行,原样输出文字"
bl video generate 为异步任务,配合 bl video task get、bl video download --task-id <id> --out <path> 使用。注意 video generate 的 --poll-interval 默认 5 秒,而 video edit/video ref 默认 15 秒,接入调度系统时需按命令区分。
成本治理(企业关注重点)
产出层与文本层在计费模型上有本质差异:调用由 Agent 自主发起。一次生成 3 张候选图即产生 3 次计费调用,这一特性要求在启用前建立防线,而非事后核账。
bl usage freetier --all # 免费额度用尽自动停,防意外扣费
bl usage free --expiring 30 # 查余量与到期(console 命令,需先 bl auth login --console)
bl usage stats --days 30 # 按模型/类型查真实用量分布
bl quota check --model <model> # 对照 RPM/TPM 限流水位
bl quota request # 需要时申请临时提额
免费额度规则按官方文档(help.aliyun.com/zh/model-studio/new-free-quota)梳理如下,用于容量规划:
| 规则项 | 口径 | 规划影响 |
|---|---|---|
| 有效期 | 90 天,过期作废不补发 | 试点周期需在窗口内完成评估 |
| 额度粒度 | 每模型独立约 100 万 Token | 多模型方案不能按总量估算 |
| 版本粒度 | 快照版本与最新版本各自独立 | 锁版本策略会影响额度分布 |
| 地域 | 仅华北2(北京) | 多地域部署需单独核算 |
| 用尽行为 | 不自动切换模型 | 需在应用侧实现降级逻辑 |
| 子账号 | 主账号与 RAM 子账号共享 | 多团队共用需配额纪律 |
| 不可抵扣 | Batch/调优/部署/自定义模型 | 这些场景须按量预算 |
| 超支 | 已认证用户耗尽后直接扣费 | 强制开启用完即停 |
网络流传的"100 万 Tokens 永久有效"与官方文档不符,不可作为预算依据。
适用性判断
适合:内容资产产出频繁、希望减少工具切换与人工搬运环节的团队;需要中文文字入图、中文口播等本地化场景的组织。
不适合:对图像有精确构图与批量风格一致性硬要求的设计流程(本地 ComfyUI 等节点式工作流可控性更高,代价是 GPU 与工作流维护);工作流完全位于代码与文本层的团队,产出层能力会闲置并额外占用清单上下文。
结论
Agent 的能力边界等同于其工具集边界。当前 skill 生态的理解层与表达层已趋成熟,产出层是可以低成本补齐的一环——安装动作与团队已有的 skill 分发流程一致,使用方无需学习命令。
关键在于同步建立成本防线:产出层的计费调用由 Agent 自主发起,用完即停与用量监控应作为启用前的必要配置,而非可选项。
从体验中心可先验证具体业务场景的产出质量再决定推广范围。