在AI技术全面渗透开发与创作领域的当下,命令行工具凭借轻量化、可脚本化、易集成的特性,成为开发者高效调用AI能力的核心入口。阿里云百炼CLI作为官方开源的命令行工具,将百炼平台150+款模型与全模态AI能力统一封装,彻底解决了多模型API鉴权复杂、参数不统一、调用繁琐的痛点。最新版百炼CLI实现了从单一文本交互到文本、图像、视频、语音全模态能力的全覆盖,支持流式输出、思考模式、工具调用、多模态理解等高级特性,同时原生兼容各类AI Agent框架,可无缝嵌入自动化脚本与开发工作流。本文将全面拆解最新版百炼CLI的核心架构、全模态能力、安装配置流程,并提供详细的命令实操案例与避坑指南,助力开发者一行命令解锁全模态AI能力,大幅提升开发与创作效率。
一、百炼CLI核心定位与架构优势
百炼CLI(Bailian CLI)是阿里云百炼平台官方推出的开源命令行工具,以“统一接口、全模态覆盖、Agent原生”为核心定位,专为开发者与AI Agent设计,提供轻量、高效、可脚本化的AI能力调用方式。相比传统的Web控制台与独立API调用,百炼CLI具备三大核心架构优势,彻底重构AI能力调用体验:详情👉访问阿里云百炼 CLI 页面 或
详情👉访问阿里云百炼大模型服务平台页面 了解

1. 统一接口,全模型兼容
百炼CLI将百炼平台150+款模型(涵盖文本、图像、视频、语音、多模态等全品类)的API统一封装,提供一致的命令行接口与参数规范。开发者无需记忆不同模型的鉴权方式、请求格式与参数定义,只需通过bl前缀命令即可调用任意模型,实现“一套命令、全模型适配”。无论是通义千问系列文本模型、Qwen-Image图像模型、HappyHorse视频模型,还是CosyVoice语音模型,均通过统一命令体系调用,大幅降低学习成本与开发复杂度。
2. 全模态能力原生集成
最新版百炼CLI原生集成文本生成、图像生成/编辑、视频生成/编辑、语音合成/识别、多模态理解、联网搜索、知识库检索等全模态AI能力,覆盖从内容创作到智能分析的全场景需求。所有能力均以命令行形式提供,支持批量调用、流式输出、结果保存,可直接嵌入Shell脚本、CI/CD流程与自动化工作流,实现全模态AI能力的无感化集成。
3. Agent原生,无缝协同
百炼CLI专为AI Agent框架设计,所有命令均支持结构化工具调用,原生兼容Claude Code、Qwen Code、OpenClaw、Hermes Agent等主流AI编程与Agent工具。Agent可直接调用百炼CLI命令获取全模态能力,无需额外开发适配逻辑,实现“Agent+百炼CLI”的无缝协同,让AI Agent具备文本创作、图像生成、视频制作、语音交互等全栈能力。
4. 跨平台兼容,轻量高效
百炼CLI采用Go语言编写,支持macOS、Linux、Windows全平台运行,无需依赖复杂环境,仅需Node.js 18.17+或直接使用二进制安装包即可快速部署。工具体积轻量、启动迅速、响应低延迟,支持本地缓存与批量处理,适配个人开发、服务器部署与大规模自动化场景。
二、最新版百炼CLI全模态核心能力全解析
最新版百炼CLI围绕“全模态AI能力调用”构建完整功能体系,从基础文本交互到复杂多模态理解,从内容生成到智能分析,提供一站式命令行解决方案。以下按能力类别详细拆解核心功能与命令参数:详情👉访问阿里云百炼 CLI 页面 或
详情👉访问阿里云百炼大模型服务平台页面 了解

1. 文本交互能力:智能创作与代码开发
文本交互是百炼CLI的基础核心能力,支持对话、生成、总结、代码编写等全场景文本处理,内置思考模式、流式输出、工具调用等高级特性。
核心命令与参数
# 基础文本对话(默认模型qwen3.7-max)
bl text chat --content "解释百炼CLI的核心优势"
# 指定模型、开启思考模式、限制输出长度
bl text chat --model qwen3.8-max --enable-thinking --thinking-budget 8192 --max-token 2000 --content "编写一个Python异步爬虫框架,支持多线程与代理池"
# 流式输出(默认开启,TTY环境)
bl text chat --stream --content "生成一份产品需求文档大纲"
# 代码生成与调试
bl text chat --content "修复这段JavaScript代码的报错:function add(a,b) { return a + b } add(1)"
# 批量文本处理(从文件读取输入,输出到文件)
bl text chat --model qwen3.7-plus --input ./input.txt --output ./output.txt --content "将输入文本翻译为英文,并优化语言表达"
核心特性
- 思考模式(Thinking Mode):支持
--enable-thinking参数,适用于qwen3/qwq系列模型,开启后模型会先进行深度思考,生成更精准、逻辑更严谨的输出,适合复杂代码编写、方案设计与深度分析场景。 - 流式输出:默认开启流式响应,实时展示输出内容,无需等待完整结果返回,提升交互体验。
- 工具调用:支持
--tool参数,可调用联网搜索、知识库检索等外部工具,实现“文本交互+工具赋能”的增强能力。 - 长文本处理:支持百万级token上下文输入,适配长文档总结、代码库分析、长篇内容创作等场景。
2. 图像生成与编辑能力:创意视觉一键生成
百炼CLI集成Qwen-Image 2.0等专业图像模型,支持文生图、图生图、图像编辑、多图合成等全流程图像创作能力,提供丰富的参数控制,生成专业级视觉内容。
核心命令与参数
# 文生图(生成4张1024*1024电商主图)
bl image generate --prompt "白色无线蓝牙耳机,简约北欧风,电商主图,高清质感" --n 4 --size 1024x1024 --out-dir ./images/
# 图像编辑(基于参考图修改,替换背景)
bl image edit --image ./product.png --prompt "将背景替换为海边沙滩场景,保持产品主体不变" --out-dir ./edited/
# 多图合成(最多9张参考图,保持主体一致性)
bl image generate --prompt "生成一系列同风格的智能家居产品图" --ref-images ./img1.png ./img2.png --n 6 --size 1024x1024
# 指定图像模型与风格
bl image generate --model qwen-image-2.0 --prompt "赛博朋克风格的城市夜景,霓虹灯光,高清细节" --style "cinematic" --quality "high"
核心特性
- 专业文本渲染:支持精准文字生成,适配海报、logo、宣传图等需要文字的场景。
- 多图合成:支持最多9张参考图,保持视觉风格与主体一致性,适合系列化内容创作。
- 风格与质量控制:提供风格(如cinematic、anime、realistic)、质量(high/medium/low)、比例等参数,精准控制生成效果。
- 批量输出:支持一次生成多张图片,并自动保存到指定目录,适配批量创作需求。
3. 视频生成与编辑能力:动态内容快速制作
百炼CLI集成HappyHorse系列视频模型,支持文生视频、图生视频、自然语言视频编辑等能力,无需专业剪辑工具,一行命令生成高清动态视频。
核心命令与参数
# 文生视频(生成30秒产品演示视频,16:9比例)
bl video generate --type t2v --prompt "白色无线蓝牙耳机产品演示,展示佩戴、音质、续航功能,高清4K" --duration 30 --ratio 16:9 --out-dir ./videos/
# 图生视频(基于单张图片生成20秒动态视频)
bl video generate --type r2v --image ./product.png --prompt "产品缓慢旋转,展示细节,背景渐变" --duration 20 --out-dir ./videos/
# 视频编辑(自然语言指令编辑现有视频)
bl video edit --video ./demo.mp4 --prompt "裁剪视频前5秒,添加背景音乐,调整亮度与对比度" --out-dir ./edited_videos/
# 多参考图视频生成(最多5张参考图,保持视觉连贯)
bl video generate --type r2v --ref-images ./img1.png ./img2.png --prompt "生成连贯的产品展示视频" --duration 25
核心特性
- 多模式生成:支持文生视频(t2v)、图生视频(r2v)两种核心模式,适配不同创作需求。
- 自然语言编辑:无需专业剪辑知识,通过自然语言指令完成视频裁剪、拼接、特效添加、音频调整等操作。
- 高清输出:支持4K分辨率、高帧率输出,生成专业级视频内容。
- 视觉连贯控制:多参考图生成时,自动保持画面风格、主体与色彩的连贯性,避免视觉割裂。
4. 语音合成与识别能力:全场景语音交互
百炼CLI集成CosyVoice与FunAudio-ASR模型,支持多音色语音合成、极速声音克隆、多语言语音识别等能力,覆盖语音内容创作、语音交互、音频转写等场景。
核心命令与参数
# 语音合成(默认音色,中文)
bl tts --text "欢迎使用百炼CLI,全模态AI能力一键调用" --out ./audio/output.wav
# 指定音色、语言、情感
bl tts --voice Cherry --language English --emotion "cheerful" --text "Bailian CLI empowers your AI development with multimodal capabilities" --out ./audio/en_output.wav
# 声音克隆(基于5-20秒音频样本克隆音色)
bl tts --clone ./sample.wav --text "这是克隆音色生成的语音内容" --out ./audio/cloned.wav
# 语音识别(音频转文本,支持多语言与方言)
bl asr --audio ./input.wav --language zh-CN --dialect "mandarin" --out ./transcript.txt
核心特性
- 多音色支持:提供数十种专业音色,覆盖男声、女声、童声,适配不同场景需求。
- 极速克隆:仅需5-20秒音频样本,即可克隆专属音色,生成个性化语音内容。
- 多语言与方言:语音识别支持30种语言,涵盖7种中文方言与20+种普通话口音,适配全球化场景。
- 流式合成:支持流式语音合成,实时输出音频流,适配实时语音交互场景。
5. 全模态理解能力:多源信息智能分析
百炼CLI提供bl omni全模态对话命令,支持文本、图像、音频、视频多源输入,实现跨模态信息理解与分析,可处理图表解析、文档识别、视频内容理解、多模态问答等复杂场景。
核心命令与参数
# 多模态问答(文本+图像输入)
bl omni --content "分析这张图片中的数据趋势,并给出结论" --image ./chart.png
# 视频内容理解(分析30秒视频内容)
bl omni --content "总结这段视频的核心内容,并提取关键信息" --video ./demo.mp4 --duration 30
# 音频+文本交互
bl omni --content "结合这段音频内容,回答用户问题:产品的核心优势是什么" --audio ./intro.wav
# 多文件批量分析
bl omni --content "分析所有文档的核心观点,并生成汇总报告" --files ./doc1.md ./doc2.pdf --out ./report.md
核心特性
- 全模态输入:支持文本、图像、音频、视频单模态或多模态混合输入,处理复杂信息场景。
- 长内容分析:支持10小时音频与400秒音视频输入,适配长视频、长音频的深度分析。
- 图表与文档解析:精准识别图表数据、文档内容,实现结构化信息提取与分析。
- 跨模态推理:基于多源信息进行综合推理,生成更全面、精准的分析结果。
6. 高级能力:工具调用、联网搜索与知识库
百炼CLI内置联网搜索、知识库检索、记忆管理等高级能力,可扩展AI交互的边界,实现实时信息获取与个性化交互。
核心命令与参数
# 联网搜索(实时获取最新信息)
bl text chat --tool web-search --content "最新的AI大模型技术发展趋势"
# 知识库检索(调用私有知识库)
bl text chat --tool rag --kb-id "your-kb-id" --content "基于知识库内容,回答产品技术架构问题"
# 记忆管理(跨会话持久化记忆)
bl memory set --key "user-preference" --value "喜欢简约风格的设计"
bl memory get --key "user-preference"
bl memory clear
# 额度查询(查看模型调用额度)
bl quota list --model qwen3.7-max
核心特性
- 实时联网:支持联网搜索,获取最新信息,解决模型知识截止问题。
- 私有知识库:无缝对接百炼知识库,实现私有数据的安全检索与应用。
- 持久化记忆:支持跨会话记忆存储,实现个性化交互与上下文延续。
- 额度管理:提供模型调用额度查询功能,方便开发者管控使用成本。
三、百炼CLI安装与配置实战教程
百炼CLI提供多种安装方式,适配不同平台与场景,配置流程简单快捷,仅需3步即可完成全能力调用准备。
1. 环境准备
- 系统要求:支持macOS、Linux、Windows全平台。
- 依赖条件:Node.js ≥ 18.17.0(npm安装方式);二进制安装方式无额外依赖。
- 账号准备:注册并登录阿里云百炼控制台,创建并获取API Key(以
sk-开头)。
2. 全平台安装
方式1:二进制安装(推荐,无Node依赖)
# macOS/Linux
curl -fsSL https://bailian.aliyun.com/cli/install.sh | bash
# Windows (PowerShell)
irm https://bailian.aliyun.com/cli/install.ps1 | iex
方式2:npm安装(开发者/Node环境)
# 全局安装百炼CLI
npm install -g bailian-cli
# 安装配套Skills(扩展能力)
npx skills add modelstudioai/cli --all -g
# 验证安装
bl --version
bl --help
3. 鉴权配置(核心步骤)
安装完成后,需配置百炼API Key完成鉴权,支持交互式配置与命令行快速配置两种方式。
方式1:交互式配置(新手推荐)
# 启动交互式配置
bl auth login
# 按提示输入API Key
# 示例:sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx
方式2:命令行快速配置(脚本/自动化)
# 直接通过API Key配置
bl auth login --api-key sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx
# 查看鉴权状态
bl auth status
# 查看配置文件(默认路径:~/.bailian/config.toml)
cat ~/.bailian/config.toml
4. 基础配置与优化
# 设置默认模型
bl config set default.model qwen3.7-max
# 设置默认输出目录
bl config set default.out-dir ./bailian-output/
# 开启调试模式(排查问题)
bl config set debug true
# 查看所有配置
bl config list
# 更新CLI到最新版
bl update
四、全模态能力实操案例与命令速查
1. 文本创作案例
# 生成产品文案
bl text chat --model qwen3.8-max --content "为白色无线蓝牙耳机撰写电商详情页文案,突出音质、续航、舒适度三大卖点" --out ./copywriting.md
# 代码生成(Python数据分析脚本)
bl text chat --content "编写一个Python脚本,读取CSV数据,进行数据清洗、可视化分析,并生成分析报告" --out ./data_analysis.py
2. 图像创作案例
# 生成系列电商主图
bl image generate --prompt "黑色智能手表,科技感,电商主图,4K高清" --n 6 --size 1024x1024 --out-dir ./watch-images/
# 图像风格转换
bl image edit --image ./photo.jpg --prompt "将照片转换为油画风格,保持人物特征不变" --out-dir ./art-images/
3. 视频创作案例
# 生成产品宣传视频
bl video generate --type t2v --prompt "黑色智能手表产品宣传视频,展示功能、外观、使用场景,30秒,16:9" --duration 30 --out-dir ./watch-videos/
# 图片转动态视频
bl video generate --type r2v --image ./watch.png --prompt "手表缓慢旋转,展示细节,背景科技感动态效果" --duration 15 --out-dir ./dynamic-videos/
4. 语音交互案例
# 生成产品介绍语音
bl tts --voice "Alice" --text "这款黑色智能手表具备心率监测、运动追踪、智能通知等功能,续航长达7天" --out ./watch_intro.wav
# 音频转写
bl asr --audio ./meeting.wav --language zh-CN --out ./meeting_transcript.txt
5. 全模态分析案例
# 图表分析
bl omni --content "分析这张销售数据图表,找出增长趋势与关键问题,并给出优化建议" --image ./sales_chart.png --out ./chart_analysis.md
# 视频内容总结
bl omni --content "总结这段产品发布会视频的核心内容,提取关键信息与数据" --video ./launch.mp4 --duration 60 --out ./video_summary.md
五、常见问题与避坑指南
1. 安装问题
- Node版本过低:执行
node -v检查版本,低于18.17.0时,使用npm install -g n && sudo n lts升级。 - 权限不足:macOS/Linux使用
sudo前缀,Windows以管理员身份运行终端。 - 网络问题:安装失败时,配置npm镜像或使用二进制安装方式。
2. 鉴权问题
- API Key无效:检查API Key是否正确复制,确认百炼账号已开通对应模型服务。
- 配置文件权限:确保
~/.bailian/目录有读写权限,执行chmod -R 755 ~/.bailian/修复。
3. 调用问题
- 模型不存在:检查模型名称是否正确,参考
bl model list查看支持的模型列表。 - 参数错误:使用
bl <command> --help查看命令参数说明,如bl image generate --help。 - 输出失败:检查输出目录是否存在,使用
--out-dir指定可写目录。 - 流式输出异常:非TTY环境(如脚本)需显式添加
--stream false关闭流式输出。
4. 性能与成本优化
- 合理选择模型:简单任务使用轻量模型,复杂任务使用旗舰模型,平衡性能与成本。
- 批量处理:使用
--n参数批量生成,减少重复调用。 - 缓存利用:开启本地缓存,避免重复请求相同内容。
- 额度监控:定期使用
bl quota list查看额度,避免超支。
六、百炼CLI适用场景与价值总结
1. 核心适用场景
- 开发者:快速生成代码、调试程序、生成文档、调用AI能力辅助开发,嵌入CI/CD流程实现自动化。
- 内容创作者:批量生成文案、图像、视频、语音内容,提升创作效率,适配自媒体、电商、广告等场景。
- AI Agent开发者:为Agent赋予全模态能力,实现文本、图像、视频、语音的智能交互与处理。
- 企业用户:构建自动化内容生产、智能分析、客户服务等系统,降低人力成本,提升效率。
- 科研与教育:快速生成实验报告、教学资料、数据分析结果,辅助科研与教学工作。
2. 核心价值总结
百炼CLI通过统一的命令行接口,将阿里云百炼平台的全模态AI能力轻量化、可脚本化,让开发者与创作者无需关注复杂的API细节,一行命令即可解锁文本、图像、视频、语音等全栈AI能力。其跨平台兼容、Agent原生、高效轻量的特性,使其成为AI开发与内容创作的必备工具。最新版百炼CLI的全模态能力升级,进一步拓展了命令行AI的应用边界,实现了从“文本交互”到“全模态创作与分析”的跨越,为开发者提供了更强大、更灵活、更高效的AI能力调用方案。
无论是个人开发者快速构建AI应用,还是企业规模化部署自动化流程,百炼CLI都能以极简的方式集成全模态AI能力,大幅提升开发效率、降低技术门槛,让AI技术真正赋能每一个开发与创作场景。