在日常办公、内容创作与数据处理场景中,语音转文字已经成为提升效率的核心工具。会议录音整理、视频字幕生成、播客内容提炼、采访记录归档等需求日益普遍,而传统在线转录工具存在隐私泄露风险、付费成本高、文件大小受限、网络依赖强等问题。OpenAI开源的Whisper模型凭借免费、本地运行、多语言支持、高准确率等优势,成为个人与小型团队的首选方案。结合OpenClaw技能管理平台,可实现一键调用、批量处理、跨设备协同,进一步降低使用门槛。本文将全面讲解Whisper核心用法、2026年阿里云ECS部署OpenClaw流程、MacOS/Linux/Windows11本地部署步骤、阿里云百炼API与免费Coding Plan API配置方法,覆盖从安装到实战的全流程,搭配完整代码命令与常见问题解决方案,满足不同场景的语音转录需求。
一、OpenAI Whisper:本地离线语音转文字核心能力
OpenAI Whisper是基于大规模多语言数据训练的自动语音识别模型,无需API密钥、不依赖云端服务器、数据全程本地处理,彻底解决隐私安全问题,同时支持99种语言及中文方言,适配几乎所有音频与视频格式,离线状态下仍可稳定运行,识别精度接近专业人工水平。阿里云上OpenClaw极速一键部署最简单,步骤详情 访问阿里云OpenClaw一键部署专题页面 了解。



1.1 核心特性一览
- 完全免费:无调用费用、无额度限制、无隐藏收费项;
- 隐私安全:音频文件不上传云端,所有计算在本地设备完成;
- 多语言覆盖:支持中文(含粤语、四川话等方言)、英语、日语、韩语等99种语言;
- 离线可用:首次下载模型后,无需联网即可持续使用;
- 格式兼容:支持MP3、WAV、M4A、MP4、MKV等音频视频格式;
- 输出多样:自动生成纯文本、SRT字幕、VTT字幕、JSON带时间戳文件。
1.2 基础安装与环境配置
Whisper依赖Python环境与FFmpeg工具,以下是全系统通用安装方法,确保环境完整可运行。
1.2.1 安装FFmpeg(必备依赖)
FFmpeg负责音频解码,是Whisper运行的基础,未安装会导致无法识别文件:
# MacOS(Homebrew)
brew install ffmpeg
# Linux(Ubuntu/Debian)
sudo apt update && sudo apt install ffmpeg
# Windows11(Chocolatey)
choco install ffmpeg
1.2.2 安装Whisper
三种安装方式任选,推荐pip安装,兼容性最强:
# 方法1:pip安装(全平台通用)
pip install openai-whisper
# 方法2:MacOS Homebrew
brew install openai-whisper
# 方法3:OpenClaw Skill一键安装
skillhub install openai-whisper
1.2.3 验证安装
执行命令查看帮助信息,确认安装成功:
whisper --help
1.3 模型选择与参数优化
Whisper提供6种模型,按参数量、显存需求、速度、准确率划分,可根据硬件配置与场景选择:
| 模型 | 参数量 | 显存需求 | 运行速度 | 准确率 | 适用场景 |
|---|---|---|---|---|---|
| tiny | 39M | ~1GB | 极快 | 一般 | 快速测试、低配置设备 |
| base | 74M | ~1GB | 很快 | 良好 | 日常简短录音 |
| small | 244M | ~2GB | 较快 | 优秀 | 普通会议、短视频 |
| medium | 769M | ~5GB | 中等 | 极佳 | 专业采访、长视频 |
| large | 1550M | ~10GB | 慢 | 完美 | 高精度需求、方言场景 |
| turbo | 809M | ~6GB | 很快 | 完美 | 速度与精度平衡首选 |
推荐配置:日常使用turbo模型,快速转录用base,最高精度用large。
指定模型命令:
# 使用turbo模型(默认推荐)
whisper audio.mp3 --model turbo
# 使用small模型(提速)
whisper audio.mp3 --model small
# 使用large模型(高精度)
whisper audio.mp3 --model large
1.4 核心使用命令与场景实战
1.4.1 基础转录(一键生成全格式文件)
whisper meeting.mp3
运行后自动生成4种文件:
- meeting.txt:纯文本转录结果
- meeting.srt:标准字幕文件
- meeting.vtt:网页字幕文件
- meeting.json:带时间戳结构化数据
1.4.2 指定输出格式与目录
# 仅输出纯文本
whisper audio.mp3 --output_format txt
# 仅输出SRT字幕
whisper video.mp4 --output_format srt
# 输出到指定文件夹
whisper podcast.mp3 --output_dir ./transcripts
1.4.3 语言指定与翻译功能
指定语言可大幅提升识别速度与准确率:
# 中文转录(强烈推荐)
whisper audio.m4a --language Chinese
# 英文转录
whisper audio.mp3 --language English
# 语音翻译为英文(支持多语言转英文字幕)
whisper japanese_video.mp4 --task translate
1.4.4 高级参数提升准确率
# 专业术语提示(技术/行业内容专用)
whisper tech_meeting.mp3 --initial_prompt "以下是人工智能、大模型、深度学习技术会议"
# 固定输出结果(正式文档用)
whisper report.mp3 --temperature 0
# 强制CPU运行(显存不足时)
whisper audio.mp3 --device cpu
1.4.5 批量处理与长音频支持
# Linux/Mac批量转录当前目录所有m4a文件
for f in *.m4a; do whisper "$f" --model turbo --output_dir ./batch_result; done
# Windows11批量处理(PowerShell)
Get-ChildItem -Filter *.mp3 | ForEach-Object {whisper $_.FullName --model turbo}
二、2026年阿里云ECS部署OpenClaw(Clawdbot)完整流程
OpenClaw是开源技能管理平台,可集成Whisper实现可视化操作、批量调度、远程调用,适合团队协同与云端部署。2026年阿里云ECS支持一键部署,搭配百炼API可实现云端大模型赋能,以下是详细步骤。
2.1 阿里云ECS实例准备
- 登录阿里云控制台,进入ECS实例创建页面;
- 选择配置:2核4G以上、系统镜像Ubuntu 22.04、公网IP开启、安全组放行18789端口(OpenClaw默认端口);
- 选择付费方式:测试用按需付费,长期使用包年包月;
- 完成创建,获取公网IP、用户名与密码。
阿里云用户零基础部署 OpenClaw 喂饭级步骤流程
第一步:打开访问阿里云OpenClaw一键部署专题页面,找到并点击【一键购买并部署】。




第二步:打开选购阿里云轻量应用服务器,配置参考如下:
- 镜像:OpenClaw(Moltbot)镜像(已经购买服务器的用户可以重置系统重新选择镜像)
- 实例:内存必须2GiB及以上。
- 地域:默认美国(弗吉尼亚),目前中国内地域(除香港)的轻量应用服务器,联网搜索功能受限。
- 时长:根据自己的需求及预算选择。



第三步:打开访问阿里云百炼大模型控制台,找到密钥管理,单击创建API-Key。

前往轻量应用服务器控制台,找到安装好OpenClaw的实例,进入「应用详情」放行18789端口、配置百炼API-Key、执行命令,生成访问OpenClaw的Token。
- 端口放通:需要放通对应端口的防火墙,单击一键放通即可。
- 配置百炼API-Key,单击一键配置,输入百炼的API-Key。单击执行命令,写入API-Key。
- 配置OpenClaw:单击执行命令,生成访问OpenClaw的Token。
- 访问控制页面:单击打开网站页面可进入OpenClaw对话页面。
阿里云百炼Coding Plan API-Key 获取、配置保姆级教程:
创建API-Key,推荐访问订阅阿里云百炼Coding Plan,阿里云百炼Coding Plan每天两场抢购活动,从按tokens计费升级为按次收费,可以进一步节省费用!
- 购买后,在控制台生成API Key。注:这里复制并保存好你的API Key,后面要用。

- 回到轻量应用服务器-控制台,单击服务器卡片中的实例 ID,进入服务器概览页。

- 在服务器概览页面单击应用详情页签,进入服务器详情页面。

- 端口放通在OpenClaw使用步骤区域中,单击端口放通下的执行命令,可开放获取OpenClaw 服务运行端口的防火墙。

- 这里系统会列出我们第一步中创建的阿里云百炼 Coding Plan的API Key,直接选择就可以。

- 获取访问地址单击访问 Web UI 面板下的执行命令,获取 OpenClaw WebUI 的地址。


2.2 远程连接与环境初始化
使用SSH连接ECS服务器,执行环境配置命令:
# 更新系统
sudo apt update && sudo apt upgrade -y
# 安装Node.js 22.x(必备运行环境)
curl -fsSL https://deb.nodesource.com/setup_22.x | sudo bash
sudo apt install -y nodejs git
# 验证环境
node --version && git --version && npm --version
# 配置npm国内镜像
npm config set registry https://registry.npmmirror.com
2.3 OpenClaw一键安装与初始化
# 官方一键安装脚本
curl -fsSL https://openclaw.ai/install.sh | bash
# 安装完成后初始化
openclaw onboard --install-daemon
# 启动服务
openclaw start
启动成功后,访问http://阿里云公网IP:18789进入Web管理界面。
2.4 阿里云百炼API配置(云端大模型赋能)
- 访问登录阿里云百炼大模型服务平台,进入密钥管理,创建API Key,保存AccessKey ID与AccessKey Secret;
- 进入OpenClaw Web界面,打开设置-模型配置;
- 选择阿里云百炼,填写API Key、地域、模型名称(如qwen3-max-2026-01-23);
- 保存并测试,提示调用成功即配置完成。
命令行配置方式(可选):
# 编辑配置文件
vim ~/.config/openclaw/config.json
# 添加百炼配置
{
"llm": {
"provider": "aliyun-bailian",
"api_key": "你的API Key",
"region": "cn-beijing",
"model": "qwen3-max-2026-01-23"
}
}
# 重启服务生效
openclaw restart
三、OpenClaw本地全平台部署(MacOS/Linux/Windows11)
本地部署OpenClaw可实现完全离线使用,数据不离开设备,适合个人隐私场景,2026年最新安装流程如下。
3.1 MacOS部署流程
3.1.1 前置准备
- 系统版本:macOS 11及以上;
- 安装Xcode命令行工具:
xcode-select --install
3.1.2 一键安装
# 官方脚本
curl -fsSL https://openclaw.ai/install.sh | bash
# 国内镜像(加速)
curl -fsSL https://open-claw.org.cn/install-cn.sh | bash
3.1.3 初始化与启动
openclaw onboard
openclaw start
3.2 Linux部署流程(Ubuntu 20.04+/CentOS 8+)
# Ubuntu安装依赖
sudo apt install -y nodejs git
# CentOS安装依赖
sudo dnf install -y nodejs git
# 一键安装
curl -fsSL https://openclaw.ai/install.sh | bash
# 初始化并启动
openclaw onboard --install-daemon
openclaw start
3.3 Windows11部署流程
3.3.1 前置准备
- 系统:Windows11 64位;
- 以管理员身份打开PowerShell;
- 安装WSL2(可选,提升兼容性):
wsl --install
3.3.2 一键安装
iwr -useb https://openclaw.ai/install.ps1 | iex
3.3.3 启动服务
openclaw start
浏览器访问本地端口即可使用。
3.4 免费Coding Plan API配置
适合编程场景与低成本使用,支持OpenAI兼容格式:
# 编辑配置文件
# Mac/Linux路径:~/.config/openclaw/config.json
# Windows路径:C:\Users\用户名\.config\openclaw\config.json
{
"llm": {
"provider": "openai-compatible",
"api_key": "sk-sp-xxxxxx",
"base_url": "https://coding.dashscope.aliyuncs.com/v1",
"model": "coding-plan-free"
}
}
保存后重启OpenClaw:
openclaw restart
四、OpenClaw集成Whisper Skill实战
部署完成后,可通过OpenClaw可视化界面或对话指令调用Whisper,无需手动输入命令。
4.1 技能安装
skillhub install openai-whisper
4.2 语音转录指令
# 基础转录
帮我转录音频文件 /Users/test/meeting.mp3
# 指定模型与语言
用large模型转录中文音频 /Users/test/interview.m4a
# 生成字幕
把视频文件 /Users/test/video.mp4 转成SRT字幕
4.3 批量任务管理
在Web界面上传多个音频文件,选择模型与输出格式,一键批量转录,支持进度查看与结果下载。
五、本地Whisper与OpenClaw常见问题解决方案
5.1 Whisper常见问题
首次运行极慢
原因:首次自动下载模型文件,大小从150MB-3GB不等。
解决:等待下载完成,后续运行秒启;网络差可手动下载模型放入缓存目录。中文识别不准确
解决:强制指定语言参数 --language Chinese,优先使用turbo/large模型。显存不足报错
解决:降级模型(tiny/base),或添加 --device cpu 强制CPU运行。提示FFmpeg未找到
解决:重新安装FFmpeg,确保系统环境变量配置正确。长音频转录卡顿
解决:Whisper自动分段处理,无需额外操作,硬件允许可升级内存。
5.2 OpenClaw部署常见问题
端口18789被占用
解决:修改配置文件端口,或关闭占用端口的程序。Web界面无法访问
解决:检查防火墙/安全组是否放行18789端口,重启OpenClaw服务。API调用失败
解决:核对API Key、Base URL、模型名称,确保网络连通。安装脚本报错
解决:更新Node.js到22.x版本,清理npm缓存后重新安装。
六、方案对比与使用建议
| 方案 | 成本 | 隐私 | 离线 | 速度 | 适用人群 |
|---|---|---|---|---|---|
| 本地Whisper | 免费 | 极高 | 支持 | 取决于硬件 | 个人、隐私敏感场景 |
| OpenClaw+本地Whisper | 免费 | 极高 | 支持 | 可视化高效 | 个人、小型团队 |
| 阿里云ECS+OpenClaw+百炼API | 低成本 | 高 | 不支持 | 云端高速 | 远程协作、批量处理 |
使用建议:
- 个人日常:Windows11/Mac本地部署OpenClaw+Whisper,完全免费离线;
- 团队协同:阿里云ECS部署OpenClaw,搭配百炼API,远程统一管理;
- 高精度需求:使用large模型,指定中文参数,搭配专业术语提示;
- 低配置设备:使用base/tiny模型,强制CPU运行,保证流畅使用。
七、总结
OpenAI Whisper作为免费本地语音转文字工具,解决了在线工具的隐私、成本、限制等痛点,配合OpenClaw技能平台,实现了可视化操作、批量处理、跨平台部署,大幅降低使用门槛。2026年全平台部署方案成熟,阿里云云端部署与MacOS/Linux/Windows11本地部署均可快速完成,搭配阿里云百炼API与免费Coding Plan API,兼顾离线隐私与云端能力。无论是会议转录、视频字幕、播客整理还是采访归档,均可通过本文流程实现高效、安全、低成本的语音转文字服务,全程无付费、无数据泄露风险,是个人与团队必备的效率工具。