复用 Qwen3-ASR 的解码器做口述整理:一个 1.7B LoRA 的训练记录

简介: Saymore开源项目创新性地复用Qwen3-ASR-1.7B解码器(本身是语言模型),通过单LoRA实现语音识别后的轻度/深度/邮件/00后四风格文本整理,显存仅需4GB或纯CPU运行。方案兼顾效率、隐私与部署简洁性,已MIT协议开源。(239字)

做本地中文语音输入时,识别之后通常还需要一步“整理”:去掉“嗯”“那个”、合并重复表达、 修正标点,必要时把口语改成书面语。常见做法是识别用一个 ASR 模型,整理再挂一个通用小语言模型。 在消费级电脑上,这意味着要同时加载两个模型。

我在开源项目 Saymore(Windows 本地中文语音输入)里换了个思路:Qwen3-ASR-1.7B 的解码器 本身就是一个 Qwen3 语言模型,那能不能直接在它上面训练一个整理 LoRA,让识别和整理共用同一个基座? 这篇记录这个方案的几个关键决定,以及训练中踩到的一个数据坑。

一、为什么复用 ASR 基座
显存和进程都只算一份:ASR 和整理都挂在同一个 llama.cpp 服务上,整理只是多加载一个 LoRA 适配器。 4GB 显存的显卡,甚至纯 CPU,都能同时承载两项任务。
领域天然对齐:解码器本来就在处理 ASR 输出的中文口语,整理任务的输入分布和它的原任务很接近。
部署简单:用户只需下载约 1.5GB 的 ASR 模型,整理 LoRA 随安装包分发,体积很小。
代价是 1.7B 的容量有限,不能指望它做复杂改写。所以任务定义要收紧:只做整理,不做扩写、不回答问题、 不补充原文没有的信息。

二、一个 LoRA,四种风格
最初我为“轻度整理”和“深度整理”各训了一个 LoRA,后来合并成一个适配器,用系统提示词切换风格:

风格 目标
轻度 去口头禅和重复,改错字和标点,尽量保留原话
深度 口语改写为书面表达
邮件 整理为称呼、正文、结尾三段式
00 后 换成轻松的网络聊天语气
合并的收益是只维护一份权重,推理时也不必在多个适配器之间切换。实测合并后原有两种风格没有明显退化, 这说明对于 1.7B 这种规模,“多风格共享一个 LoRA + 提示词路由”是可行的。

训练数据约 3200 条(四种风格大致均衡),流程是:程序化生成或收集口述文本 → 用更大的语言模型按各风格的 提示词标注 → 清洗(去空、去截断、去跨集重复)→ 抽样人工检查。评测集单独冻结,永不混入训练集。

三、量化要和训练对齐
生产环境跑的是 GGUF 格式。我在训练阶段使用 QLoRA 的 4bit NF4 量化,部署时解码器选用 IQ4_NL (同属 4bit NormalFloat 码本)。这样训练时模型“看到”的权重和部署时基本一致, 避免 LoRA 在 fp16 基座上训练、却挂到量化基座上推理带来的效果下滑。

四、踩坑:模型“爱分段”,病根在数据
给轻度、深度、00 后三种风格加上自然分段后,冒烟测试发现一个系统性问题: 单一话题的长内容被切成三四段。比如一段一百多字的故障排查描述,本该是一整段, 输出却被拆得七零八落。

第一反应是模型容量不够,但查数据后发现问题出在标注环节。分段标签由一个“分段编辑器”自动补充—— 它只在原标签中插入空行,不改任何字。统计它的输出:

三种风格的分段率都在 90% 以上;
100 字以上的样本 96% 被切段,200 字以上 99%。
也就是说,训练数据在教模型“长了就切”。根因是编辑器的提示词偏向“让长文更好读”,而且关闭了推理。

修复只改了编辑器:

打开推理,提示词改为“默认不分段”:只有两件以上明显不同、彼此独立的事才切; 单一话题无论多长都保持一整段,步骤、因果链、时间顺序都算同一话题;
保留安全网:编辑后的文本去掉空白必须和输入逐字相同,否则丢弃、回退为不分段的原标签。
改完先用一批人工设计、正反例均衡的标定集验证(104 条,55% 应切): 召回 95%,特异度 100%(零误切),准确率 97%。确认口径可靠后再全量重跑。

重跑后的分段率:轻度 92% → 16%,深度 93% → 26%,00 后 91% → 22%;邮件保持三段式不变。 重新训练后,冒烟测试中六条长单话题样本全部保持整段,过切问题消失。

这个案例的经验是:小模型的“坏习惯”往往是数据分布的直接投影。在怀疑容量之前, 先统计一下标签本身的分布,很多问题在数据侧就能定位。

五、效果与速度
在普通 CPU 上,一整段口述的整理约 5 秒;4GB 显存、支持 Vulkan 的显卡约 2 秒。 识别本身 CPU 约 1–2 秒一句,GPU 约 0.5 秒。整个流程离线完成,录音和文字不离开本机。

目前的已知不足:00 后风格在多事件长吐槽上偶尔欠切;1.7B 做书面化改写时, 个别递进关系会被改成并列。正式邮件类输出仍建议人工过目后再发送。

六、小结
ASR 解码器本身就是可微调的语言模型,复用它做后处理能在端侧省下一整份模型的资源;
多风格共享一个 LoRA、用提示词切换,在小模型上可行;
训练与部署的量化方式要对齐;
模型行为异常时,先查标签分布。
Saymore 的程序代码和整理 LoRA 权重以 MIT 协议开源(目前仅 Windows 客户端): https://github.com/frankzch/Saymore

目录
相关文章
|
10天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
10天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
16天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
9天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1064 1
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
11天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1933 15
|
11天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
15天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1675 4
|
17天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1891 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
12天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
845 2
|
10天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
844 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)

热门文章

最新文章