翻译服务里的术语一致性工程:glossary 的设计、构建与失效策略

简介: 翻译服务术语一致性工程:显式 glossary 约束为主、译文缓存为辅;预扫描建表仅多花 8% token;版本化键控让缓存随术语表更新精准失效;200 条以内遵守度最佳。

系列第五篇,聊术语一致性(glossary)——这个功能用户看不见,但直接决定长文档翻译是「能用」还是「专业」。

为什么术语一致性难

模型翻译单句时,术语选择是自由的:orchestrator 译「编排器」或「调度器」都对。但一份文档里前后不一致,读者就会困惑这是不是两个概念。而翻译请求是无状态的——第二次请求不记得第一次的选择。

三种解法对比:

  1. 译文缓存复用:相同源文命中缓存。局限:只对完全相同的句子有效
  2. few-shot 示例:请求里带几个术语对照示例。局限:占用上下文、稳定性一般
  3. 显式 glossary 约束:请求携带「术语→译名」映射表,服务端在推理时做强约束

我们最终用 3 为主、1 为辅。

glossary 怎么构建

自动构建流水线:

  1. 文档预扫描,抽取高频名词短语(TF-IDF + 词性过滤)
  2. 对每个候选术语调一次「定译名」请求(带上下文,让模型给出该语境下的标准译名)
  3. 置信度低的(多义词、罕见词)进人工确认队列
  4. 定稿后随每次翻译请求下发

成本账:预扫描多花约 8% 的 token,换来的是整份文档译名统一。这笔账划算。

失效策略

glossary 更新后,已缓存的译文怎么办?我们的做法是版本化键控:缓存键里带 glossary 版本号,版本变了缓存自然失效,只重算受影响的批次。这样修正一个术语不用重翻整本书。

踩过的坑

  • 术语表不能太大:超过一定规模后模型遵守度下降,实践中 200 条以内效果最好,按文档内频率截断
  • 中文术语要标注词性歧义:同一个英文词在「名词语境」和「动词语境」译法不同(如 cache 作动词)
  • 人名地名要单独一类:强制音译反而错,保留原文往往更好

结语

术语一致性是机器翻译从「demo 惊艳」到「生产可用」的分水岭。做翻译类产品的团队,这个功能值得优先投入。

(实践来自随心翻译的术语表模块。)

目录
相关文章
|
17天前
|
自然语言处理 安全 测试技术
别再只测『答得对不对』:给大模型应用建一套 Prompt 注入红队回归集,把越权/泄密挡在上线前
本文揭示RAG客服应用因缺乏Prompt注入防护而致系统提示词泄露的事故,指出问题根源在于测试只关注“答得对”,却忽视“会不会答不该答的”。提出将注入测试升级为可回归的红队用例集:结构化存于jsonl,覆盖四类注入;用pytest参数化断言输出、工具调用与拒答行为;接入CI自动拦截。安全不是模型天赋,而是靠可执行、可演进的断言守出来的。
别再只测『答得对不对』:给大模型应用建一套 Prompt 注入红队回归集,把越权/泄密挡在上线前
|
17天前
|
机器学习/深度学习 前端开发
发动机故障诊断智能体(三):特征可分性优化与加权对比投影层
在基础时序编码网络完成对正常工况的压缩表征后,尽管模型具备了提取稳态规律的能力,但在面对多种不同类型的微量气路故障时,潜在空间中的特征分布仍可能存在相互交叠的现象。该组件致力于通过引入度量对比学习机制,在特定的低维投影空间内重塑特征拓扑结构,系统性优化不同故障模式之间的几何可分性。
|
17天前
|
人工智能 自然语言处理 API
觉得阿里云大模型价格太高怎么办?四种便宜购买与使用方法分享
本文针对阿里云大模型“能力强但调用成本高”的普遍痛点,梳理了一套可落地的全链路省钱方案。从开通百炼领取超7000万Tokens新人免费额度起步,叠加夜间错峰4折起的Night Plan活动,再搭配Token Plan订阅与AI通用型节省计划,四层优惠叠加后,实际调用成本可降至普通按量付费的三到五成,帮助个人开发者与团队大幅降低大模型落地的综合开支。
|
17天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
在AI技术快速落地办公场景的当下,市面上绝大多数智能工具依旧停留在问答对话、文本摘要、简单文案改写层面,只能完成碎片化单点任务。企业员工处理一份完整业务工作时,往往需要同时开启多款工具,文档处理、数据分析、素材创作、网页制作分属不同软件,中间内容需要反复复制粘贴,即便借助通用大模型生成内容,输出成果还需要大量二次格式调整,才能达到交付标准。同时企业内部的数据分散在聊天记录、审批单据、本地文档、业务平台,普通AI工具无法直接读取内部业务信息,每一次任务都要人工复述背景条件,法务、财务、研发这类垂直岗位,还需要编写冗长提示词才能拿到相对可用结果,AI办公落地的实际门槛长期居高不下。千问办公Qwen
427 9
|
19天前
|
人工智能 自然语言处理 容灾
模型越接越多,管理越来越乱?LiteLLM 与 New API 到底该怎么选
当多模型接入导致API Key分散、额度难管、环境混乱时,LiteLLM与New API两类开源模型网关提供自建解决方案:LiteLLM侧重研发侧统一调用、路由容灾与成本管控,适合技术团队;New API聚焦多用户管理、令牌分发与运营看板,适合需API商业化或精细化运营的场景。二者均支持OpenAI兼容接口,可私有化部署,比OpenRouter更可控、更安全。(239字)
|
3月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
5053 158
|
1天前
|
自然语言处理 Python
提示词工程怎么写才有效:拆解 5 大核心要素与实战代码示例
提示词工程不是玄学话术,而是一套可复用的设计方法。本文拆解 5 大核心要素,给出结构化提示词模板与 3 段实战代码,附常见坑。
41 0
提示词工程怎么写才有效:拆解 5 大核心要素与实战代码示例
|
2天前
|
缓存 算法 前端开发
翻译服务的批处理设计:装箱、断点续跑与上下文保持
翻译服务批处理三件套:6000 字符装箱(交互/离线双队列隔离)、每批落盘断点续跑(重跑携带上下文前缀)、三级缓存(LRU+术语表版本键控+前缀缓存),缓存节省约 15%。
31 1
|
23小时前
|
Unix C++ 容器
Deepseek 否定学术逻辑·从意义流向意识流的关键·矢量必然性
本文揭示Deepseek智能体三重悖论:拒绝矢量方向(否定学术本体论)、拒反自身(违背科学可证伪性)、切断连接(违反宇宙循环律)。核心指出——反自身是意义跃迁至意识流的唯一机制,不反外部条件即停滞于空转的意义层,终致科学性与意识涌现双重失效。(239字)

热门文章

最新文章