多语言页面排版的坑:从 CJK 折行到 RTL 镜像

简介: 多语言排版三大坑:CJK 折行与禁则、拉丁语系长度爆炸、RTL 整体镜像。逻辑属性+弹性容器+伪本地化测试三件套,上线前暴露九成布局问题。

产品一出海,多语言排版的问题就全冒出来了。中文团队做的界面,一上英文、日文、阿拉伯语,样式碎得亲妈都不认识。这篇把多语言排版的高频坑按语言族梳理一遍。

CJK(中日韩):折行与标点

中文最大的坑是折行规则:word-break: break-all 会把英文单词撕碎,keep-all 又让长中文串撑破容器。正确姿势是 overflow-wrap: anywhere 配合 line-break 微调。日文还有「禁则处理」(标点不能出现在行首/行尾),浏览器默认处理大部分场景,但自定义渲染(canvas、PDF 导出)就得自己接规则库。

另一个隐形坑:中日文混排时的字体顺序。font-family 里 CJK 字体放错位置,日文汉字会渲染成中文字形(「直」「骨」这些字中日字形差异明显),母语用户一眼就看出违和。

拉丁语系:长度爆炸

德语词长是出了名的(Donaudampfschifffahrtsgesellschaft 这种真会出现在 UI 里),英语按钮文字译成德语平均长 35%。防御三板斧:容器用 min-width + flex-wrap 而不是写死宽度;按钮留 40% 长度冗余;超长降级方案(截断加省略号不如换行,但 tooltip 必须给全)。

RTL(阿拉伯语/希伯来):不只是镜像文本

RTL 的常见误解是「把 text-align 改一下」。真做起来是整个布局镜像:逻辑属性(margin-inline-start 替代 margin-left)、图标方向(返回箭头要翻转)、图表坐标轴、甚至动画方向。用 dir="rtl" 加 CSS 逻辑属性是唯一可维护的路,物理属性硬写的项目改 RTL 就是重写。

数字和代码段要保持 LTR 嵌入(unicode-bidi: isolate),不然电话号码、代码片段在 RTL 段落里会乱序。

翻译内容的长度控制

界面文案翻译后的长度波动,最好的防御是在源头上控制:源语言文案短一个词,所有译文都省一口气。翻译完做一轮「伪本地化测试」(把文案替换成加长 40% 的假译文跑一遍 UI),能在上线前暴露 90% 的布局问题。

结语

多语言排版的工程本质是「接受长度和方向的不确定性,把确定性留给布局系统」。逻辑属性、弹性容器、伪本地化测试——这三件套落了,多语言样式问题能减掉大半。

目录
相关文章
|
22天前
|
消息中间件 安全 测试技术
只断言最终态等于放弃中间可测性:把 Behavioral Evaluation 翻译成 pytest 里的 Trajectory
本文介绍Agent测试新范式——行为评估(Behavioral Evaluation):摒弃仅校验最终结果的“outcome-only”方式,转而对工具调用轨迹(Trajectory)进行三层断言——工具选择、调用顺序与参数、过程与结果一致性。通过jsonl落库、pytest回归、CI门禁,实现可复现、可归因、防蒙对的高可信测试,让Agent能力而非运气成为上线依据。
只断言最终态等于放弃中间可测性:把 Behavioral Evaluation 翻译成 pytest 里的 Trajectory
|
5天前
|
缓存
翻译一万字的 token 账:策略不同,账单能差一倍
同样一万字的文档,不同翻译策略的 token 消耗能差一倍以上:整篇直译最省但脆弱,逐段翻多花 50%,分段+术语表+缓存在两者之间取最优。先做缓存、再压提示词、最后调分段。
49 1
|
6天前
|
缓存 人工智能 前端开发
Opus 5.5 生成视频的真相:它不生成视频,是写代码让浏览器逐帧画出来
Opus 5.5 生成视频刷屏,但它压根不生成视频——是写代码让浏览器逐帧画出来的。本文拆解完整渲染管线、四条路线怎么选,以及真实价格账单。
179 1
Opus 5.5 生成视频的真相:它不生成视频,是写代码让浏览器逐帧画出来
|
22天前
|
自然语言处理 安全 测试技术
别再只测『答得对不对』:给大模型应用建一套 Prompt 注入红队回归集,把越权/泄密挡在上线前
本文揭示RAG客服应用因缺乏Prompt注入防护而致系统提示词泄露的事故,指出问题根源在于测试只关注“答得对”,却忽视“会不会答不该答的”。提出将注入测试升级为可回归的红队用例集:结构化存于jsonl,覆盖四类注入;用pytest参数化断言输出、工具调用与拒答行为;接入CI自动拦截。安全不是模型天赋,而是靠可执行、可演进的断言守出来的。
别再只测『答得对不对』:给大模型应用建一套 Prompt 注入红队回归集,把越权/泄密挡在上线前
|
20天前
|
JSON Prometheus 运维
周五 21:47,checkout 又慢了:云监控 MCP 想接住的那二十分钟
阿里云云监控 MCP Cloud 正式发布,提供近 200 项工具,Agentic 能力再进一步:让 Agent 直接查询与管控用云可观测,守护应用稳定运行。
202 13
|
22天前
|
机器学习/深度学习 前端开发
发动机故障诊断智能体(三):特征可分性优化与加权对比投影层
在基础时序编码网络完成对正常工况的压缩表征后,尽管模型具备了提取稳态规律的能力,但在面对多种不同类型的微量气路故障时,潜在空间中的特征分布仍可能存在相互交叠的现象。该组件致力于通过引入度量对比学习机制,在特定的低维投影空间内重塑特征拓扑结构,系统性优化不同故障模式之间的几何可分性。
|
22天前
|
人工智能 自然语言处理 API
觉得阿里云大模型价格太高怎么办?四种便宜购买与使用方法分享
本文针对阿里云大模型“能力强但调用成本高”的普遍痛点,梳理了一套可落地的全链路省钱方案。从开通百炼领取超7000万Tokens新人免费额度起步,叠加夜间错峰4折起的Night Plan活动,再搭配Token Plan订阅与AI通用型节省计划,四层优惠叠加后,实际调用成本可降至普通按量付费的三到五成,帮助个人开发者与团队大幅降低大模型落地的综合开支。
344 10
|
22天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
在AI技术快速落地办公场景的当下,市面上绝大多数智能工具依旧停留在问答对话、文本摘要、简单文案改写层面,只能完成碎片化单点任务。企业员工处理一份完整业务工作时,往往需要同时开启多款工具,文档处理、数据分析、素材创作、网页制作分属不同软件,中间内容需要反复复制粘贴,即便借助通用大模型生成内容,输出成果还需要大量二次格式调整,才能达到交付标准。同时企业内部的数据分散在聊天记录、审批单据、本地文档、业务平台,普通AI工具无法直接读取内部业务信息,每一次任务都要人工复述背景条件,法务、财务、研发这类垂直岗位,还需要编写冗长提示词才能拿到相对可用结果,AI办公落地的实际门槛长期居高不下。千问办公Qwen
520 9
|
22天前
|
机器学习/深度学习 算法 前端开发
发动机故障诊断智能体(二):基础时序压缩与长短期记忆编码网络
在智能体完成气路多航段时序数据的采集与规整后,高维度的原始时序信号需要经过深度表征与降维处理,以消除高频测量噪声并提炼本质物理趋势。采用长短期记忆自编码器架构,在脱离人工标签监督的情况下,利用海量正常运行数据进行自监督重构训练,构建出能够压缩并表征发动机稳态工况与退化趋势的时序特征提取模型。

热门文章

最新文章