OPC中国科普:Embedding、向量与语义检索,AI 为什么能“看懂相近意思”?

简介: 本文深入浅出解析RAG核心技术:Embedding将文本转为语义向量,实现“意思相近即匹配”;向量检索初筛相关片段,关键词检索保障专有名词精准命中,重排序精调结果顺序——三者协同提升召回率与准确性,让知识库真正懂业务、答得准。

aliyun-embedding-science-cover.png

在 RAG、知识库、智能客服等场景中,“向量”“相似度”“召回”“重排序”经常成套出现。它们并不是玄妙的新术语,而是在解决一个很朴素的问题:怎样从大量资料里,先找出最可能回答当前问题的少数几段。

一、从关键词匹配到语义相似

传统搜索很擅长找“字面上相同”的内容。输入“订单取消”,包含这两个词的文档会优先被找出。它简单、快速、可解释,但遇到同义表达时会有局限:

  • 用户说“退掉刚买的商品”,文档写“订单撤销”;
  • 用户说“忘了密码怎么办”,文档写“账号凭证重置”;
  • 用户使用口语、简称或错别字。

语义检索试图补足这一点。它不只看词是否一样,也尝试判断两段文字表达的含义是否接近。Embedding,通常译作“向量化”或“嵌入”,就是把文本转换成一串数值的过程。

二、什么是 Embedding?

可以把 Embedding 想象成给每段文本分配一个很长的坐标。现实中的地图用二维坐标标识位置;文本向量通常有数百甚至更多维度,人无法直接画出来,但计算机可以比较这些坐标之间的距离或夹角。

经过训练的向量模型,会让语义相近的文本在“向量空间”里更靠近,让差异较大的文本更远离。于是:

“取消订单的条件”   → 一个向量

“订单撤销流程说明” → 另一个相近向量

“如何修改头像”     → 一个较远向量

这里有一个重要边界:向量不是文本的加密副本,也不是模型“理解一切”的证明。它是从文本中提取的一种数值表示,擅长比较相关性,却不天然保证事实正确、时间最新或权限合规。

三、RAG 中的向量检索到底在做什么?

aliyun-embedding-science-diagram.png

一个典型流程可以拆成六步:

  1. 文档切分:把长文档拆成适合检索的片段;
  2. 文档向量化:为每个片段生成并保存向量;
  3. 问题向量化:用户提问时,用同类模型把问题也转成向量;
  4. 近邻搜索:在大量文档向量中找出与问题最接近的一批候选片段;
  5. 重排序:对候选片段做更细致的相关性判断;
  6. 生成回答:把少数高相关片段连同问题交给大模型组织答案。

阿里云百炼的知识检索服务采用的就是类似的分层思路:可先做 Query 改写,再结合向量检索、关键词检索与排序模型,最后返回按相关性排序的切片。阿里云百炼:知识检索

四、为什么长文档要先切分?

一份 100 页的操作手册通常不会整体变成一个向量。因为“整本书”里包含太多主题,最终向量会过于宽泛,难以对应一个具体问题。

更合理的做法是按标题、段落或固定长度切成多个片段,再为每个片段生成向量。用户问“退款时限”时,系统就有机会找出“退款规则”那一段,而不是把整份手册塞给模型。

但切分也不能太随意:

  • 太长:一个片段包含多个主题,检索会变模糊;
  • 太短:必要的上下文被拆开,片段本身读不懂;
  • 无重叠:刚好跨越边界的关键信息容易丢失;
  • 全靠固定字数:标题、表格、代码块等结构可能被破坏。

因此,好的切分不是追求某个固定长度,而是尽量让每个片段表达一个相对完整的小主题。

五、相似度高,就一定相关吗?

不一定。向量检索是“先筛选”,不是最终裁判。

例如,用户问“取消已发货订单”,系统可能召回“未发货订单取消规则”,因为两者主题高度接近;但关键条件“已发货”不同,结论可能完全不同。又如,文档里有历史政策和新政策,旧版本也可能因表达相似而被召回。

这就是重排序(Rerank)的价值。它会对初步召回的一小批候选片段进行更细的比较,把真正更贴合问题的内容排到前面。百炼的向量与重排序模型说明中提到,重排序可在 Embedding 检索之后对 Top-N 结果重新排序,以提高 RAG 的检索精度。向量与重排序模型

在实践里,还常会加入关键词匹配、字段过滤、时间范围和权限过滤。因为有些条件并非“语义接近”就能替代,例如产品型号、合同编号、日期和用户所属部门。

六、向量检索、关键词检索和重排序如何分工?

方法 擅长什么 容易忽略什么
关键词检索 精确名称、型号、编号、专有名词 同义表达与口语化提问
向量检索 语义相近、表达多样的问题 精确条件、版本差异、时间变化
重排序 从候选中挑出更相关的片段 候选集里根本没有正确内容

三者组合通常比只依赖其中一种更稳。关键词保证精确约束不被忽略;向量扩大语义召回范围;重排序负责精细筛选。百炼知识库也支持向量召回数、相似度阈值、排序模型与字段过滤等配置,以适配不同资料类型和检索要求。阿里云百炼:知识库

七、检索错了,先检查哪里?

当 RAG 回答不理想时,很多人会先改提示词。提示词当然重要,但检索问题常常更早发生。可以按这条顺序排查:

  1. 资料是否存在:知识库里是否真的有答案,且版本最新?
  2. 切分是否合理:关键句是否被拆散,标题是否和正文一起保留?
  3. 查询是否明确:用户的“它”“那个”是否需要结合多轮上下文改写?
  4. 候选是否正确:初步召回里有没有真正相关片段?
  5. 排序是否准确:正确片段是否被排到足够靠前的位置?
  6. 模型是否忠实回答:模型是否基于证据作答,而不是自行补全?

这个顺序很重要:如果正确资料从未被召回,再好的生成模型也无法凭空引用它。

八、Embedding 不是只用于文本

向量化也可以用于图片、音频等多模态内容。核心思想不变:把不同类型的内容转换为可比较的数值表示,再做相似度检索。

例如,图片知识库可以从一张图片中提取特征并保存向量;之后用户用文字描述或另一张图片发起查询,系统便能尝试找到风格、对象或语义相近的内容。阿里云百炼知识库支持文本、图片等不同来源,并可使用多模态向量能力进行检索。知识库与多模态向量说明

不过,跨模态检索同样需要明确业务标准:所谓“相似”是颜色相近、商品类别相近,还是使用场景相近?不同目标需要不同数据和评测方式。

九、三个常见误解

误解 1:向量维度越高,检索一定越好

不一定。维度只是表示容量的一部分。数据质量、切分方式、模型适配性、排序和过滤策略都会影响结果。

误解 2:相似度分数可以当作绝对真相

不可以。分数更适合在同一配置下比较候选结果,而不是脱离业务语境给出“正确或错误”的唯一判定。

误解 3:有向量检索就不需要维护文档

不可以。过期、矛盾、重复或没有权限控制的资料,会被更高效地检索出来,却不会因此变得更可信。

结语

Embedding 让文本能够以“语义接近度”的方式被比较;向量检索负责从海量资料里初步找线索;重排序和业务过滤再帮助系统把线索变成更可靠的证据。

对 OPC中国 而言,理解这些基础概念的意义不在于亲手实现一个向量数据库,而在于知道 RAG 什么时候值得信任、什么时候需要继续核验。检索系统最理想的状态,不是“永远猜对”,而是能把相关证据准确地送到模型和用户面前。


延伸阅读

目录
相关文章
|
8天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2259 12
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
8天前
|
云安全 人工智能 安全
|
8天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1018 2
|
8天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
1044 0
|
10天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1018 44
|
7天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
501 1
|
6天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
565 0
|
10天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
700 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南

热门文章

最新文章