Transformer 深入浅出:从问题推导到大语言模型核心架构

简介: ransformer 是现代大语言模型(Large Language Model, LLM)的核心基础架构,其提出改变了传统自然语言处理依赖循环神经网络(RNN)的发展路线。本文从工程问题出发,逐步推导 Transformer 的设计思想,而不是简单罗列 Attention、Q/K/V 等概念。文章首先分析传统序列模型在长距离依赖和并行计算方面的限制,引出 Self-Attention 机制的核心目标:让每个 token 根据上下文动态获取相关信息。随后深入解析 Transformer 的关键组成部分,包括 Token Embedding、位置编码(Position Encoding)、S

Transformer 深入浅出:从问题推导到大语言模型核心架构

从一个问题开始理解 Transformer,而不是背 Q/K/V、Attention 公式。

1. 为什么需要 Transformer?

在 Transformer 出现之前,NLP(自然语言处理)主要依赖 RNN、LSTM 等循环神经网络。

例如:

我昨天去了银行办理贷款。

传统 RNN 的处理方式:

我
↓
昨天
↓
去
↓
银行
↓
办理
↓
贷款

模型需要按照顺序逐个读取。

这种方式存在两个核心问题:

问题 1:无法充分并行

GPU 擅长矩阵计算,但是 RNN 必须:

第1个词处理完成
        ↓
第2个词处理
        ↓
第3个词处理

前一个时间步完成之前,后一个无法开始。

因此训练效率较低。


问题 2:长距离依赖困难

例如:

我小时候住在北京,后来去了很多城市,二十年后我又回到了这里。

模型需要知道:

这里
↓
北京

二者距离很远。

RNN 需要经过很多计算步骤传递信息,容易丢失。

因此出现一个核心问题:

一个词如何直接关注句子中其他相关的词?

这就是 Attention 的来源。


2. Transformer 的核心思想

Transformer 的核心:

让每个 token 根据当前上下文,动态决定应该关注哪些 token。

例如:

我 去 银行 办理 贷款

理解:

银行

时:

模型发现:

办理
贷款

和它关系更强。

于是:

银行
+
办理
+
贷款

共同决定“银行”的当前含义。

这就是:

Contextual Representation
上下文表示

同一个词:

bank

在不同句子:

I went to the bank.

I sat near the bank of the river.

会产生不同含义。


3. 输入:文字如何进入 Transformer?

计算机不能直接理解:

银行

所以第一步:

Tokenization

文本:

我喜欢人工智能

转换:

token1 token2 token3

然后:

Embedding

每个 token 转换成向量:

银行

↓

[0.21, -0.53, 0.88 ...]

假设:

d_model = 768

那么:

一个 token:

768维向量

一句话:

seq_len × d_model

例如:

10 × 768

4. 为什么需要 Position Encoding?

Attention 有一个特点:

它只关心 token 之间的关系。

但是:

我打你

和:

你打我

如果没有位置信息:

模型不知道顺序。

因此 Transformer 加入:

Position Encoding

最终输入:

Token Embedding
+
Position Information

告诉模型:

这个词是什么
+
这个词在哪里

现代大模型中常见:

RoPE
Rotary Position Embedding

也是为了解决位置信息问题。


5. Self-Attention:Transformer 的核心

Attention 解决的问题:

当前 token 应该关注哪些 token?

例如:

我 去 银行 办理 贷款

处理:

银行

时,需要判断:

我
去
银行
办理
贷款

哪个重要。

于是产生:

Q
K
V

6. Q、K、V 到底是什么?

不要把 Q/K/V 理解成三个输入。

它们来自同一个输入:

X

通过三个不同的线性变换:

Q = XWq

K = XWk

V = XWv

其中:

Wq
Wk
Wv

都是模型训练出来的参数。


Query

表示:

我想寻找什么信息?

例如:

银行:

我想知道哪些词和我的金融含义相关?

Key

表示:

我是什么类型的信息?

例如:

贷款:

我是金融相关信息

Value

表示:

如果关注我,我提供什么内容?


所以 Attention 的流程:

Q
↓
和所有 K 比较
↓
得到相关程度
↓
根据权重读取 V

7. Attention 公式解析

公式:

$$ Attention(Q,K,V) = softmax ( \frac{QK^T}{\sqrt{d_k}} )V $$

拆开:

第一步:QKᵀ

计算:

Query
和
所有 Key

的相似度。

得到:

token之间的关系矩阵

例如:

        我 去 银行 办理 贷款

我

去

银行

办理

贷款

每个位置代表:

一个 token 对另一个 token 的关注程度

第二步:Softmax

把分数转换成概率:

例如:

办理   25%
贷款   60%
银行   7%

表示:

银行主要关注:

贷款
办理

第三步:加权求和 V

最终:

银行的新表示

=

0.25×办理信息

+

0.60×贷款信息

+

其他信息

于是:

原来的:

银行

变成:

和金融业务相关的银行

8. 为什么需要 Multi-Head Attention?

一个 Attention 只能观察一种关系。

但是语言包含很多关系:

例如:

小明因为小红生病,所以他去医院看她。

同时存在:

他 → 小明

她 → 小红

医院 → 生病

因此 Transformer 使用:

Multi-Head Attention

多个注意力头:

Head 1
关注语法

Head 2
关注指代

Head 3
关注语义关系

最后:

Concat

↓

Linear

融合。

注意:

模型并没有人为规定:

Head1一定学语法

这些关系是训练过程中自动形成的。


9. FFN:Attention 后为什么还需要它?

这是很多人容易误解的地方。

Attention:

负责信息交换。

FFN:

负责信息加工。

例如:

Attention:

银行
获得:

贷款信息
办理信息

但是这些只是收集来的信息。

FFN 进一步处理:

贷款
+
办理
+
银行

↓

形成更高级特征

↓

金融行为

FFN 结构:

输入
 ↓
Linear
 ↓
激活函数
 ↓
Linear
 ↓
输出

通常:

768维

↓

3072维

↓

768维

为什么扩大?

因为更高维空间可以学习更多复杂组合。


可以这样记:

Attention:
我应该看谁?

FFN:
看完之后,我应该如何理解?

10. Residual Connection 为什么存在?

Transformer 很深:

Block1
↓
Block2
↓
Block3
...

容易:

  • 信息丢失
  • 梯度消失

所以加入残差:

普通:

x
↓
Layer
↓
y

残差:

x --------┐
          ↓
Layer(x) + x

公式:

$$ output=x+F(x) $$

意思:

新学习的信息建立在原信息基础上。


11. LayerNorm 的作用

深层网络中:

不同层的数据分布可能变化。

LayerNorm:

帮助:

  • 稳定训练
  • 加速收敛
  • 防止数值异常

简单理解:

调整数据分布
让网络更容易学习

12. 一个 Transformer Block 的完整结构

输入

↓

Self Attention

↓

Residual

↓

Normalization

↓

FFN

↓

Residual

↓

Normalization

↓

输出

大量堆叠:

Block 1

↓

Block 2

↓

Block 3

↓

...

↓

Block N

形成大型语言模型。


13. 为什么高层表示更加抽象?

不是因为:

第1层负责语法

第30层负责推理

这种固定划分。

真实情况:

每一层都在:

Attention
+
FFN

不断加工。

简单理解:

低层:

词之间的关系

中层:

关系组合

高层:

更复杂的语义模式

例如:

第一层:

银行
关注
贷款

中间层:

银行 + 贷款 + 办理

更高层:

用户正在进行金融行为

14. Decoder-only 为什么成为 GPT 的主流?

Transformer 最初:

Encoder
+
Decoder

例如翻译任务。

后来发现:

很多任务只需要生成。

于是出现:

Decoder-only

代表:

GPT
Llama
Qwen
DeepSeek

它的特点:

只能看到过去:

我 今天 去

不能看到未来:

银行

因此使用:

Causal Mask

保证:

预测当前 token 时不能偷看答案。


15. GPT 如何生成文本?

输入:

中国的首都是

流程:

Tokenizer

↓

Embedding

↓

Transformer

↓

Hidden State

↓

Linear

↓

Vocabulary概率

得到:

北京 0.9

上海 0.02

广州 0.01

选择:

北京

然后:

中国的首都是北京

继续预测。

这叫:

Autoregressive Generation
自回归生成

16. 为什么只预测下一个 token,却能产生智能?

核心:

预测任务很简单,但是为了预测准确,模型必须学习复杂规律。

例如:

预测:

法国的首都是

需要知道:

法国
国家实体

首都
城市关系

巴黎
对应知识

预测:

def binary_search():

需要知道:

代码结构

算法逻辑

变量关系

预测:

小明有3个苹果,又买2个,一共有

需要知道:

数学推理过程

因此:

next-token prediction

↓

学习语言规律

↓

学习世界规律

↓

形成语义表示

↓

产生复杂能力

17. Transformer 与 LLM 的完整链路

最终:

文本

↓

Tokenizer

↓

Embedding

↓

Position Encoding

↓

Transformer Blocks

    ↓

Self Attention

    ↓

FFN

    ↓

Residual + Norm


↓

Hidden State

↓

LM Head

↓

下一个 Token

↓

循环生成

18. 最终理解框架

不要记:

Transformer = QKV + Softmax

应该记:

文字无法计算
        ↓
Embedding

词没有上下文
        ↓
Attention

不知道位置
        ↓
Position Encoding

信息需要加工
        ↓
FFN

网络需要稳定训练
        ↓
Residual + Norm

不断堆叠
        ↓
Transformer

预测下一个token
        ↓
LLM

一句话总结:

Transformer 本质是一种通过 Self-Attention 建立 token 之间关系,并通过 FFN 进行特征加工的深度神经网络架构。大型语言模型利用大量文本训练这个架构,使其在预测 token 的过程中学习到语言、知识、代码和复杂任务模式。

相关文章
|
8天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
7382 12
|
6天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1545 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
7天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
998 8
|
3天前
|
人工智能 JavaScript 芯片
DeepSeek 官方偷偷上传 Harness 桌面端安装包,我已经用上了。。附最新下载地址
DeepSeek Harness 官方的桌面端安装包被网友扒出来了,2 分钟讲明白如何使用,体验如何,适合作为 AI 编程工具么?附最新 Windows 和 Mac 双端的下载地址
1196 1
|
20天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3579 10
|
15天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1611 1
|
4天前
|
编解码 缓存 PyTorch
16G 显卡能跑 Qwen-Image 2.1 吗?
9月20日,阿里Qwen开源Qwen-Image-2.1:7B DiT图像模型+8B文本编码器+VAE,单模型支持文生图与图像编辑,原生输出2K PNG(含Alpha通道),支持10张参考图。在自建Qwen-Image-Bench达60.28分(开源模型第一),GenAI Showdown文生图排名7/15。16G显存可跑1024×1024(需INT8量化+ComfyUI优化),但2K需24G以上。注意其Qwen Research License限非商业用途。
506 1
|
5天前
|
人工智能 编解码 并行计算
MiniMax-H3 一键整合包技术文档:8G 显存运行 AI 漫剧制作 —— 角色替换 / 动作迁移 / 文图生视频部署与调参指南
MiniMax H3 是 MiniMax 开源的全模态视频生成模型,支持文/图/音/视多条件输入,输出最高2K、15秒带双声道音频视频。本文档详述其Int8量化版在8GB显存下的本地一键部署、三段式工作流(EDIT/REPLACE/CONTINUE)、参数调优及常见问题排查。(239字)

热门文章

最新文章