搞懂这 20 个Transformer 问题,你就是人工智能大牛

简介: 搞懂这 20 个Transformer 问题,你就是人工智能大牛

1.请阐述Transformer能够进行训练来表达和生成信息背后的数学假设,什么数学模型或者公式支持了Transformer模型的训练目标?请展示至少一个相关数学公式的具体推导过程。(贝叶斯公式、极大似然估计、KL散度、交叉熵、矩阵空间转换等)


2.Transformer中的神经网络为何能够很好的表示信息?请从数学和工程实践的角度展开具体的分析


3.请从Data Science的角度分析为何Transformer是目前最generic的AI模型?


4.请分析一下是什么能够从根本上限制Transformer的能力?


5.Transformer在通用语言领域(例如,整个英语语言领域)能否实现Word Analogy功能,请分析具体的工程原因和数学原因


6.为何说Transformer是一种理想的Bayesian模型实现?请阐述数学原理及具体的场景案例


7.为何说Transformer是目前人工智能领域工程落地实践Bayesian理论的典型?请从数学的的角度进行完整的证明(至少包含Encoder-Decoder、Training、Inference等对Bayesian Theory的具体实现)


8.在Gavin看来,“Transformer赋予机器思想。Transformer是实现多模态目前最佳的底层引擎,是人工智能、贝叶斯理论、认知模型演进的统一架构,是学术界(无意间)基于Bayesian理论通过神经网络实现的(计算机)认知模型持续的Evolving的理想架构体系”,你怎么看?


  1. 请从数学和架构的角度分析一下Transformer是如何通过使用Bayesian 理论中的 marginal probability 来完成信息更丰富和立体的表达的?


10.请描述一下你认为的把self-attention复杂度从O(n2) 降低到 O(n)有效方案


11.使用BPE (Byte-Pair Encoding) 进行Tokenization对于Cross-lingual语言模型的意义是什么?是否会有问题及如何改进?


12.如果使用Transformer对不同类别的数据进行训练,数据集有些类别的数据量很大(例如有10亿条),而大多数类别的数据量特别小(例如可能只有100条),此时如何训练出一个相对理想的Transformer模型来对处理不同类别的任务?


13.如何使用使用多种类小样本对Transformer训练而取得很好的分类效果,请详述背后的架构设计和数学机制


14.更深更宽的Transformer网络是否意味着能够获得更强的预训练模型?请至少从3个角度,例如架构的工程化落地、参数的信息表达能力、训练任务等,来展开具体的分析


15.为什么说Transformer的注意力机制是相对廉价的?注意力机制相对更对于RNN系列及Convolution系列算法而言在计算上(尤其是计算复杂度)有什么优势?


16.为何训练后的BERT模型不能够很容易的实现模型泛化?请从架构机制和数学原理部分进行分析


17.GPT的auto-regressive语言模型架构在信息表示方面有什么架构上的缺陷?具体如何改进?


18.请描述Transformer中Decoder的Embedding layers架构设计、运行流程和数学原理


19.为何Transformer的Matrix Dimensions是3D的?每个Dimension大小的改变是如何影响整个Transformer训练过程的?请详述其具体的流程和数学原理


20.请描述Transformer的Training Loss具体工作流程和背后的数学公式


这些问题源自 Gavin 老师, 关于 Transformer 和注意力机制提出的问题可以查看 Gitee Transformer101Q


标签:Transformer,注意力机制,Attention机制,Transfomer课程,Transformer架构,Transformer模型,对话机器人,NLP课程,NLP,自然语言处理,知识图谱,命名实体识别


目录
相关文章
|
机器学习/深度学习 算法 自动驾驶
计算机视觉面试中一些热门话题整理
通常在机器学习面试中,问完常见基础知识的技术问题之后会有具体的项目问题的讨论,所以这里准备了一些项目相关的话题,以可以帮助你准备和通过计算机视觉相关的面试。
105 0
|
机器学习/深度学习 人工智能 分布式计算
数据科学、人工智能与机器学习傻傻分不清楚,看这篇就够了
数据科学、人工智能与机器学习傻傻分不清楚,看这篇就够了
308 1
数据科学、人工智能与机器学习傻傻分不清楚,看这篇就够了
|
机器学习/深度学习 人工智能 资源调度
机器学习入门与实战:克服AI的幻想
  与许多其他技术一样, Al和机器学习都有非常梦幻以及时髦的用法。例如,有些人使用机器学习从照片创建毕加索风格的艺术品。当然,这种用法带来很多问题。一方面,除了赶时髦(因为以前没有人这么弄过) ,是否有人真的想要以这种方式来创建毕加索作品是值得怀疑的。艺术的价值并不在于对特定的现实世界表现做出一个有趣的解释,而在于理解艺术家是如何进行诠释的。文章的结尾指出,计算机在现阶段只能复制已有的风格,而不是创造它自己的全新风格。下面将讨论Al和机器学习的各种奇幻应用。
171 0
|
机器学习/深度学习 人工智能
AI工程师面试知识点:神经网络相关
AI工程师面试知识点:神经网络相关
AI工程师面试知识点:神经网络相关
|
机器学习/深度学习 人工智能 自然语言处理
重磅!花书《深度学习》,这份精炼笔记可能是最全面的
重磅!花书《深度学习》,这份精炼笔记可能是最全面的
1848 0
重磅!花书《深度学习》,这份精炼笔记可能是最全面的
|
存储 人工智能 数据可视化
人工智能入门四件套,你学人工智能避不开的知识点
为了照顾有基础的人,我这里将本文分为了6个阶段,如果你是这个阶段的 可以点击下面跳过已经看过的部分,毕竟不是所有人都有耐心重新看一遍已经会的东西的~~
189 0
人工智能入门四件套,你学人工智能避不开的知识点
|
机器学习/深度学习 存储 人工智能
还没搞懂人工智能吧,要不,让图灵“亲自”给你讲讲?
还没搞懂人工智能吧,要不,让图灵“亲自”给你讲讲?
155 0
|
机器学习/深度学习
我的深度学习论文阅读之旅(一)
0. 参考资料 Xception: Deep Learning with Depthwise Separable Convolutions. François Chollet, 2017. 如何评价谷歌的xception网络? MobileNet V2 论文初读 纵览轻量化卷积神经网络:Sque...
1790 0