一层transformer如下输入Token ↓ 多头注意力 ↓ 残差连接 归一化 ↓ 前馈神经网络(多个 liner激活函数)↓ 残差连接 归一化 ↓ 输出Token 这个输出不是模型输出是输出给下一个transformer整个模型只有一个token预测输出模型尾部全连接层 这是编码的transformer解码的多一个 Cross Attention 处理多头注意力注意力是收集资料每个token观察与其他token的关系。多头注意力是多个角度观察比如从时间空间任务等多个逻辑观察。残差连接 归一化残差是观察到的原始信息 加入原始信息是为了防止向下多层层transofrmer传递过程中真值不被丢弃。归一化是多层transformer每层都有大量信息为了防止信息爆炸。前馈神经网络FFN对注意力收集到的资料进行整理和理解这里是产生学习和智能的关键。transformer有编码和解码两种类型解码适合做接龙游戏因为它只能看到前面的不能看到后面的因此它不适合做图片工作。编码器既然能看到前面的也能看到后面的适合做图片和视频工作但它不适合做接龙工作。CNN学习“像素之间有什么关系”LSTM学习“时间序列前后有什么关系”Transformer学习“所有Token之间有什么关系”GPT利用这些关系预测下一个TokenGPT/transformer的训练推流过程训练自监督训练。比如喂入文本“中国的首都是北京”输入中国后执行整个100层transformer网络得到一个预测tokenlabel是“的”计算误差反向传播。然后继续向后面滚动训练。当把新token“的”加进来时只会计算新token的Attention“中国”并不会再走一边网络因为它的Attention已经存在KV Cache中可以直接用推理时也是这样。推理把前面自己的输出再作为输入然后预测下一个token然后继续滚动。称为自回归生成。GPT的网络输入Token ↓ Embedding ↓ Transformer Layer1↓ Transformer Layer2↓...↓ Transformer Layer100↓ Linear输出层 ↓ 预测下一个Token人工智能深度学习分类| | ---- CNN | | | ResNet | YOLO | | ---- RNN/LSTM 基本被Transformer取代 | | | 语音 | | ---- Transformer | | | Encoder 适合理解不适合生成 | | BERT | | ViT视觉Transformer和VideoMAE 都是把图片切成小块(Patch)转成token | | | Decoder | | GPT | | | Encoder-Decoder | T5 百度翻译 | | ---- Diffusion | | | Stable Diffusion | Sora (Diffusion transformer) | | ---- GAN 基本被Diffusion取代 | | ---- Reinforcement Learning | AlphaGo RLHF人工智能模型| | ---- 网络结构(Backbone) | | CNN | Transformer | RNN/LSTM | | ---- 范式 | Diffusion 扩散模型 transformerU-Net | GAN CNN | ---- 训练推流方法 Autoregressive自回归 (transformer)Diffusion通常由U-Net和Transformer实现Encoder类的TransformerU-Net负责降噪。 可以生成文字/语言/图片/视频它本质是学习如何从噪声恢复数据的方法。它在工业上一般用于图片生成 视频生成 图像编辑(给人换衣服) 医学影像。应用模型方向Stable Diffusion图片Sora视频Runway视频Pika视频