摘要本文主要是博主在学习专用模型后训练的笔记。CPTContinual Pre-Training)简单来说CPT就是在已经训练好的通用模型基础上通过新的数据学习新的知识尤其是特定目标领域的知识。形式是自监督学习self_supervised learning)。CPT通用的epoch数大概为1-2并不是要多次反复的拟合。此阶段最后导出HF格式模型文件HFHuggingFace是通用的标准模型格式。核心公式损失函数通常为其中输入一个文本T是文本Token长度是第t个Token的真实值是概率为参数损失函数目的极大化预测正确的概率。因果注意力机制模型只能关注当前以及以前的token不能回看后面的token。例如对于【我-喜欢-吃-苹果】这句话计算【我】的Attention,只能根据【我】计算【喜欢】的Attention,可以根据【我】【喜欢】计算【吃】的Attention,可以根据【我】【喜欢】【吃】计算【苹果】的Attention,可以根据【我】【喜欢】【吃】【苹果】现实计算时候可以借助Causal Mask注意力机制Attention Is All You Need核心公式Attention的作用衡量前后文的重要性以【我-喜欢-吃-苹果】举例。例如【吃】的attention为【0.10.20.70】就是【我】有0.1的重要【喜欢】有0.2【吃】有0.7的重要。下面是具体计算。Step1指的是【我】的向量形式指的是【喜欢】的向量形式....Step2其中为可学习的NxN矩阵Step3计算 Attention ScoreStep4加入 Causal Mask再进行 Softmax其中M为因果掩码Step5对 V 加权求和潜在风险值得注意的是CPT之后模型可能会忘记之前的通用知识训练的时候可以放些通用知识做replay。