如何有效的使用自督导式模型相关介绍Autoregressive Language Model给定句子的前半部分让预测后半部分Masked Language Model给定一个有某些部分被遮住的句子让预测被masked的是什么字。Pre-trained Language Modelsfine-tuning:其中Classifier Head的功能是输入句子最后的embedding输出句子有可能是正面还是负面。Embedding Layer和Transformer Layer的参数都是直接从Pre-trained Model直接拿过来的而在fine-tuned的时侯就会基于这些Pre-trained的weight fine-tune整个model。PLMS在现实生活中会遇到的问题1.Data scarcity:很难获得大量的labeled Data2.PLM的参数太大问题的解决办法1.当label的Training Data不够大的时候如何在有限的data或甚至没有data的情况下应用在downstreams task上面。Prompt templatePLMverbalizerprompt template:把data point 转成natural language prompt如下图所示。接下来让模型预测masked的地方要填入什么字。PLMperform language modelingverbalizer转换label跟vocabulary set 之间的关系。Few-shot Learning:只有一些labeled training dataSemi-supervised Learning:training data中包含了少量的labeled training data和大量的unlabeled training dataZero-shot:没有任何的training data2.当pre-trained language model太大的时候怎么减小用小的pre-trained model不可行因为model小了表现就会差很多。解决办法降低在fine-tune时所要用到的参数量。其中Distillation和Pruning不仅可以让参数量变小还可以让model inverse变快。Parameter-Efficient Fine-tuning:在fine-tune的时侯对于每一个task他所需的参数就是原本和BERT一样的参数加上task A专属的一小部分的参数从而降低所需的空间。如下图所示。在fine-tune的时候在Transformer里面只会fine-tune Adapter里面的参数而Feed-forward和Multi-headed attention里面的参数是完全不会被动的。