一、模型压缩技术在保证一些模型性能损耗不大的情况下使得模型尽可能的小就是我们要解决的问题。而让模型规模变小我们称之为模型压缩所以基于上述背景如何解决大模型在低资源设备硬件上提升推理效率就是模型压缩意义。二、模型量化量化是一种技术把高精度的数据类型转化为低精度的类型。量化有如下几种方式1. 训练中量化量化感知训练适用于高端的算力设备在模型训练过程中就做量化2. 训练后量化动态量化适用于端侧、消费级算力设备训练结束后推理时临时做量化静态量化适用于边缘、中端服务器训练结束后先校验再做量化三、模型蒸馏模型蒸馏是一种通过将一个复杂模型教师模型的知识转移给一个简单模型学生模型的方法以提高学生模型的性能。在减小模型体积的同时保持或提升模型性能。蒸馏流程1.先训练笨重精准的大老师模型2.相同数据的的老师细微的知识生成软标签3.学生一边学习老师的软分布一边对标真实的答案4.训练完成后丢掉老师模型只用小巧的学生模型上线小巧速度快精准和大模型差不多5.温度T在训练蒸馏阶段开大学神训练完成实际上线推理的时候直接T1正常softmax即可学习如下学生模型 学 教师模型的三种学习目标(Loss,即:差距),Loss是 学生输出和教师输出的不同程度差距越小,说明学生学的越好.1.软标签Loss -KL散度 交叉熵 - 信息熵让学生学教师 犹豫的判断 (概率 分布)2.硬标签Loss-交叉熵让学生学 最终的正确答案3.中间层Loss-(MSE,均方误差)让学生学教师思考过程中的特征四、模型剪枝定义仿照生物的稀疏神经网络, 将大型网络中的稠密连接变成稀疏的连接,并同样达到SOTA的效果就是模型剪枝的原动力剪枝和其他优化技术的融合:剪枝量化:先剪枝,再量化,可以获得更好的压缩效果.剪枝 蒸馏:先用教师模型 指导 剪枝后的学生模型的 训练