Transformer语言模型的序列计算蒸馏方法
针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。
针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。