基于单次前向传播的注意力路由图实时电路提取方法
传统语言模型的可解释性电路查找通常需要进行大量复杂的干预实验。该研究提出了一种轻量化新方法,将单次前向传播中的注意力视为路由图,筛选出指向答案的关键路径。在归纳和间接宾语识别(IOI)任务中,消融该方法提取的边对模型性能的破坏显著高于随机消融。研究在GPT-2与Pythia模型上验证了该方法的有效性,为低成本理解模型内部机制提供了新路径。
传统语言模型的可解释性电路查找通常需要进行大量复杂的干预实验。该研究提出了一种轻量化新方法,将单次前向传播中的注意力视为路由图,筛选出指向答案的关键路径。在归纳和间接宾语识别(IOI)任务中,消融该方法提取的边对模型性能的破坏显著高于随机消融。研究在GPT-2与Pythia模型上验证了该方法的有效性,为低成本理解模型内部机制提供了新路径。
该研究探讨了Transformer架构在序列排序判断任务中的表达能力。论文证明,判断一个比特序列是否处于有序状态的任务无法由单头单层(1-head 1-layer)Transformer完成,但可以通过双头单层(2-head 1-layer)Transformer实现。与以往同类理论成果不同的是,该研究的结论建立在模型包含输出多层感知机(MLP)的架构设定之下。