基于单次前向传播的注意力路由图实时电路提取方法
传统语言模型的可解释性电路查找通常需要进行大量复杂的干预实验。该研究提出了一种轻量化新方法,将单次前向传播中的注意力视为路由图,筛选出指向答案的关键路径。在归纳和间接宾语识别(IOI)任务中,消融该方法提取的边对模型性能的破坏显著高于随机消融。研究在GPT-2与Pythia模型上验证了该方法的有效性,为低成本理解模型内部机制提供了新路径。
传统语言模型的可解释性电路查找通常需要进行大量复杂的干预实验。该研究提出了一种轻量化新方法,将单次前向传播中的注意力视为路由图,筛选出指向答案的关键路径。在归纳和间接宾语识别(IOI)任务中,消融该方法提取的边对模型性能的破坏显著高于随机消融。研究在GPT-2与Pythia模型上验证了该方法的有效性,为低成本理解模型内部机制提供了新路径。