超越重叠:评估基准数据泄露对模型性能因果效应的LeakScale框架
训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。
训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。
该研究探讨了大模型思维链(CoT)在生成最终答案时的因果约束力。作者提出了“基于续写的因果测试”方法,通过扰动某一推理步骤、截断链条并强迫模型基于被破坏的前缀继续生成,用以量化CoT对答案的“承重性”(load-bearingness)。在Gemma-2、Llama-3.1和DeepSeek-R1蒸馏模型上的多项基准测试表明,CoT的因果承重性与任务难度密切相关,简单任务中CoT往往流于形式,而在难任务中则切实主导推理方向。
该研究探讨了在存在未观测混杂因素的历史观测数据中学习风险评分的难题,此类评分通常用于指导稀缺资源分配或干预措施的优先级。尽管逆倾向加权等传统方法尝试校正观测数据带来的偏差,但在存在未观测混杂时仍面临严峻挑战。本研究旨在提出能够在混杂偏差下保持鲁棒性的评分学习方案。注:原始摘要文本末尾有所截断,具体方法细节未完全披露。