DCAI
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

超越重叠:评估基准数据泄露对模型性能因果效应的LeakScale框架

训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。

阅读原文 ↗推荐理由:提出了一种基于反事实干预的新框架,有效解决了大语言模型基准数据污染难以量化因果影响的痛点。# 基准评测# 数据污染# 因果推断# 大语言模型# 模型评估