硬预算重复评测中真实不确定性的理论界限研究
该研究探讨了在硬预算约束下,通过重复评测来准确估计基准测试分数并确保较低不确定性的理论极限。研究在固定任务网格和响应成本限制的框架下,推导出了在完全观察与允许遗漏两种情况下,最差纯群组的最优期望区间宽度理论界限。该理论下界同样适用于自适应硬预算策略,为机器学习模型的基准评测设计与置信度验证提供了严格的理论依据。
该研究探讨了在硬预算约束下,通过重复评测来准确估计基准测试分数并确保较低不确定性的理论极限。研究在固定任务网格和响应成本限制的框架下,推导出了在完全观察与允许遗漏两种情况下,最差纯群组的最优期望区间宽度理论界限。该理论下界同样适用于自适应硬预算策略,为机器学习模型的基准评测设计与置信度验证提供了严格的理论依据。