跨八大领域评估:后处理公平性约束何时有效何时受损
生产环境机器学习的公平性审计往往仅在部署时进行单域单次评估,难以应对重训或用户群变化导致的公平性漂移。为此,研究团队提出了生产环境公平性审计框架FAPE,该框架包含四个阶段,专门评估后处理干预措施(如Fairlearn的ThresholdOptimizer)。研究在刑事司法、收入预测、法律录取、信用贷款及农业信贷等八个领域展开跨域实证评估,深入剖析了后处理公平约束在不同场景下的适用性与潜在风险。
生产环境机器学习的公平性审计往往仅在部署时进行单域单次评估,难以应对重训或用户群变化导致的公平性漂移。为此,研究团队提出了生产环境公平性审计框架FAPE,该框架包含四个阶段,专门评估后处理干预措施(如Fairlearn的ThresholdOptimizer)。研究在刑事司法、收入预测、法律录取、信用贷款及农业信贷等八个领域展开跨域实证评估,深入剖析了后处理公平约束在不同场景下的适用性与潜在风险。
针对 AI 虚拟细胞模型在预测生物干预响应时可能并未真正利用输入信息的“预测-主张差距”,研究团队提出了审计框架 CELLAUDIT。在大模型智能体自动发现和迭代预测模型的场景下,CELLAUDIT 从源码计算路径、拟合依赖性以及实际预测贡献三个维度切入,系统性验证模型对输入扰动信息的使用主张是否属实,以确保智能体生成的科学预测模型具备真正的因果有效性和可靠性。