可控多元对齐研究:预测目标冲突并高效覆盖多目标权衡
该论文针对大型语言模型多元对齐中价值观冲突的问题,研究了可控模型如何在竞争性目标间平衡权衡。多目标直接偏好优化(MODPO)通过目标权重覆盖连续权衡区间,本研究探讨了模型何时可同时提升两个目标,以及如何避免为每种权衡单独训练模型。基于HelpSteer和UltraFeedback的七组目标测试,研究提出了可预测目标冲突的预训练测量方法,以实现更高效的多元对齐。
推荐理由针对多目标对齐与个性化偏好优化的前沿理论研究,有助于提升大语言模型动态权衡多种冲突需求的能力。
原标题:Which Objectives Need a Dial? Predicting Objective Conflict and Covering Trade-offs in Steerable Pluralistic Alignment
阅读 arXiv 人工智能 原文 ↗