AdvRole:面向角色扮演智能体的对抗性闭环课程学习框架
基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。
推荐理由针对角色扮演智能体强化学习中训练场景固定的分布瓶颈,创新提出了对抗式闭环课程演化方案。
原标题:Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents
阅读 arXiv 人工智能 原文 ↗