DCAI
← 返回全部动态
arXiv 机器学习AI 评分 73/10009月24日 12:00

智能体训练中工具缓存可能导致策略更新方向反转

工具结果缓存可显著减少智能体训练中的重复计算,但也会耦合采样过程的随机性。最新研究通过一个双动作模型证明,即使独立执行与共享执行在边际上保持了每个采样的条件奖励分布一致,在组内共享随机结果仍可能导致预期的组归一化策略更新方向发生反转。理论推导表明,共享缓存更新反映的是胜负概率之差而非期望奖励之差,揭示了智能体强化学习中常见工程优化策略潜在的算法偏差风险。

推荐理由该研究从理论上揭示了智能体RL训练中工具缓存机制可能意外导致策略梯度方向反转的隐患。

原标题:Marginally Correct Tool Caches Can Reverse Group-Normalized Policy Updates

阅读 arXiv 机器学习 原文 ↗