9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 73/10012:00
工具结果缓存可显著减少智能体训练中的重复计算,但也会耦合采样过程的随机性。最新研究通过一个双动作模型证明,即使独立执行与共享执行在边际上保持了每个采样的条件奖励分布一致,在组内共享随机结果仍可能导致预期的组归一化策略更新方向发生反转。理论推导表明,共享缓存更新反映的是胜负概率之差而非期望奖励之差,揭示了智能体强化学习中常见工程优化策略潜在的算法偏差风险。
arXiv 机器学习✦ 精选AI 评分 68/10012:00
事后重标记通过将转移目标事后替换为实际达到的结果,是提升强化学习样本效率的有效手段。然而,将其自然扩展至偏好条件的多目标强化学习(MORL)时,本研究发现该方法往往适得其反。在 MO-Gymnasium 连续控制测试套件中,针对涵盖两种 Critic 主干和偏好采样方案的四种离线策略算法测试表明,此类重标记会导致性能退化并引发偏好覆盖崩溃。(注:原文摘要结尾处不完整)
arXiv 人工智能✦ 精选AI 评分 78/10012:00
面向推理的大语言模型强化学习能显著提升多步推理与代码能力,但轨迹生成(Rollout)阶段也承担了极高的训练计算成本。如何在保障训练数据新鲜度、一致性与统计有效性的前提下提升 Rollout 效率,已成为当前优化的核心课题。本综述对近年来面向推理的强化学习 Rollout 效率研究进行了系统梳理,从底层机制和性能瓶颈等维度对现有优化方法展开分类,并指出了未来的发展方向。
arXiv 机器学习✦ 精选AI 评分 75/10012:00
该研究针对预训练流式生成模型的下游奖励微调问题,提出了一种名为Wasserstein倾斜流的新框架。传统方法多将其表述为基于KL散度正则化的奖励倾斜分布采样,而本研究构建了直接基于预训练漂移的最优传输正则化项。与传统的重加权基分布不同,该目标直接将单个样本输运至高奖励区域,使其等价于一种确定性过程,从而实现了免仿真的强化学习模型优化。
Hugging Face✦ 精选AI 评分 65/10002:41
该技术文章聚焦于如何结合使用 NVIDIA Warp 与 MjWarp 框架,以加速机器人领域的物理仿真与强化学习等工作流。由于提供的原始素材缺少详细摘要与正文内容,具体的技术架构实现、性能评测对比及实操步骤等细节尚无法进一步展开。整体内容旨在探讨通过高性能 GPU 仿真工具提升机器人开发与训练效率的方法。