DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 68/10012:00

可验证奖励强化学习在小型搜索智能体中的应用研究

该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。

阅读原文 ↗推荐理由:探索了端侧极小参数模型直接利用GRPO和可验证强化学习进行搜索问答训练的新路径。# 强化学习# RLVR# 搜索智能体# 小模型# GRPO
arXiv 机器学习✦ 精选AI 评分 72/10012:00

基于自旋玻璃理论:可验证奖励强化学习(RLVR)在迭代乘法任务中的优化景观可呈良态

该论文研究了带有可验证奖励的强化学习(RLVR)在迭代群与拟群乘法等算法任务中的优化景观,探讨其学习新推理能力的极限。作者将近视表格策略下的熵正则化RLVR映射到确定性策略的自旋玻璃能量模型,不仅给出了RLVR能力的理论上限,还严格刻画了表格环境下的景观特征。理论与实验表明该优化景观可以是良态的;因原文摘要截断,具体实验细节未完全展开。

阅读原文 ↗推荐理由:引入统计物理中的自旋玻璃理论深入分析RLVR的优化景观,为理解大模型推理与强化学习机制提供了坚实的理论工具。# RLVR# 强化学习# 自旋玻璃# 数学推理# 模型优化