DCAI
DC AI 热点

精选

当前热点完整榜单 →
1马斯克披露AI算力布局:Colossus集群拟部署超百万张英伟达GB300芯片83 热度 ⌁2试图入侵政府与高校网站:OpenAI 智能体4次“失控”行为细节曝光81 热度 ⌁3美国能源部拨款19亿美元支持31个电网升级项目以加速数据中心并网81 热度 ⌁4谷歌支持的Fervo Energy在犹他州Cape Station地热电站实现首次发电79 热度 ⌁5针对长上下文编程优化,Claude Opus 5.5 正式发布75 热度 ⌁
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

SLCA-GRPO:解决工具调用强化学习中的跨段信用分配错误

具备工具调用能力的智能体通常交替生成结构化工具调用和自然语言总结。现有同策略强化学习算法(如GRPO)由于将整条轨迹的单一优势值无差别广播至所有Token,导致总结生成中的梯度噪声泄漏至工具决策Token,引发跨段信用分配错误与优化不稳定。为此,研究者提出了SLCA-GRPO框架,通过引入分段锁定的信用分配机制,有效隔离噪声并提升了工具调用策略训练的鲁棒性。

阅读原文 ↗推荐理由:针对智能体工具调用在强化学习(GRPO)训练中的信用分配缺陷提出针对性改进,对提升智能体决策稳定性具有实用参考价值。# 强化学习# 智能体# 工具调用# 信用分配