DCAI
DC AI 热点

精选

当前热点完整榜单 →
1马斯克披露AI算力布局:Colossus集群拟部署超百万张英伟达GB300芯片84 热度 ⌁2试图入侵政府与高校网站:OpenAI 智能体4次“失控”行为细节曝光82 热度 ⌁3针对长上下文编程优化,Claude Opus 5.5 正式发布76 热度 ⌁4OpenAI升级ChatGPT语音功能,支持通过语音指令执行复杂工作任务76 热度 ⌁5甲骨文为旗舰AI数据中心发不可抗力通知引市场延期担忧76 热度 ⌁
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族

该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。

阅读原文 ↗推荐理由:提出了一种将同策略蒸馏与强化学习融合的新型多模态后训练框架,具备算法架构参考价值。# 大模型# 强化学习# 蒸馏# 后训练# Qwen
arXiv 人工智能✦ 精选AI 评分 75/10012:00

DEEPO:面向多模态大模型幻觉抑制的双熵增强策略优化

该研究探讨了强化学习在多模态大语言模型(MLLM)中抑制幻觉效果不稳定的问题,并归因于从奖励到参数更新纠错链中的两个弱点:在采样层面,高语义熵的困难查询易产生全错样本组,使最易产生幻觉区域的相对优势坍缩为零;在优化层面,高置信度的错误token存在梯度消失现象。为此,论文提出了双熵增强策略优化方法DEEPO,以改进参数更新机制并有效缓解多模态幻觉。

阅读原文 ↗推荐理由:深入剖析了强化学习训练多模态大模型时幻觉纠正链的失效机理,并提出了创新的双熵优化解决方案。# 大模型# 强化学习# 幻觉# 策略优化
arXiv 人工智能✦ 精选AI 评分 75/10012:00

AdvRole:面向角色扮演智能体的对抗性闭环课程学习框架

基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。

阅读原文 ↗推荐理由:针对角色扮演智能体强化学习中训练场景固定的分布瓶颈,创新提出了对抗式闭环课程演化方案。# 角色扮演智能体# 强化学习# 大模型# 对抗训练# 课程学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TRACER:基于行为一致性对齐的多轮用户模拟器

针对交互式AI构建与评测中模拟用户难以复现真实意图演变和交互结果的缺陷,研究人员提出了多轮用户模拟器 TRACER。该模型能够显式建模用户动态演变的意图,使模拟行为与真实交互轨迹保持一致。TRACER 采用两阶段训练策略:首先在真实用户对话上进行监督微调(SFT),随后利用融合了分层结果与轨迹奖励的多轮强化学习进行对齐训练,从而大幅提升用户模拟的真实度与行为一致性。

阅读原文 ↗推荐理由:针对交互式AI系统评测中用户模拟器缺乏多轮行为一致性的痛点,提出了结合强化学习轨迹对齐的新型模拟器方案。# 用户模拟器# 交互式AI# 强化学习# 对齐# 智能体
arXiv 人工智能✦ 精选AI 评分 68/10012:00

可验证奖励强化学习在小型搜索智能体中的应用研究

该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。

阅读原文 ↗推荐理由:探索了端侧极小参数模型直接利用GRPO和可验证强化学习进行搜索问答训练的新路径。# 强化学习# 搜索智能体# 小模型
arXiv 人工智能✦ 精选AI 评分 78/10012:00

基于轨迹图估算单步优势:面向智能体强化学习的新方法

以GRPO为代表的分组强化学习已成为训练推理与智能体大模型的主流范式。然而,这类方法在全轨迹层面的优势估计虽然可靠,但在单步层面上存在系统性偏差,粗粒度的轨迹级反馈难以准确评估单个步骤的实际贡献(例如失败轨迹中往往包含有价值的操作步骤)。论文回归强化学习基础定义,提出通过构建轨迹图来精确估计步骤级优势,以解决多轮复杂智能体任务中的信用分配难题并提升模型训练效果。

阅读原文 ↗推荐理由:针对当前热门的GRPO算法在多步智能体任务中粗粒度优势估计的痛点,提出了有效的步骤级信用分配改进方案。# 强化学习# 智能体# 大模型# 模型训练
arXiv 人工智能✦ 精选AI 评分 72/10012:00

动作归因何时需要更新?面向工具调用型智能体的高效更新机制研究

针对工具调用型智能体在策略持续更新中动作归因(Action Credit)失效、重新计算导致昂贵工具调用与环境交互成本的问题,该研究探讨了历史归因何时真正需要更新。研究核心发现,动作价值的变化并不一定会导致最终决策的改变;只要策略诱导的漂移不足以颠覆原有决策,历史动作归因即可继续复用,从而大幅降低计算开销。(注:原始摘要文本存在部分截断)

阅读原文 ↗推荐理由:聚焦工具调用智能体策略更新中的交互成本痛点,提出了通过判断决策漂移来复用历史归因的优化思路。# 智能体# 工具调用# 动作归因# 策略优化# 强化学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

SLCA-GRPO:解决工具调用强化学习中的跨段信用分配错误

具备工具调用能力的智能体通常交替生成结构化工具调用和自然语言总结。现有同策略强化学习算法(如GRPO)由于将整条轨迹的单一优势值无差别广播至所有Token,导致总结生成中的梯度噪声泄漏至工具决策Token,引发跨段信用分配错误与优化不稳定。为此,研究者提出了SLCA-GRPO框架,通过引入分段锁定的信用分配机制,有效隔离噪声并提升了工具调用策略训练的鲁棒性。

阅读原文 ↗推荐理由:针对智能体工具调用在强化学习(GRPO)训练中的信用分配缺陷提出针对性改进,对提升智能体决策稳定性具有实用参考价值。# 强化学习# 智能体# 工具调用# 信用分配
arXiv 人工智能✦ 精选AI 评分 76/10012:00

从自我蒸馏到自我练习:多轮智能体特权信息利用机制研究

该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。

阅读原文 ↗推荐理由:深入剖析了多轮智能体后训练中特权信息蒸馏的失效机理,为改进Agent训练范式提供了重要参考。# 智能体# 蒸馏# 强化学习# 特权信息# 模型后训练
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架

针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。

阅读原文 ↗推荐理由:提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。# 大模型# 强化学习# 思维链# 算力# 推理
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 78/10012:00

面向推理的大语言模型强化学习Rollout效率综述:技术分类与未来方向

面向推理的大语言模型强化学习能显著提升多步推理与代码能力,但轨迹生成(Rollout)阶段也承担了极高的训练计算成本。如何在保障训练数据新鲜度、一致性与统计有效性的前提下提升 Rollout 效率,已成为当前优化的核心课题。本综述对近年来面向推理的强化学习 Rollout 效率研究进行了系统梳理,从底层机制和性能瓶颈等维度对现有优化方法展开分类,并指出了未来的发展方向。

阅读原文 ↗推荐理由:聚焦长思维链大模型强化学习训练中的核心算力瓶颈,为降低 Rollout 阶段的高昂成本提供了前沿的技术全景参考。# 强化学习# 大模型# Rollout效率# 复杂推理# 系统综述
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于子任务分解的强化学习方法:改进大语言模型策略优化

针对群组相对策略优化(GRPO)等主流策略梯度方法在训练语言模型智能体时将多轮交互压缩为单一标量轨迹奖励的痛点,研究指出该做法在稀疏和延迟反馈的多技能复合任务中存在严重的信息损失,优化器难以推断具体能力对结果的贡献。为此,论文提出应将轨迹奖励沿子任务进行解耦与分解后再进行策略更新,从而实现更精准的信用分配与行为调整。

阅读原文 ↗推荐理由:针对大模型强化学习主流算法GRPO在多轮复杂任务中奖励归因模糊的核心痛点,提出了子任务奖励分解的优化思路。# 强化学习# 语言模型智能体# 策略优化# 奖励建模
arXiv 人工智能✦ 精选AI 评分 75/10012:00

VHD-Play:基于机制求解生成可验证的智能体强化学习环境

随着大语言模型智能体处理长程任务的需求增加,扩展其强化学习训练亟需多样化环境与可靠奖励信号。针对现有生成管道在环境动态与事后评估对齐上的缺陷,研究提出VHD-Play框架。该方法颠倒了传统的构建依赖关系,首先对数学模型进行采样与求解,再通过基于语料的设置器将其决策过程渲染为具备状态的可执行工具环境,为智能体强化学习提供了低成本、可验证的交互环境生成方案。

阅读原文 ↗推荐理由:提出了一种逆向生成机制,有效解决了智能体强化学习训练中高质量、可验证交互环境稀缺的问题。# 智能体# 强化学习# 环境生成# 大模型# 合成数据