Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
该研究探讨了强化学习在多模态大语言模型(MLLM)中抑制幻觉效果不稳定的问题,并归因于从奖励到参数更新纠错链中的两个弱点:在采样层面,高语义熵的困难查询易产生全错样本组,使最易产生幻觉区域的相对优势坍缩为零;在优化层面,高置信度的错误token存在梯度消失现象。为此,论文提出了双熵增强策略优化方法DEEPO,以改进参数更新机制并有效缓解多模态幻觉。
基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。
针对交互式AI构建与评测中模拟用户难以复现真实意图演变和交互结果的缺陷,研究人员提出了多轮用户模拟器 TRACER。该模型能够显式建模用户动态演变的意图,使模拟行为与真实交互轨迹保持一致。TRACER 采用两阶段训练策略:首先在真实用户对话上进行监督微调(SFT),随后利用融合了分层结果与轨迹奖励的多轮强化学习进行对齐训练,从而大幅提升用户模拟的真实度与行为一致性。
该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。
以GRPO为代表的分组强化学习已成为训练推理与智能体大模型的主流范式。然而,这类方法在全轨迹层面的优势估计虽然可靠,但在单步层面上存在系统性偏差,粗粒度的轨迹级反馈难以准确评估单个步骤的实际贡献(例如失败轨迹中往往包含有价值的操作步骤)。论文回归强化学习基础定义,提出通过构建轨迹图来精确估计步骤级优势,以解决多轮复杂智能体任务中的信用分配难题并提升模型训练效果。
针对工具调用型智能体在策略持续更新中动作归因(Action Credit)失效、重新计算导致昂贵工具调用与环境交互成本的问题,该研究探讨了历史归因何时真正需要更新。研究核心发现,动作价值的变化并不一定会导致最终决策的改变;只要策略诱导的漂移不足以颠覆原有决策,历史动作归因即可继续复用,从而大幅降低计算开销。(注:原始摘要文本存在部分截断)
具备工具调用能力的智能体通常交替生成结构化工具调用和自然语言总结。现有同策略强化学习算法(如GRPO)由于将整条轨迹的单一优势值无差别广播至所有Token,导致总结生成中的梯度噪声泄漏至工具决策Token,引发跨段信用分配错误与优化不稳定。为此,研究者提出了SLCA-GRPO框架,通过引入分段锁定的信用分配机制,有效隔离噪声并提升了工具调用策略训练的鲁棒性。
该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。
针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。
面向推理的大语言模型强化学习能显著提升多步推理与代码能力,但轨迹生成(Rollout)阶段也承担了极高的训练计算成本。如何在保障训练数据新鲜度、一致性与统计有效性的前提下提升 Rollout 效率,已成为当前优化的核心课题。本综述对近年来面向推理的强化学习 Rollout 效率研究进行了系统梳理,从底层机制和性能瓶颈等维度对现有优化方法展开分类,并指出了未来的发展方向。
针对群组相对策略优化(GRPO)等主流策略梯度方法在训练语言模型智能体时将多轮交互压缩为单一标量轨迹奖励的痛点,研究指出该做法在稀疏和延迟反馈的多技能复合任务中存在严重的信息损失,优化器难以推断具体能力对结果的贡献。为此,论文提出应将轨迹奖励沿子任务进行解耦与分解后再进行策略更新,从而实现更精准的信用分配与行为调整。
随着大语言模型智能体处理长程任务的需求增加,扩展其强化学习训练亟需多样化环境与可靠奖励信号。针对现有生成管道在环境动态与事后评估对齐上的缺陷,研究提出VHD-Play框架。该方法颠倒了传统的构建依赖关系,首先对数学模型进行采样与求解,再通过基于语料的设置器将其决策过程渲染为具备状态的可执行工具环境,为智能体强化学习提供了低成本、可验证的交互环境生成方案。