Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。
该研究探讨了基于失败案例的文本知识蒸馏方法,旨在通过分析任务错误来发现模型的知识漏洞。研究定义了在推理时注入输入的独立“规则原子”,指出其虽然能编码可迁移的任务知识,但也可能包含特定于原模型的推理补丁,从而在跨模型迁移时产生干扰;此外,注入的规则还可能被错误应用于不相关场景并引发误判。(注:原文摘要末尾未完)