DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族

该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。

阅读原文 ↗推荐理由:提出了一种将同策略蒸馏与强化学习融合的新型多模态后训练框架,具备算法架构参考价值。# 大模型# 强化学习# 蒸馏# 后训练# Qwen
arXiv 人工智能✦ 精选AI 评分 76/10012:00

从自我蒸馏到自我练习:多轮智能体特权信息利用机制研究

该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。

阅读原文 ↗推荐理由:深入剖析了多轮智能体后训练中特权信息蒸馏的失效机理,为改进Agent训练范式提供了重要参考。# 智能体# 蒸馏# 强化学习# 特权信息# 模型后训练
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 72/10012:00

跨模型错误中的文本知识蒸馏:鲁棒故障与保守修复

该研究探讨了基于失败案例的文本知识蒸馏方法,旨在通过分析任务错误来发现模型的知识漏洞。研究定义了在推理时注入输入的独立“规则原子”,指出其虽然能编码可迁移的任务知识,但也可能包含特定于原模型的推理补丁,从而在跨模型迁移时产生干扰;此外,注入的规则还可能被错误应用于不相关场景并引发误判。(注:原文摘要末尾未完)

阅读原文 ↗推荐理由:深入分析了通过错误反馈进行跨模型知识蒸馏的不稳定性与规则泛化风险,为大模型推理修复提供了新视角。# 蒸馏# 模型修复# 大模型# 推理机制# 错误分析