DCAI
DC AI 热点

精选

当前热点完整榜单 →
1马斯克披露AI算力布局:Colossus集群拟部署超百万张英伟达GB300芯片84 热度 ⌁2试图入侵政府与高校网站:OpenAI 智能体4次“失控”行为细节曝光82 热度 ⌁3针对长上下文编程优化,Claude Opus 5.5 正式发布76 热度 ⌁4OpenAI升级ChatGPT语音功能,支持通过语音指令执行复杂工作任务76 热度 ⌁5甲骨文为旗舰AI数据中心发不可抗力通知引市场延期担忧76 热度 ⌁
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族

该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。

阅读原文 ↗推荐理由:提出了一种将同策略蒸馏与强化学习融合的新型多模态后训练框架,具备算法架构参考价值。# 大模型# 强化学习# 蒸馏# 后训练# Qwen
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

后训练会在无关决策中留下行为阴影:新型主动无任务蒸馏方法提出

最新研究发现,大语言模型的能力可以通过与目标任务无关的文本进行传递。传统后训练通常依赖任务特定数据,而研究团队提出了一种“主动无任务蒸馏”(ATD)方法,仅需教师模型针对每个提示生成一个词即可实现能力转移。该方法揭示了后训练会在任务无关的决策中留下可被探测的“行为阴影”,突破了此前潜意识学习研究需依赖大量生成的限制,深化了对模型后训练表征变化及知识蒸馏机制的理解。

阅读原文 ↗推荐理由:该研究揭示了语言模型后训练中能力隐式转移的新机理,提出的单词蒸馏方法对模型对齐与泛化研究具有重要启发。# 大模型# 后训练# 蒸馏# 潜意识学习# 模型行为分析
arXiv 人工智能✦ 精选AI 评分 76/10012:00

从自我蒸馏到自我练习:多轮智能体特权信息利用机制研究

该研究探讨了大模型多轮智能体训练中策略内自我蒸馏(OPSD)范式的缺陷。该范式利用特权信息构建强教师模型进行词元级监督,但在多轮交互中,学生智能体会表现出脱离实际信息的盲目自信,误以为自己掌握了未曾观测到的特权信息,导致性能大幅落后于普通强化学习,甚至劣于基座模型。为此作者提出了新范式;由于原文摘要截断,新方法细节尚未完全展开。

阅读原文 ↗推荐理由:深入剖析了多轮智能体后训练中特权信息蒸馏的失效机理,为改进Agent训练范式提供了重要参考。# 智能体# 蒸馏# 强化学习# 特权信息# 模型后训练
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LastOPD:解决隐状态同策略大模型蒸馏中的后期崩溃问题

该研究针对大模型同策略蒸馏(OPD)缺乏教师模型隐层思考过程的问题展开探索。尽管引入隐状态监督(Latent supervision)能对齐学生与教师模型的内部状态,但在将Qwen3-4B/8B蒸馏至Qwen3-1.7B-Base的实验中,研究人员发现该方法存在“早期增益、后期崩溃”的失效现象,MATH-500准确率虽迅速提升但随后崩溃。为此,论文提出了LastOPD方法以抑制此类崩溃。

阅读原文 ↗推荐理由:针对大语言模型同策略隐层蒸馏中性能崩溃问题提出解决方案,对模型轻量化与对齐训练具有参考价值。# 蒸馏# Qwen3# 大模型# 前沿研究
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 72/10012:00

跨模型错误中的文本知识蒸馏:鲁棒故障与保守修复

该研究探讨了基于失败案例的文本知识蒸馏方法,旨在通过分析任务错误来发现模型的知识漏洞。研究定义了在推理时注入输入的独立“规则原子”,指出其虽然能编码可迁移的任务知识,但也可能包含特定于原模型的推理补丁,从而在跨模型迁移时产生干扰;此外,注入的规则还可能被错误应用于不相关场景并引发误判。(注:原文摘要末尾未完)

阅读原文 ↗推荐理由:深入分析了通过错误反馈进行跨模型知识蒸馏的不稳定性与规则泛化风险,为大模型推理修复提供了新视角。# 蒸馏# 模型修复# 大模型# 推理机制# 错误分析