Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案
该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。
该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。
GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。