DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案

该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。

阅读原文 ↗推荐理由:开源了包含八个阶段的大语言模型后训练完整工作流与奖励设计,对模型后训练实践具有较高参考价值。# 大模型# 后训练# 强化学习# GLM# 开源
AITNT · AI头条(网页)✦ 精选AI 评分 78/10010:11

GLM-5.3-Flash融合Kimi与DeepSeek注意力架构,大模型设计走向混合组合

GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。

阅读原文 ↗推荐理由:体现了大模型底层注意力机制从单一路线竞争向异构融合设计演进的重要技术趋势。# GLM# DeepSeek# Kimi# 注意力机制# 模型架构