GLM-5.3-Flash融合Kimi与DeepSeek注意力架构,大模型设计走向混合组合
GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。
GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。
根据性能对比测试,在 Cerebras 算力平台上运行的开源模型 Kimi K2.6,在智能水平上可比肩 Google Gemini 3.5 Flash。依托 Cerebras 晶圆级硬件加速架构,Kimi K2.6 的推理输出生成速度达到了后者的 5 倍,且具备更低的访问延迟和开源权重模型的部署灵活性。
Cerebras宣布在其企业级测试中支持Kimi K2.6超大模型的极速推理,实测输出速度达到每秒981个Token。该方案旨在通过其专有算力芯片解决大模型推理的吞吐与延迟瓶颈,支持实时智能体编程及其他万亿参数级别的复杂AI工作负载,加速超大规模模型在企业级生产环境的高性能落地。
9月18日,亚马逊云科技宣布其大模型服务平台Bedrock正式托管国产开源模型Kimi K3。尽管国产模型上线海外云平台此前已有先例,但作为开源模型直接吸引美国主流云厂商采购付费尚属罕见。此举标志着中国开源大模型的技术实力与应用价值进一步获得硅谷云巨头的商业认可,也展现了海外云厂商围绕优质开源模型开展商业化合作的新动向。