DCAI
DC AI 热点

精选

当前热点完整榜单 →
1高通发力AI软件生态:收购Modular打造统一软件栈,推进Mojo语言多端支持81 热度 ⌁2Black Forest Labs 推出开源具身智能模型 FLUX 3 Action76 热度 ⌁3谷歌云 API Gateway 支持 MCP:将 REST API 原生转化为 AI Agent 工具74 热度 ⌁4Sakana AI聘请AI先驱Jürgen Schmidhuber担任首席科学顾问74 热度 ⌁5谷歌、OpenAI与Anthropic拟联合组建AI安全标准自律组织SAFA73 热度 ⌁
9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

Transformer语言模型的序列计算蒸馏方法

针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。

阅读原文 ↗推荐理由:提出了一种动态压缩Token序列以减少Transformer自回归计算开销的高效架构优化方案。# Transformer# 模型压缩# 序列计算# 注意力机制# AI架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

注意力路由提前稳定:面向循环语言模型的工作集推理机制

针对循环语言模型在每个循环步骤重复计算全局注意力导致的高开销问题,研究人员分析了跨循环深度的注意力动态。研究发现,注意力分布和支撑集稳定的时间显著早于隐藏状态与输出,呈现出两阶段特征:前期步骤先确定相关上下文的稀疏工作集,后期步骤则在基本固定的路由支撑上细化表征。基于该发现,论文提出了名为 WISE 的工作集推理方法以优化推理过程(原文摘要末尾有所截断)。

阅读原文 ↗推荐理由:揭示了循环语言模型中注意力路由提前稳定的关键特性,为长序列与循环推理加速提供了新思路。# 循环语言模型# 注意力机制# 模型推理# 推理加速# 深度学习