Agentic-GER:利用全局上下文实现长语音专业术语纠错的LLM智能体
针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。
针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。
该研究探讨了大语言模型智能体的持久记忆机制,旨在不更新权重的前提下持续改进提示与技能。研究发现,将检索范围与认证范围精确匹配,能有效防止跨任务族的干扰,支持在重复出现的任务族中实现可靠适应。研究人员在12轮代码修复数据流ProcStream-RSI上对冻结模型智能体进行了测试,并使用基于执行的正交回归控制门控机制,证实仅在技能生成的原始任务族内检索该技能,可显著提升轨迹效用。
本研究探讨利用分布式声波传感(DAS)与深度学习技术进行高时空分辨率城市交通动态监测。DAS通过复用现有的地下光纤电缆作为密集连续的传感器阵列,能够以米级空间分辨率和秒级时间分辨率对道路交通活动进行被动且保护隐私的实时监测。该研究旨在验证DAS结合深度学习在智慧交通感知中的有效性(注:原文摘要信息有所截断,具体实验指标未详述)。
深度搜索要求大语言模型智能体分解复杂查询、检索证据并合成可靠答案。然而现有的 ReAct 架构智能体存在角色耦合(单策略兼顾规划、证据利用与合成)以及搜索历史累积导致上下文噪声增加的问题。为此,研究团队提出 IterSynth 范式,通过角色解耦与基于摘要的状态演进机制,在负责识别信息需求的规划器与负责整合证据的合成器之间交替执行,有效改善了深度搜索智能体的长程推理与信息合成能力。
该研究针对生成式搜索中答案虽有引用却可能遗漏改变语义解释的源关系这一问题,提出了一种主张门控审计规范。该机制对“查询-来源-答案”三元组进行审计,仅在关系证据、答案采纳、实质性与披露四项要素均被观测时判定存在遗漏,避免将证据不全误判为独立无关。该规范将判定结果绑定至带版本控制的证据片段,并通过引用检查器使审计记录契约可执行,提升了生成式搜索溯源审计的可靠性。
该研究针对机制可解释性技术难以随大语言模型规模与深度扩展的问题,提出了一种新型架构——流递归模型(SRM)。SRM 是对分层推理模型(HRM)的改进,通过将计算过程组织为多个相互交互的潜在流,在保持模型可扩展性的同时暴露其内部计算结构。该工作旨在通过设计天然具备可解释性结构的小型模型,为验证和理解模型内部行为提供新的探索路径。
该研究探讨了基于重构的无监督异常检测在模型过度拟合异常或丢失正常变异时的失败机理。论文借助“子空间追求”(PoS)假说,从交集、并集和联接几何视角对失败模式进行理论表征:模型容量过大易引发联接盲区,容量不足则会导致交集偏好与正常保真度下降。研究证明紧凑的正常数据并集是最优保真范围,通常依赖非线性重构映射实现。
该研究针对大语言模型智能体在复杂工具使用任务中的技能自我进化问题展开探索。论文指出,复杂任务通常存在多种有效解题路径,失败轨迹往往也包含前期的有效进展而非全盘皆错。因此,研究提出不应将失败轨迹强行与固定成功路径对齐或进行粗粒度反思,而应精确定位有效求解向错误偏离的转折点,通过偏差引导的方式实现智能体技能的高效自我进化与演进。
该研究针对大模型同策略蒸馏(OPD)缺乏教师模型隐层思考过程的问题展开探索。尽管引入隐状态监督(Latent supervision)能对齐学生与教师模型的内部状态,但在将Qwen3-4B/8B蒸馏至Qwen3-1.7B-Base的实验中,研究人员发现该方法存在“早期增益、后期崩溃”的失效现象,MATH-500准确率虽迅速提升但随后崩溃。为此,论文提出了LastOPD方法以抑制此类崩溃。
该论文针对科学断层扫描中神经场优化的核心难题展开研究。作者指出,由于2D到3D的正向映射为多对一关系,较低的2D图像误差并不能保证隐式3D物理场的准确性,且该隐式场在训练中缺乏直接监督。为此,研究团队提出了CoroNeRF框架,利用可微原子发射渲染器,直接从多视角、多谱线辐射强度中联合优化3D电子密度与温度场,并在日冕断层扫描场景中进行了测试与验证(注:原摘要结尾处有所截断)。
针对振动光谱预测在跨化学空间场景下易受局部立体电子环境扰动而导致精度下降的问题,研究提出 SO(3) 等变神经卡尔曼网络(SENK)。该框架构建了响应态级联结构,融合了用于学习 Hessian 矩阵、偶极导数及极化率导数的等变 Transformer 骨干网络,通过等变神经卡尔曼桥实现状态依赖精炼与可靠性感知,并结合 NBO 电子先验以提升光谱表征的可迁移性。
该研究深入探讨了基于埃尔米特多项式构建的谱图神经网络,并提出了 HermNet 模型。该模型将节点级预测器与归一化埃尔米特传播相结合,依靠稀疏递推关系实现计算,既无需昂贵的特征值分解也不依赖可学习基底。研究还评估了坐标校准、响应归一化和高斯导数正则化等可选机制,并系统分析了在有限训练预算下,不同完备多项式基底在优化行为上的差异。
低秩适应(LoRA)已成为大语言模型中广泛应用的参数高效微调方法,但如何确定各适应矩阵的秩仍是核心挑战。针对现有自适应秩分配方法多依赖人工设计重要性评分的问题,该研究提出了lp-LoRA方法。该方法基于信号处理中经典的稀疏诱导技术,利用0
开发者在 ChatGPT 网页端源代码中发现了“PROMAX”相关字段,业内据此推测 OpenAI 可能正筹备推出更高阶的订阅方案,月费或达 600 美元。目前 OpenAI 官方尚未证实该计划,产品命名、功能与定价仍存不确定性。此前由于系统压力加剧,OpenAI 已暂停了 200 美元档位的 Pro 订阅新增。这一潜在新档位或反映出其在算力负载与商业化层级上的新探索。
新一代梅赛德斯-迈巴赫 S 级轿车正式上市,售价 139.8 万元起。该车型首度搭载梅赛德斯-奔驰 MB.OS 架构与最新一代交互系统,在座舱中应用端侧多模态 VLM 大模型;智驾方面配备全新城区及高速领航辅助驾驶系统,支持车位到车位辅助与智能泊车,未来还将通过 OTA 率先升级搭载 Momenta R7 世界模型,加速大模型在高端智能汽车硬件上的量产落地。
深度求索(DeepSeek AI)旗下智能体运行时框架 DeepSeek Harness 悄然上线官方桌面版开发者预览,版本号为 V0.1.7-rc.2。该桌面版免去了此前安装 Node.js 及终端运行的繁琐步骤,目前已支持 Windows x64 和 macOS Apple Silicon。应用内置标准模式、PTC 模式、极简模式和创造模式四种模式,支持智能体代码处理、批量调用工具和对话定制插件等功能。
Meta在Connect大会上推出了便携式掌上AI设备Muse Charm,由前苹果界面设计主管Alan Dye操刀设计。该设备配备2英寸触摸屏和5G调制解调器,能够脱离手机独立运行AI助手Muse,类似AI版本的“拓麻歌子”电子宠物形态。设备计划于今年12月假日购物季正式开售,进一步拓展了消费级独立AI硬件的应用场景与终端形态。
OpenAI宣布为ChatGPT Voice上线语音执行任务功能,通过接入模型与插件体系,用户可直接通过语音指令查验邮件、制作PPT、搭建网站及追回重复扣费等。该项能力已深度整合进此前推出的ChatGPT Work Agent中,新版本应用已同步面向全球用户推送,标志着语音交互进一步向具备实际操作能力的智能体演进。
科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。
Meta旗下个人智能体应用Muse在上线12天后下载增速亮眼,但随后被曝光其关键核心文件SOUL.md及工作区组织逻辑与开源项目OpenClaw高度雷同。对此,Meta超级智能实验室产品负责人Nat Friedman公开承认,Muse在产品整体设计上确实深受OpenClaw启发,团队致力于将其进一步优化改造,打造为一个兼具安全易用性、可拓展至数十亿用户规模的版本。
前豆包PC端负责人齐俊元正式发布主动式个人Agent操作系统“Today”。该系统具备Living Memory记忆能力与Proactive主动交互特性,能够深度连接用户的邮件、日历、笔记等常用办公应用。通过对上下文信息的持续记忆与分析,Today可自主为用户梳理工作节奏并主动推送个性化早晚报,标志着个人Agent正从被动响应转向主动服务的应用落地探索。
开源智能体项目Orbital主张“Context is yours”,旨在解决用户上下文资产被主流厂商Agent锁定的痛点。该项目能将散乱的交互会话沉淀为可自由迁移的项目记忆,助力用户拿回数据自主权。同时,配合观猹推出的Tokendance模型钱包,系统支持对DeepSeek、GLM、Kimi等70余个主流模型的Token用量进行透明化监控与管理,提升多模型协同与应用工程效率。
该文梳理了梁文锋在学术论文中的署名脉络。过去三年中,梁文锋极少作为第一作者或通讯作者出现在动辄上百人署名的旗舰模型整体报告中,而是将研究精力与署名重点投向最底层的原子技术,包括MLA注意力机制、MoE路由机制、mHC拓扑流形、DSpark推理算子以及DSec智能体沙盒等关键底层技术论文,展现了其对AI基础架构研发的深耕。
Eight Sleep联合创始人介绍了其AI智能床套Pod的核心功能与商业布局。该产品集成了动态液冷温控与健康异常预警技术,目前正在推进美国FDA医疗认证申请。同时,创始人分享了开拓中国市场取得的高速增长态势,以及对高端硬件产品定价策略的思考,探讨了AI睡眠硬件从消费级产品演进为预防医疗入口的商业路径。
英伟达首席执行官黄仁勋在接受《纽约时报》采访时表示,针对前沿AI模型的“越狱”攻击等行为,若前沿实验室无法保证AI安全与实验可控性,就必须停止实验乃至关闭实验室。他指出,AI实验一旦产生失控智能体将引发民事与刑事责任,相关机构必须承担后果。黄仁勋同时强调,当前不应陷入泛安全焦虑,而应将核心精力聚焦于AI实验本身的实际可控性上。
新加坡国立大学、清华大学、北京大学等七所高校联合开源了机器人世界动作模型OpenWAM。该项目包含OpenWAM-Infra模块化基础设施、OpenWAM-Study受控实验及OpenWAM-α大规模预训练基座模型,旨在将视频生成中蕴含的世界动态物理先验与机器人动作学习相结合。实验表明,该模型在多个仿真基准和真实机器人平台上成功验证了预测环境演变并执行控制动作的能力。
在2026云栖大会上,斑马智能正式发布了面向智能终端的全模态端侧大模型AutoOmni 2.0-23B-A3B。斑马智能提出,智能汽车是具身智能规模最大的中试场,将推动智能终端成为生成与处理Token的关键载体。公司强调,端侧AI基础设施的建设与成熟,将直接决定人工智能技术能否在真实物理世界中实现真正的深度落地与广泛应用。
GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。
华为昇腾950超节点在华为全联接大会正式发布上市,定位为业界最大规模商用超节点。该方案通过灵衢互联、统一内存编址等关键技术创新,旨在打破算力、存储和通信三方面的技术瓶颈,解决超大规模集群互联难题,为十万亿级参数大模型的训练与推理场景提供高性能算力基础设施支撑。
觅蜂科技推出物理AI数据众包服务平台“觅蜂派”,采用众包模式让普通用户佩戴自研MEgo采集设备在真实场景中采集具身数据并赚取报酬。该平台目前已积累2万台设备和百万小时级物理数据,致力于解决具身智能领域高质量真实场景数据匮乏的痛点,并已向腾讯Robotics X实验室、蚂蚁灵波等客户提供服务。