COPE:利用用户嵌入与自评估实现大模型在稀疏反馈下的持续个性化
针对大语言模型在标准对齐后输出同质化、难以满足用户多样化偏好的问题,研究人员提出了COPE优化框架。现有免训练方法多依赖提示工程占用上下文窗口,而微调方法在训练后保持静态,无法持续适应动态偏好。COPE结合个性化用户嵌入与模型自评估机制,有效克服了现实场景中用户反馈稀疏的挑战,实现了大语言模型在部署后的持续个性化优化。
针对大语言模型在标准对齐后输出同质化、难以满足用户多样化偏好的问题,研究人员提出了COPE优化框架。现有免训练方法多依赖提示工程占用上下文窗口,而微调方法在训练后保持静态,无法持续适应动态偏好。COPE结合个性化用户嵌入与模型自评估机制,有效克服了现实场景中用户反馈稀疏的挑战,实现了大语言模型在部署后的持续个性化优化。
关系深度学习将多表数据库建模为异构时序图,目前图Transformer在该领域表现优异。然而,现有代表性模型RelGT存在局部采样子图连接松散阻碍消息传递,以及全局注意力依赖单一特征记忆而忽视宏观动态的两大缺陷。为此,研究人员提出了QUARTET架构,通过结合四分支交叉注意力与随机游走轨迹,增强全自注意力机制在关系图表征中的表达能力。
文本转语音(TTS)系统在处理网络生成文本(如缩写 ppl、imo)时,需根据规范表达而非表面拼写来推断发音。为此,研究人员推出了首个针对英语、越南语和韩语网络文本的字素转音素(G2P)基准 UGTPhon,并配套提出用于细粒度诊断的分类体系。测试显示,现有 G2P 模型及前沿大模型在此类文本上的音素错误率(PER)最高落后 66.8 点。研究团队进一步提出了一种结合规范形式证据的组合式 G2P 基线方法。
工具结果缓存可显著减少智能体训练中的重复计算,但也会耦合采样过程的随机性。最新研究通过一个双动作模型证明,即使独立执行与共享执行在边际上保持了每个采样的条件奖励分布一致,在组内共享随机结果仍可能导致预期的组归一化策略更新方向发生反转。理论推导表明,共享缓存更新反映的是胜负概率之差而非期望奖励之差,揭示了智能体强化学习中常见工程优化策略潜在的算法偏差风险。
扩散语言模型通过迭代去噪生成文本。研究团队发现该类模型中存在一种“稳定但错误锁定”的推理故障,即答案在去噪阶段早期便过早稳定于错误结果。置信度、熵等常规表层解码信号难以有效区分正误锁定。为此,论文将选择性推理修复建模为轻量级测试时规划任务,并提出了 LOCKR,一种基于隐状态轨迹引导的规划器,专门用于检测与修复该问题。
在物理数据同化(DA)工作流中,通常需要平滑算法能够表示物理状态变量的非高斯后验分布,并适配高维物理模拟器。针对这一需求,研究人员提出了 PR-Smoother,一种保留模拟器的摊销平滑方法。该方法的核心设计在于,在证据下界与变分分布族中均显式保留既定的物理模拟器,而非训练替代动力学模型或学习完整轨迹,从而在仅依赖观测窗口训练的同时,保持与模拟器校准的良好兼容性。
传统语言模型的可解释性电路查找通常需要进行大量复杂的干预实验。该研究提出了一种轻量化新方法,将单次前向传播中的注意力视为路由图,筛选出指向答案的关键路径。在归纳和间接宾语识别(IOI)任务中,消融该方法提取的边对模型性能的破坏显著高于随机消融。研究在GPT-2与Pythia模型上验证了该方法的有效性,为低成本理解模型内部机制提供了新路径。
针对现有大语言模型和检索增强生成(RAG)等概率系统易产生幻觉、证据链难以审计及强行作答等缺陷,该研究提出了 LatWeave 框架。LatWeave 将知识组织为多维知识格,并将复杂的多跳问答编译为三个确定性算子:约束交集(meet)、格序比较(compare)与弃权判断(abstain),旨在将知识存储与逻辑推理过程彻底解耦,提供可审计、零幻觉风险且知错能弃权的问答能力。
在堆叠异构视觉骨干网络(如CNN、ViT及其混合架构)以提升精度、校准度与鲁棒性时,常受制于预测空间多重共线性与校准崩溃两大耦合问题。多重共线性会导致元学习器解不稳定,而简单线性堆叠则会加剧各模型的未校准问题,导致模型越多期望校准误差反而越差。现有解决方案均无法同时解决这两种缺陷,为此该研究提出了基于元学习的深度堆叠泛化方法CORE-STACK+以克服这些限制。
针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。
事后重标记通过将转移目标事后替换为实际达到的结果,是提升强化学习样本效率的有效手段。然而,将其自然扩展至偏好条件的多目标强化学习(MORL)时,本研究发现该方法往往适得其反。在 MO-Gymnasium 连续控制测试套件中,针对涵盖两种 Critic 主干和偏好采样方案的四种离线策略算法测试表明,此类重标记会导致性能退化并引发偏好覆盖崩溃。(注:原文摘要结尾处不完整)
该研究指出大模型在多轮对话中的交互失败不仅源于上下文记忆丢失,更深层的原因在于“过早后验坍缩”。即在用户初期意图尚不明确时,模型便过早锁定了某种单一的隐藏假设,导致后续用户给出的澄清信息仅被视为对既定假设的微调,而非彻底纠错。研究团队使用 Gemini-2.5-P 在写作、规划和代码任务中设计了可控实验,系统验证了这一导致模型难以调整错误方向的固有机制。
针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。
该研究探讨了大模型思维链(CoT)在生成最终答案时的因果约束力。作者提出了“基于续写的因果测试”方法,通过扰动某一推理步骤、截断链条并强迫模型基于被破坏的前缀继续生成,用以量化CoT对答案的“承重性”(load-bearingness)。在Gemma-2、Llama-3.1和DeepSeek-R1蒸馏模型上的多项基准测试表明,CoT的因果承重性与任务难度密切相关,简单任务中CoT往往流于形式,而在难任务中则切实主导推理方向。
针对大规模不平衡表格数据在梯度提升树训练中算力消耗过高的问题,研究人员提出了一种名为 CRISP 的线性时间核心集剪枝方法。该方法依据代理模型打分的分位数分层分配多数类(负类)样本预算,并通过样本加权校正不等采样概率。在真实生产级反欺诈数据集上的测试表明,在削减 95% 负类样本、数据总量缩减 93.2%(从 2500 万行降至约 170 万行)的情况下,该模型仍能保留全量数据 99.7% 的平均精度。
该研究探讨了基于失败案例的文本知识蒸馏方法,旨在通过分析任务错误来发现模型的知识漏洞。研究定义了在推理时注入输入的独立“规则原子”,指出其虽然能编码可迁移的任务知识,但也可能包含特定于原模型的推理补丁,从而在跨模型迁移时产生干扰;此外,注入的规则还可能被错误应用于不相关场景并引发误判。(注:原文摘要末尾未完)
传统通用微分方程(UDE)训练依赖通过数值微分方程求解器进行反向传播,其巨大的内存开销远超边缘微控制器的承受能力。为此,研究团队提出TinyUDE框架,引入免求解器的李-泰勒射流匹配方法,将混合向量场直接拟合至观测状态的一阶与二阶时间导数。系统通过Savitzky-Golay滤波实现在线导数估计,在无需自动微分库的情况下获得完全解析梯度,有效攻克了受限边缘设备上的动态系统训练难题。
现有的全双工语音对话模型评测多采用固定窗口规则,机械地通过停顿或打断重叠来判定轮换成败。研究人员指出,响应时机的合理性取决于说话人的潜在意图。为此,该研究提出了评测基准 TACT,包含来自 5 个双人对话语料库的 9,728 个片段(共 73.2 小时),整合了对话历史、说话人记忆画像以及针对 6 类意图的标注,旨在提供更符合人类自然交互习惯的意图条件化轮换评估。
针对多智能体系统中去中心化环境下统一模型维护的难题,本文提出了两种用于多输出高斯过程回归的高效分布式递归高斯过程算法:ADMM-RGP与PDMM-RGP。该研究解决了多智能体在仅依赖本地测量和邻居通信时的高效协同计算问题,能够在量化预测不确定性的同时降低通信与计算开销,为多智能体系统的分布式学习与状态估计提供了新的理论与算法支持。
针对循环语言模型在每个循环步骤重复计算全局注意力导致的高开销问题,研究人员分析了跨循环深度的注意力动态。研究发现,注意力分布和支撑集稳定的时间显著早于隐藏状态与输出,呈现出两阶段特征:前期步骤先确定相关上下文的稀疏工作集,后期步骤则在基本固定的路由支撑上细化表征。基于该发现,论文提出了名为 WISE 的工作集推理方法以优化推理过程(原文摘要末尾有所截断)。
针对复杂推理任务,并行分支的测试时扩展(Test-Time Scaling)已得到广泛应用,但传统的独立重复采样容易生成冗余尝试,制约了推理算力增加所带来的收益。为此,研究团队提出了规划型测试时扩展(PTTS)方法,以协调的联合策略取代独立采样。该架构通过规划器为各个分支生成解答大纲,引导不同分支探索差异化的推理路径,再由执行器生成完整解答,从而提升计算效率和推理表现。
残差矢量量化(RVQ)可将生理波形转换为紧凑的标记序列,但传统掩码建模通常将所有错误标记赋予相同的代价。为此,研究人员提出 GeoRVQ,这是一种由粗到细的掩码标记模型,其优化目标结合了冻结波形解码器的局部响应。该模型通过解码器诱导的成本构建了几何感知软目标与期望失真,并遵循量化因果依赖进行预测。在 MIMIC-IV、VitalDB 和 CODE-15% 等数据集上的实验表明,GeoRVQ 显著提升了标记预测的准确性。
面向推理的大语言模型强化学习能显著提升多步推理与代码能力,但轨迹生成(Rollout)阶段也承担了极高的训练计算成本。如何在保障训练数据新鲜度、一致性与统计有效性的前提下提升 Rollout 效率,已成为当前优化的核心课题。本综述对近年来面向推理的强化学习 Rollout 效率研究进行了系统梳理,从底层机制和性能瓶颈等维度对现有优化方法展开分类,并指出了未来的发展方向。
该研究针对预训练流式生成模型的下游奖励微调问题,提出了一种名为Wasserstein倾斜流的新框架。传统方法多将其表述为基于KL散度正则化的奖励倾斜分布采样,而本研究构建了直接基于预训练漂移的最优传输正则化项。与传统的重加权基分布不同,该目标直接将单个样本输运至高奖励区域,使其等价于一种确定性过程,从而实现了免仿真的强化学习模型优化。
该研究探讨了基于似然的多上下文压缩技术对上下文输入顺序的高度敏感性问题。实验表明,相同上下文集合的不同排列顺序会导致显著不同的关键证据保留结果。论文将这种敏感性归因于“信息抢占”现象,即较早出现的部分相关上下文会提前消耗共享信息的置信度权重,从而压低后续更关键证据载体的增量评分,大幅增加强证据被错误删除的风险。研究通过受控干预实验深入分析了该机制。
针对聚合物性质预测领域缺乏开源、标准化基准且覆盖聚合物结构狭窄的问题,研究团队推出了PolyBench26开源数据集。该基准包含近25万条聚合物性质数据点,涵盖实验测量、密度泛函理论和分子动力学模拟得出的8种物理性质。该数据集支持均聚物、交替共聚物、无规共聚物和嵌段共聚物等多结构类型的四类评估任务,旨在促进机器学习方法在聚合物科学中的规范化评估与对比。
针对阿拉伯语等低资源语言标注数据稀缺的问题,AraGenre 2026 评测任务提出了一种基于定义指导的层级阿拉伯语文体分类基准。该任务要求系统为文本分配宽泛的交际文体以及细粒度的具体文体标签。其公开的训练与开发集主要包含有限的合成与受控样本,而最终测试基准则涵盖了包含现代标准阿拉伯语、古典阿拉伯语及多种方言的真实噪声文本,旨在评估模型利用自然语言定义进行文本分类的泛化能力。
针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。
许多用于节点分类的图神经网络(GNN)将线性分类器应用于局部消息的非负混合中。预测错误往往源于混合权重不佳或可达 logit 集合的几何位置不适合该分类器。该研究通过精确质量线性规划和两种后验修复方法区分了这两类原因。研究表明,每个重加权预测都对应一个中心化的 logit 平移。在8个数据集、8个 GNN 骨干网络及10种划分上的实验表明,重加权使冻结模型的平均准确率从62.6%提升至63.8%。
针对大模型推理加速,现有并行投机解码(PSD)虽能重叠草稿生成与验证过程,但往往依赖对接受前缀和额外标记的预先猜测,猜错会导致批处理回退至低效的串行起草。论文提出 DPara 框架,在复用高效并行草稿器的同时,确保目标模型验证与起草阶段在每一轮均实现重叠,彻底消除了概率性回退缺陷,保障了投机解码流水线的高效利用。注:素材末尾存在文本截断。