COMED:平衡多大模型推理中路由与协作的选择性协同机制
针对单一大型语言模型在处理复杂查询时可靠性不足的问题,现有多模型系统通常采用路由分发或密集全量协作。但研究表明,模型协作具有非单调性,引入同行模型在纠正错误的同时也可能破坏已有的正确结果。为此,研究团队提出了COMED机制,作为一种后锚点控制器实现受控的模型升级协商,介于单纯路由与全量协作之间,通过选择性触发跨模型协同来兼顾推理准确率与计算效率。
针对单一大型语言模型在处理复杂查询时可靠性不足的问题,现有多模型系统通常采用路由分发或密集全量协作。但研究表明,模型协作具有非单调性,引入同行模型在纠正错误的同时也可能破坏已有的正确结果。为此,研究团队提出了COMED机制,作为一种后锚点控制器实现受控的模型升级协商,介于单纯路由与全量协作之间,通过选择性触发跨模型协同来兼顾推理准确率与计算效率。
针对大规模文本标注中编码规范(Codebook)构建耗时漫长的问题,该研究提出利用大语言模型(LLM)加速这一流程。方法通过在早期将编码本应用于数据,筛选出多个LLM之间存在显著分歧的疑难样本,从而精准引导专家介入并提供针对性反馈。研究探讨了多种专家反馈形式,包括直接编辑由跨模型分歧驱动生成的修改方案,以及解答模型争议问题等,有效提升了人机协同标注与规范迭代的效率。
当前针对大语言模型在多语言亲属关系理解上的评估多采用多项选择,实质将其简化为识别任务。该研究构建了涵盖印地语、泰米尔语和韩语三种非西方语言的亲属称谓生成基准,测试了5款开源大模型在生成与选择任务中的表现。结果显示,模型普遍存在显著能力断层:GPT OSS 120B在对应选项识别中准确率达90.67%,但在自主生成中的合格率仅为36.00%,Llama 3.3 70B等模型亦呈现相同趋势。
针对大语言模型在司法推理分析中的难点,该研究提出了一个句子级基准,用于评估大模型分类法律解释准则的能力。研究基于传统法学解释理论构建了分类标准,发布了经过句子级人工标注的德国联邦宪法法院判决数据集,并在专家手写提示词设定下,对来自三个模型家族的四款大语言模型进行了基线性能评测。
该论文针对长文本多项选择问答任务,系统测试了学习型上下文规划在强检索、路由、预算选择和重排序控制下的有效性。研究人员基于LongBench-v2的503道多选题目,使用Qwen2.5-7B-Instruct模型进行了对照诊断。结果显示,在18k字符的预算约束下,锚定混合检索可达到36.18%的准确率,揭示了复杂的上下文规划在面临强检索基线时的局限性与表现瓶颈。
针对大语言模型在复杂法律推理中面临的结构性挑战,研究人员提出了LEGO框架。传统RAG及GraphRAG往往侧重词汇或语义相似度,忽略了法律条文间的规范关系;而普通思维链提示易生成缺乏法律规范结构的推导过程。LEGO采用双模块架构,将法律专家GraphRAG与专家级思维链相结合,有效规范了法律条文检索与逻辑推理链路,旨在突破高风险法律领域的推理瓶颈。
在法律文本摘要中,真实性至关重要,因而通常采用内容可溯源的抽取式方法。但现有方法多孤立评估段落等结构单元,忽视了长距离分散证据的有效整合。研究人员提出抽取式摘要模型 LexLattice,将法律文书的层级结构具象化为二维语义网格,并在选择文本前利用带掩码的二维神经元胞自动机对其进行跨区域特征整合,以改善证据整合能力与摘要质量。
大语言模型已被广泛应用于教育对话数据的教学构念标注与分类,但其黑盒推理特性导致难以验证模型对具体话语分类的机理依据。为此,研究团队提出了 EduBehaviors 框架。该框架是一种可解释且具扩展性的教育数据标注方案,通过利用大语言模型量化与多种构念相关的可观测重复行为,进而训练下游分类器,实现标注过程的可追溯与审计(原摘要结尾略有截断)。
研究人员推出了伊利诺伊社会态度综合语料库(ISAAC)及其可复现的处理流水线。该语料库汇集了2007年至2023年间超过5.27亿条英文Reddit帖子,重点围绕种族、性取向、年龄、身体能力、体重和肤色六大社会群体维度。通过多步骤的人工审计过滤流程,各分类的不相关内容比例均控制在10%以下,并且每条帖子均通过算法标注了用户的推断居住区域等元数据,为大规模分析社会群体话语提供了开放工具。
该论文探讨了联合事实核查评分提升背后的机制,分析在固定答案的前提下证据质量对综合评分的独立贡献。研究基于FEVEROUS基准数据集中的7,890条声明及4个DeBERTa模型检查点展开实验。结果显示,将DCUF证据替换为UnifEE证据后,严格核查评分显著提升9.61个百分点,而答案准确率仅提高1.96个百分点。该研究通过细粒度归因,揭示了高质量证据检索对联合事实核查评估指标的决定性影响。
NADI 2026 是精细阿拉伯语方言识别(NADI)系列的第七届共享任务,也是第二次专注于多方言阿拉伯语语音处理的评测。本届任务包含五项核心任务与八个子任务,覆盖自动语音识别(ASR)、方言识别(SDID)、语音合成(TTS)、语音翻译(SLT)和口语理解(SLU)。该评测重点关注低带宽、混合方言、语码转换、域外及零样本等真实场景,并首次在该系列中引入了 TTS、SLT 和 SLU 赛道。
针对大语言推理模型常生成正确却冗长低效的推理链问题,现有优化方法多依赖轨迹级或局部标记信号,未能充分建模步骤间的语义依赖,导致难以有效区分冗余步骤与关键支撑步骤。研究团队提出了 RECAP(通过传播实现的冗余感知信用分配)方法。该方法基于推理步骤在后续推导中的实际下游作用精准分配信用,从而在确保模型推理准确率的前提下精简推理过程,显著提升推理效率。
在利用大语言模型评估社交媒体长文本的公众价值取向时,文本通常夹杂背景信息、引用及少数关键立场句。现有方法直接预测篇章标签易导致过度自信,而传统的句子级聚合投票则忽视了句子间置信度的差异。为此,研究团队将长文本价值测量构建为决策融合问题,并提出了无需训练的“回火证据融合”(TEF)方法,旨在更有效地聚合模型判断并提升长文本价值衡量的准确性。
在科学、医疗、法律和金融等领域解决复杂任务时,通常需要整合分散在海量异构数据源中的关联信息,其规模远超模型自身的上下文长度限制。现有方法多将信息组织为图谱、文本记忆或检索集合等形式以便推理,但其构建方式大多缺乏统一原则。本研究借鉴认知科学等理论,探讨如何规范化构建上下文表示以提升大规模推理能力。由于提供的内容在方法阐述处截断,具体技术细节有待进一步公开。
训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。
文本转语音(TTS)系统在处理网络生成文本(如缩写 ppl、imo)时,需根据规范表达而非表面拼写来推断发音。为此,研究人员推出了首个针对英语、越南语和韩语网络文本的字素转音素(G2P)基准 UGTPhon,并配套提出用于细粒度诊断的分类体系。测试显示,现有 G2P 模型及前沿大模型在此类文本上的音素错误率(PER)最高落后 66.8 点。研究团队进一步提出了一种结合规范形式证据的组合式 G2P 基线方法。
扩散语言模型通过迭代去噪生成文本。研究团队发现该类模型中存在一种“稳定但错误锁定”的推理故障,即答案在去噪阶段早期便过早稳定于错误结果。置信度、熵等常规表层解码信号难以有效区分正误锁定。为此,论文将选择性推理修复建模为轻量级测试时规划任务,并提出了 LOCKR,一种基于隐状态轨迹引导的规划器,专门用于检测与修复该问题。
针对现有大语言模型和检索增强生成(RAG)等概率系统易产生幻觉、证据链难以审计及强行作答等缺陷,该研究提出了 LatWeave 框架。LatWeave 将知识组织为多维知识格,并将复杂的多跳问答编译为三个确定性算子:约束交集(meet)、格序比较(compare)与弃权判断(abstain),旨在将知识存储与逻辑推理过程彻底解耦,提供可审计、零幻觉风险且知错能弃权的问答能力。
针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。
针对企业数据智能体需准确保留业务特定语义的需求,研究人员提出了面向自动化“问题到报告”分析的本体驱动系统 UniDataAgent。该系统将语义获取与在线执行解耦,主要包含两个阶段:本体获取与验证阶段(OAV)利用元数据与业务知识构建版本化的企业本体,并经专家评估验证;执行阶段(QRE)则负责具体任务的检索与生成。输入摘要在执行阶段细节处存在文本截断。
本文探讨了生产级智能客服系统中的核心部署问题:针对意图分类、问答、摘要和工具调用等多项技能,究竟应采用多个专用模型,还是通过多任务微调、连续更新或模型合并训练单一模型。研究团队基于 Qwen、Gemma、Llama 和 Mistral 等 5 个模型家族的 13 款模型(涵盖 0.6B 至 32B 参数),在 4 个公开及 4 个专有客服数据集上展开了系统性评测与策略比较。
针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。
针对网页智能体在实时环境中评估存在状态漂移、难以稳定复现和开展可控训练研究的痛点,研究团队提出了离线评估基准 WebMRE。该基准基于 WebArena 的成功轨迹构建,包含 541 个任务和 5,293 个步骤,配备经过全面审计的测试标签和确定性评估协议,无需运行环境即可确保同一检查点在多次运行中输出一致评分。每个步骤将人类指导语句与具体动作配对,首次实现了对引导与动作相互强化机制的离线研究。
针对越南《个人数据保护法》等法规对机构维护数据处理活动记录(RoPA)的要求,人工准备耗时且云端大模型存在数据主权合规风险。研究团队提出了 RoPA Manager 系统,通过结合基于 tsvector 的词法检索、稠密向量检索以及倒数排名融合(RRF)的混合 RAG 技术,并采用本地部署的大语言模型,实现 RoPA 信息的自动化提取,以兼顾自动化效率与数据主权需求。
现有的全双工语音对话模型评测多采用固定窗口规则,机械地通过停顿或打断重叠来判定轮换成败。研究人员指出,响应时机的合理性取决于说话人的潜在意图。为此,该研究提出了评测基准 TACT,包含来自 5 个双人对话语料库的 9,728 个片段(共 73.2 小时),整合了对话历史、说话人记忆画像以及针对 6 类意图的标注,旨在提供更符合人类自然交互习惯的意图条件化轮换评估。
针对循环语言模型在每个循环步骤重复计算全局注意力导致的高开销问题,研究人员分析了跨循环深度的注意力动态。研究发现,注意力分布和支撑集稳定的时间显著早于隐藏状态与输出,呈现出两阶段特征:前期步骤先确定相关上下文的稀疏工作集,后期步骤则在基本固定的路由支撑上细化表征。基于该发现,论文提出了名为 WISE 的工作集推理方法以优化推理过程(原文摘要末尾有所截断)。
针对复杂推理任务,并行分支的测试时扩展(Test-Time Scaling)已得到广泛应用,但传统的独立重复采样容易生成冗余尝试,制约了推理算力增加所带来的收益。为此,研究团队提出了规划型测试时扩展(PTTS)方法,以协调的联合策略取代独立采样。该架构通过规划器为各个分支生成解答大纲,引导不同分支探索差异化的推理路径,再由执行器生成完整解答,从而提升计算效率和推理表现。
针对跨语言法律问答中跨语言法条检索及避免无依据主张的挑战,研究者推出了基于越南劳动法的双语评估基准,包含231个越英问答对,其中75个针对五类法律推理现象进行了额外标注。研究评估了一种验证器引导的流程,该流程将答案拆解为主张,检测引用可达性与蕴含关系,并纠正引用失效及事实矛盾。此外,该研究还提出了六种用于评估检索证据忠实度的自动化诊断指标。
该研究探讨了基于似然的多上下文压缩技术对上下文输入顺序的高度敏感性问题。实验表明,相同上下文集合的不同排列顺序会导致显著不同的关键证据保留结果。论文将这种敏感性归因于“信息抢占”现象,即较早出现的部分相关上下文会提前消耗共享信息的置信度权重,从而压低后续更关键证据载体的增量评分,大幅增加强证据被错误删除的风险。研究通过受控干预实验深入分析了该机制。
针对阿拉伯语等低资源语言标注数据稀缺的问题,AraGenre 2026 评测任务提出了一种基于定义指导的层级阿拉伯语文体分类基准。该任务要求系统为文本分配宽泛的交际文体以及细粒度的具体文体标签。其公开的训练与开发集主要包含有限的合成与受控样本,而最终测试基准则涵盖了包含现代标准阿拉伯语、古典阿拉伯语及多种方言的真实噪声文本,旨在评估模型利用自然语言定义进行文本分类的泛化能力。