DCAI
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

COMED:平衡多大模型推理中路由与协作的选择性协同机制

针对单一大型语言模型在处理复杂查询时可靠性不足的问题,现有多模型系统通常采用路由分发或密集全量协作。但研究表明,模型协作具有非单调性,引入同行模型在纠正错误的同时也可能破坏已有的正确结果。为此,研究团队提出了COMED机制,作为一种后锚点控制器实现受控的模型升级协商,介于单纯路由与全量协作之间,通过选择性触发跨模型协同来兼顾推理准确率与计算效率。

阅读原文 ↗推荐理由:指出多模型协作可能破坏正确答案的关键痛点,提出了兼顾性能与成本的选择性模型协作新范式。# 多模型推理# 大语言模型# 模型路由# 协同推理# COMED
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

利用跨LLM分歧引导专家参与:大规模数据标注编码本的高效修订方法

针对大规模文本标注中编码规范(Codebook)构建耗时漫长的问题,该研究提出利用大语言模型(LLM)加速这一流程。方法通过在早期将编码本应用于数据,筛选出多个LLM之间存在显著分歧的疑难样本,从而精准引导专家介入并提供针对性反馈。研究探讨了多种专家反馈形式,包括直接编辑由跨模型分歧驱动生成的修改方案,以及解答模型争议问题等,有效提升了人机协同标注与规范迭代的效率。

阅读原文 ↗推荐理由:提出通过跨模型分歧精准定位边界案例并调度专家精力,为大模型时代的大规模数据标注工程提供了新范式。# 大语言模型# 数据标注# 人机协同# 标注规范# 主动学习
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

大模型在多语言亲属称谓上“能识别却难生成”:文化特定词汇生成基准研究

当前针对大语言模型在多语言亲属关系理解上的评估多采用多项选择,实质将其简化为识别任务。该研究构建了涵盖印地语、泰米尔语和韩语三种非西方语言的亲属称谓生成基准,测试了5款开源大模型在生成与选择任务中的表现。结果显示,模型普遍存在显著能力断层:GPT OSS 120B在对应选项识别中准确率达90.67%,但在自主生成中的合格率仅为36.00%,Llama 3.3 70B等模型亦呈现相同趋势。

阅读原文 ↗推荐理由:揭示了大语言模型在非西方语言文化词汇上“易于识别、难于主动生成”的显著能力脱节问题。# 大语言模型# 生成基准# 多语言NLP# 文化对齐# 模型评估
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

句子级法律解释准则分类:基于德国联邦宪法法院判决的评测基准

针对大语言模型在司法推理分析中的难点,该研究提出了一个句子级基准,用于评估大模型分类法律解释准则的能力。研究基于传统法学解释理论构建了分类标准,发布了经过句子级人工标注的德国联邦宪法法院判决数据集,并在专家手写提示词设定下,对来自三个模型家族的四款大语言模型进行了基线性能评测。

阅读原文 ↗推荐理由:该研究构建了首个针对德国宪法判决的句子级法律解释基准,推进了大模型在细粒度法律推理评测中的应用。# 法律大模型# 司法推理# 基准测试# NLP# 法律解释
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

长文本问答实证研究:学习型上下文规划为何难以超越强检索基线

该论文针对长文本多项选择问答任务,系统测试了学习型上下文规划在强检索、路由、预算选择和重排序控制下的有效性。研究人员基于LongBench-v2的503道多选题目,使用Qwen2.5-7B-Instruct模型进行了对照诊断。结果显示,在18k字符的预算约束下,锚定混合检索可达到36.18%的准确率,揭示了复杂的上下文规划在面临强检索基线时的局限性与表现瓶颈。

阅读原文 ↗推荐理由:通过严谨的对照实验探讨了长文本问答中复杂上下文规划相较于强检索基线的实际有效性边界。# 长文本问答# 检索增强生成# 上下文规划# 基准评测# 重排序
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

LEGO:融合专家GraphRAG与思维链的法律推理框架

针对大语言模型在复杂法律推理中面临的结构性挑战,研究人员提出了LEGO框架。传统RAG及GraphRAG往往侧重词汇或语义相似度,忽略了法律条文间的规范关系;而普通思维链提示易生成缺乏法律规范结构的推导过程。LEGO采用双模块架构,将法律专家GraphRAG与专家级思维链相结合,有效规范了法律条文检索与逻辑推理链路,旨在突破高风险法律领域的推理瓶颈。

阅读原文 ↗推荐理由:将GraphRAG与结构化思维链引入垂直法律推理,针对性解决了条文规范关系缺失与逻辑幻觉难题。# 法律大模型# GraphRAG# 思维链# 知识检索# 法律推理
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

LexLattice:基于文档层级与神经元胞自动机的多语言抽取式摘要模型

在法律文本摘要中,真实性至关重要,因而通常采用内容可溯源的抽取式方法。但现有方法多孤立评估段落等结构单元,忽视了长距离分散证据的有效整合。研究人员提出抽取式摘要模型 LexLattice,将法律文书的层级结构具象化为二维语义网格,并在选择文本前利用带掩码的二维神经元胞自动机对其进行跨区域特征整合,以改善证据整合能力与摘要质量。

阅读原文 ↗推荐理由:创新性地将二维神经元胞自动机应用于长文档层级结构建模,为法律领域的抽取式摘要提供了新架构思路。# 抽取式摘要# 神经元胞自动机# 法律文本# 自然语言处理# 长文本建模
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

EduBehaviors:面向教育对话可审计标注的断言架构框架

大语言模型已被广泛应用于教育对话数据的教学构念标注与分类,但其黑盒推理特性导致难以验证模型对具体话语分类的机理依据。为此,研究团队提出了 EduBehaviors 框架。该框架是一种可解释且具扩展性的教育数据标注方案,通过利用大语言模型量化与多种构念相关的可观测重复行为,进而训练下游分类器,实现标注过程的可追溯与审计(原摘要结尾略有截断)。

阅读原文 ↗推荐理由:针对大语言模型在教育数据黑盒标注中的可信度痛点,提出了一套兼顾可解释性与可扩展性的审计框架。# 大语言模型# 教育对话# 数据标注# 可解释性# EduBehaviors
arXiv 自然语言处理✦ 精选AI 评分 60/10012:00

研究人员开源ISAAC大规模社会态度语料库,覆盖超5.27亿条Reddit帖子

研究人员推出了伊利诺伊社会态度综合语料库(ISAAC)及其可复现的处理流水线。该语料库汇集了2007年至2023年间超过5.27亿条英文Reddit帖子,重点围绕种族、性取向、年龄、身体能力、体重和肤色六大社会群体维度。通过多步骤的人工审计过滤流程,各分类的不相关内容比例均控制在10%以下,并且每条帖子均通过算法标注了用户的推断居住区域等元数据,为大规模分析社会群体话语提供了开放工具。

阅读原文 ↗推荐理由:发布了跨度长达17年、规模超5亿条的高质量社会群体话语标注语料库,为自然语言处理与计算社会科学研究提供了重要资源。# 语料库# 数据工程# NLP# 社交网络# 计算社会科学
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

事实核查评分提升由何驱动?针对验证模型与大语言模型的证据与答案归因研究

该论文探讨了联合事实核查评分提升背后的机制,分析在固定答案的前提下证据质量对综合评分的独立贡献。研究基于FEVEROUS基准数据集中的7,890条声明及4个DeBERTa模型检查点展开实验。结果显示,将DCUF证据替换为UnifEE证据后,严格核查评分显著提升9.61个百分点,而答案准确率仅提高1.96个百分点。该研究通过细粒度归因,揭示了高质量证据检索对联合事实核查评估指标的决定性影响。

阅读原文 ↗推荐理由:深入解耦了事实核查任务中证据检索与预测答案对评分的各自贡献,为大模型事实性评估提供了严谨的分析框架。# 事实核查# 大语言模型# 模型评测# 自然语言处理# DeBERTa
arXiv 自然语言处理✦ 精选AI 评分 62/10012:00

NADI 2026:第二届多方言阿拉伯语语音处理共享任务发布

NADI 2026 是精细阿拉伯语方言识别(NADI)系列的第七届共享任务,也是第二次专注于多方言阿拉伯语语音处理的评测。本届任务包含五项核心任务与八个子任务,覆盖自动语音识别(ASR)、方言识别(SDID)、语音合成(TTS)、语音翻译(SLT)和口语理解(SLU)。该评测重点关注低带宽、混合方言、语码转换、域外及零样本等真实场景,并首次在该系列中引入了 TTS、SLT 和 SLU 赛道。

阅读原文 ↗推荐理由:该任务系统性推进了多方言及低资源阿拉伯语语音处理的基准建设,涵盖多项复杂真实场景评估。# 语音处理# 阿拉伯语方言# 基准评测# ASR# TTS
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

RECAP:面向大语言模型高效推理的冗余感知归因学习

针对大语言推理模型常生成正确却冗长低效的推理链问题,现有优化方法多依赖轨迹级或局部标记信号,未能充分建模步骤间的语义依赖,导致难以有效区分冗余步骤与关键支撑步骤。研究团队提出了 RECAP(通过传播实现的冗余感知信用分配)方法。该方法基于推理步骤在后续推导中的实际下游作用精准分配信用,从而在确保模型推理准确率的前提下精简推理过程,显著提升推理效率。

阅读原文 ↗推荐理由:针对大语言模型推理过程冗长低效的痛点,提出了通过建模步骤依赖关系来精简推理链的新算法。# 大语言模型# 高效推理# 思维链# 模型优化# RECAP
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

基于证据融合的LLM长文本价值测量新方法TEF

在利用大语言模型评估社交媒体长文本的公众价值取向时,文本通常夹杂背景信息、引用及少数关键立场句。现有方法直接预测篇章标签易导致过度自信,而传统的句子级聚合投票则忽视了句子间置信度的差异。为此,研究团队将长文本价值测量构建为决策融合问题,并提出了无需训练的“回火证据融合”(TEF)方法,旨在更有效地聚合模型判断并提升长文本价值衡量的准确性。

阅读原文 ↗推荐理由:提出了一种解决大模型在长文本价值评估中置信度不均衡问题的无训练融合算法。# 大语言模型# 长文本分析# 证据融合# 观点挖掘# 自然语言处理
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

抓住关键信息:面向大规模复杂推理的原则性上下文表示方法

在科学、医疗、法律和金融等领域解决复杂任务时,通常需要整合分散在海量异构数据源中的关联信息,其规模远超模型自身的上下文长度限制。现有方法多将信息组织为图谱、文本记忆或检索集合等形式以便推理,但其构建方式大多缺乏统一原则。本研究借鉴认知科学等理论,探讨如何规范化构建上下文表示以提升大规模推理能力。由于提供的内容在方法阐述处截断,具体技术细节有待进一步公开。

阅读原文 ↗推荐理由:针对大模型超长异构上下文推理面临的信息组织碎片化痛点,提出了规范化的上下文表示新思路。# 大模型推理# 上下文表示# 复杂推理# 认知建模# 长上下文
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

超越重叠:评估基准数据泄露对模型性能因果效应的LeakScale框架

训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。

阅读原文 ↗推荐理由:提出了一种基于反事实干预的新框架,有效解决了大语言模型基准数据污染难以量化因果影响的痛点。# 基准评测# 数据污染# 因果推断# 大语言模型# 模型评估
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

面向网络生成文本的字素转音素基准 UGTPhon:涵盖多语言与组合式方法

文本转语音(TTS)系统在处理网络生成文本(如缩写 ppl、imo)时,需根据规范表达而非表面拼写来推断发音。为此,研究人员推出了首个针对英语、越南语和韩语网络文本的字素转音素(G2P)基准 UGTPhon,并配套提出用于细粒度诊断的分类体系。测试显示,现有 G2P 模型及前沿大模型在此类文本上的音素错误率(PER)最高落后 66.8 点。研究团队进一步提出了一种结合规范形式证据的组合式 G2P 基线方法。

阅读原文 ↗推荐理由:针对语音合成在处理网络缩写及非规范文本时的发音难题,首创了多语言 G2P 基准与评估分类体系。# 文本转语音# G2P# 基准测试# 网络文本# 大语言模型
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

LOCKR:基于隐状态轨迹引导检测与修复扩散语言模型的推理锁定问题

扩散语言模型通过迭代去噪生成文本。研究团队发现该类模型中存在一种“稳定但错误锁定”的推理故障,即答案在去噪阶段早期便过早稳定于错误结果。置信度、熵等常规表层解码信号难以有效区分正误锁定。为此,论文将选择性推理修复建模为轻量级测试时规划任务,并提出了 LOCKR,一种基于隐状态轨迹引导的规划器,专门用于检测与修复该问题。

阅读原文 ↗推荐理由:针对扩散语言模型迭代去噪中过早锁定错误答案的核心缺陷,提出了轻量级测试时规划修复机制。# 扩散语言模型# 推理修复# 隐状态# 测试时计算# 深度学习
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

LatWeave:基于知识格的确定性多跳问答框架

针对现有大语言模型和检索增强生成(RAG)等概率系统易产生幻觉、证据链难以审计及强行作答等缺陷,该研究提出了 LatWeave 框架。LatWeave 将知识组织为多维知识格,并将复杂的多跳问答编译为三个确定性算子:约束交集(meet)、格序比较(compare)与弃权判断(abstain),旨在将知识存储与逻辑推理过程彻底解耦,提供可审计、零幻觉风险且知错能弃权的问答能力。

阅读原文 ↗推荐理由:通过引入形式化知识格与确定性算子,为解决大模型多跳推理中的幻觉与审计难题提供了新范式。# 多跳问答# 知识图谱# 确定性推理# RAG# 模型幻觉
arXiv 自然语言处理✦ 精选AI 评分 78/10012:00

Transformer语言模型的序列计算蒸馏方法

针对Transformer语言模型在自回归生成中长上下文计算开销大的问题,研究人员提出了一种序列计算蒸馏方法。该方法观察到许多相邻Token片段具有高度可预测性或常作为稳定单元出现,因而具备可压缩性。研究设计了一个轻量级合并模块,可动态将输入的多个Token片段替换为单个折叠表征,利用该替代嵌入捕捉原多Token序列的功能角色,从而减少序列计算开销并提升处理效率。

阅读原文 ↗推荐理由:提出了一种动态压缩Token序列以减少Transformer自回归计算开销的高效架构优化方案。# Transformer# 模型压缩# 序列计算# 注意力机制# AI架构
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

UniDataAgent:基于本体的企业级自动化数据分析智能体

针对企业数据智能体需准确保留业务特定语义的需求,研究人员提出了面向自动化“问题到报告”分析的本体驱动系统 UniDataAgent。该系统将语义获取与在线执行解耦,主要包含两个阶段:本体获取与验证阶段(OAV)利用元数据与业务知识构建版本化的企业本体,并经专家评估验证;执行阶段(QRE)则负责具体任务的检索与生成。输入摘要在执行阶段细节处存在文本截断。

阅读原文 ↗推荐理由:展示了结合本体工程解决企业级 LLM 数据智能体业务语义对齐与报告生成的工程实践。# UniDataAgent# 智能体# 企业级应用# 本体工程# 自动化报告
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

单模型能否搞定一切?面向智能客服的大语言模型微调策略选择研究

本文探讨了生产级智能客服系统中的核心部署问题:针对意图分类、问答、摘要和工具调用等多项技能,究竟应采用多个专用模型,还是通过多任务微调、连续更新或模型合并训练单一模型。研究团队基于 Qwen、Gemma、Llama 和 Mistral 等 5 个模型家族的 13 款模型(涵盖 0.6B 至 32B 参数),在 4 个公开及 4 个专有客服数据集上展开了系统性评测与策略比较。

阅读原文 ↗推荐理由:针对企业客服落地场景系统对比了多任务微调与专用模型策略,具备较强的实际工程参考价值。# 智能客服# 大语言模型# 模型微调# 多任务学习# 应用工程
arXiv 自然语言处理✦ 精选AI 评分 73/10012:00

Ruby-ASR:面向正字法与词汇读音联合识别的语音识别监督新方法

针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。

阅读原文 ↗推荐理由:提出创新的监督表征结构,有效解决了日语等语言在语音识别中同字异音的监督信息缺失问题。# 语音识别# ASR# 日语处理# 音素识别# 模型架构
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

引导与动作的相互强化:多模态网页智能体离线评测基准 WebMRE

针对网页智能体在实时环境中评估存在状态漂移、难以稳定复现和开展可控训练研究的痛点,研究团队提出了离线评估基准 WebMRE。该基准基于 WebArena 的成功轨迹构建,包含 541 个任务和 5,293 个步骤,配备经过全面审计的测试标签和确定性评估协议,无需运行环境即可确保同一检查点在多次运行中输出一致评分。每个步骤将人类指导语句与具体动作配对,首次实现了对引导与动作相互强化机制的离线研究。

阅读原文 ↗推荐理由:提出了无需实时环境的确定性离线基准,有效解决了网页智能体评测难以复现和量化的核心痛点。# 网页智能体# 离线基准# WebArena# 智能体评估# 多模态
arXiv 自然语言处理规则精选12:00

Automated Extraction of Records of Processing Activities (RoPA) Using Hybrid RAG and Locally Deployed Large Language Models

arXiv:2609.27359v1 Announce Type: new Abstract: Vietnam's Personal Data Protection Law (Law No. 91/2025/QH15) and Decree No. 356/2025/ND-CP, effective January 1, 2026, require organizations to establish and maintain Records of Processing Activities (RoPA). Manual RoPA preparation is labor-intensive, while cloud-hosted large language models (LLMs) may conflict with data-sovereignty requirements. We propose RoPA Manager, a system for automated RoPA information extraction using hybrid retrieval that combines lexical ranking over tsvector, dense-vector search, Reciprocal Rank Fusion (RRF), and locally deployed LLMs. We introduce a Vietnamese RoPA

arXiv 自然语言处理规则精选12:00

Neither Silence nor Overlap Is Failure: Intent-Conditioned Evaluation of Turn-Taking in Full-Duplex Spoken Dialogue Models

arXiv:2609.27372v1 Announce Type: new Abstract: Benchmarks for full-duplex spoken dialogue models score turn-taking with binary fixed-window rules that reward immediate response or silence by completeness of the prior turn. We argue that the appropriateness of a response offset, whether delayed silence or anticipatory overlap, is conditional on the speaker's latent intent, identifiable only from that speaker's behavior. We introduce TACT, a benchmark of 9,728 episodes and 73.2 hours from five dyadic corpora; each episode carries dialogue history, a per-speaker memory profile, and an annotator-derived posterior over six intent classes. Scoring

arXiv 自然语言处理规则精选12:00

Attention Routing Stabilizes Early: Working-Set Inference for Recurrent Language Models

arXiv:2609.27373v1 Announce Type: new Abstract: Recurrent language models repeatedly apply shared network blocks to refine latent representations, but standard inference recomputes global attention at every recurrent step. We study attention dynamics across recurrent depth and find that attention support and distributions stabilize substantially earlier than hidden states and attention outputs. This suggests a two-stage structure: early steps discover a sparse working set of relevant context, while later steps refine representations over largely the same routing support. Motivated by this structure, we introduce WISE (Working-set Inference wi

arXiv 自然语言处理规则精选12:00

Planned Test-Time Scaling with Coordinated Reasoning Paths

arXiv:2609.27374v1 Announce Type: new Abstract: Test-time scaling with parallel branches is widely adopted to improve performance on challenging reasoning tasks. The predominant approach, repeated sampling, draws branches independently from a single policy, which can produce redundant attempts and thereby limit the gains from additional inference compute. To address this limitation, we propose Planned Test-Time Scaling (PTTS), which replaces independent sampling with a coordinated joint policy: a planner generates a solution outline for each branch, steering the branches toward distinct reasoning paths, and an executor produces a full solutio

arXiv 自然语言处理规则精选12:00

Cross-Lingual Legal QA for Vietnamese Labour Law: Retrieval, Translation, and Verifier-Guided Correction

arXiv:2609.27376v1 Announce Type: new Abstract: Cross-lingual legal question answering must retrieve statutes across languages while preventing unsupported legal claims. We introduce a bilingual evaluation suite of 231 Vietnamese--English question--answer pairs from Vietnamese labour law. Of these, 75 are additionally annotated for five challenging legal reasoning phenomena. We evaluate a verifier-guided pipeline that decomposes answers into claims, checks citation reachability and entailment, and corrects citation failures and contradictions. We also introduce six automatic diagnostics for faithfulness to retrieved evidence, covering citatio

arXiv 自然语言处理规则精选12:00

MORSE: Multi-Context Ordering via Reverse Scoring for Evidence-Preserving Compression

arXiv:2609.27380v1 Announce Type: new Abstract: Likelihood-based context compression can account for cross-context redundancy through sequential scoring, but this makes compression outcomes sensitive to context order. We show that different permutations of the same context collection can produce markedly different evidence-retention outcomes under an unchanged compressor. We attribute this sensitivity to information preemption: earlier partially relevant contexts can absorb credit for shared information, suppressing the incremental score of later, stronger evidence carriers and increasing their risk of removal. Controlled pair-swap interventi

arXiv 自然语言处理规则精选12:00

AraGenre 2026: A Hierarchical Definition-Guided Arabic Genre Classification Shared Task

arXiv:2609.27387v1 Announce Type: new Abstract: AraGenre is a shared task on hierarchical, definition-guided Arabic genre classification, motivated by the limited availability of annotated data in Arabic and other low-resource languages. Systems assign each Arabic text segment both a broad communicative genre and a fine-grained specific genre. The released training and development sets contain limited, primarily synthetic and controlled examples, whereas the hidden final benchmark contains noisier naturally occurring text spanning Modern Standard Arabic, Classical Arabic, and multiple dialects. Participants received natural-language definitio