9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00
自动语音识别(ASR)模型通常在全精度下接受人口统计公平性审查,但实际生产部署的模型大多经过量化、剪枝和蒸馏等压缩处理。该研究探索了后训练权重压缩是否会重新分配不同人口群体的识别错误负担。在Fair-Speech、Common Voice 25和AfriSpeech-200等数据集上的评测显示,对Whisper-large-v3执行50% Wanda剪枝会显著拉大黑人/非裔与亚裔群体间的词错误率差距,表明压缩会复合加剧时间成本与识别公平性差异。
arXiv 自然语言处理✦ 精选AI 评分 65/10012:00
针对孟加拉语在神经文本转语音(TTS)领域缺乏高质量长文本朗读资源的现状,研究人员推出了BanglaKontho数据集。该数据集源自专业有声读物录音,包含20小时单人发音数据、7050条经转写校验的24 kHz切分片段,旨在解决现有语料缺乏长文本韵律与连贯叙述的问题。此外,研究团队还发布了支持孟加拉风格数字分组、货币与日期表达的文本正则化工具。
arXiv 自然语言处理AI 评分 58/10012:00
该研究提出了用于孟加拉语对话语音话轮结束(End-of-Turn)检测的基准语料库BanglaTurn及配套模型。该语料库包含35,374段时长3至15秒的播客语音,通过说话人日志结合大语言模型初标并经人工全面核验。研究构建了结合Whisper编码器与特定任务分类头的模型,在平衡测试集上达到84.33%的准确率,较基线Smart-Turn v3的69.28%显著提升,并将假阴性率从51.57%降低至7.5%。
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00
针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。