DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

研究揭示模型后训练压缩会加剧Whisper语音识别的人口统计学不公平现象

自动语音识别(ASR)模型通常在全精度下接受人口统计公平性审查,但实际生产部署的模型大多经过量化、剪枝和蒸馏等压缩处理。该研究探索了后训练权重压缩是否会重新分配不同人口群体的识别错误负担。在Fair-Speech、Common Voice 25和AfriSpeech-200等数据集上的评测显示,对Whisper-large-v3执行50% Wanda剪枝会显著拉大黑人/非裔与亚裔群体间的词错误率差距,表明压缩会复合加剧时间成本与识别公平性差异。

阅读原文 ↗推荐理由:探讨了模型压缩对语音识别公平性的负面影响,为生产端模型的安全治理与伦理审计提供了实证参考。# Whisper# 模型压缩# AI公平性# 语音识别# 模型剪枝
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:14

科大讯飞发布全国产算力训练语音识别大模型Spark-ASR-2.0

科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。

阅读原文 ↗推荐理由:科大讯飞基于全国产算力推出新一代语音识别大模型,在上下文理解与低成本推理上实现重要升级并已开放落地。# 科大讯飞# 语音识别# 国产算力# ASR# 大模型
9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 73/10012:00

Ruby-ASR:面向正字法与词汇读音联合识别的语音识别监督新方法

针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。

阅读原文 ↗推荐理由:提出创新的监督表征结构,有效解决了日语等语言在语音识别中同字异音的监督信息缺失问题。# 语音识别# ASR# 日语处理# 音素识别# 模型架构
arXiv 人工智能AI 评分 55/10012:00

语音数据集中的性少数群体包容性:审计与实践张力分类研究

该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。

阅读原文 ↗推荐理由:量化揭示了主流语音数据集中边缘群体数据的极度匮乏,为评估语音 AI 偏差与数据伦理治理提供了实证参考。# 语音识别# AI伦理# 数据集审计# 算法公平性# 数据治理