Ruby-ASR:面向正字法与词汇读音联合识别的语音识别监督新方法
针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。
针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。
该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。