语音数据集中的性少数群体包容性:审计与实践张力分类研究
该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。
该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。