语音数据集中的性少数群体包容性:审计与实践张力分类研究
该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。
该研究审查了现有语音技术数据集中对 LGBTQIA+(酷儿)声音的包容程度,深入分析此类群体代表性缺失的根源。研究人员对6个不同的主流语音数据集进行了审计,结果显示可测量的酷儿声音占比极低(仅占发言者的0%至1.4%),远不足以用于稳健的算法偏见评估。以此群体为案例,研究提出了从边缘化群体采集语音数据时的实际挑战与张力分类法,并与其他数据集展开了对比分析。
该研究针对虚拟助手的人机交互场景,提出了一种新型语音唤醒系统。该方案将传统的直接关键词检测扩展为上下文触发检测,在初始唤醒词激活后,系统利用推理能力区分实际用户指令与无关语音,从而确保高效且具备上下文感知的交互。为支撑训练,研究团队设计了一套数据生成架构,成功合成了包含直接调用、上下文跟进等场景的62.3小时可控多说话人对话语料库。