基于DistilBERT-BiLSTM-Attention的可解释仇恨言论检测框架
针对社交媒体仇恨言论检测多局限于二分类、单数据集评估且缺乏决策可解释性的问题,该研究提出了一种多层级且具备可解释性的仇恨言论检测框架。该框架融合了DistilBERT、双向长短期记忆网络(BiLSTM)与注意力机制,旨在同时支持二分类与多类别分类任务,并增强模型预测推理过程的透明度与实际应用价值,助力内容审查系统的部署。
针对社交媒体仇恨言论检测多局限于二分类、单数据集评估且缺乏决策可解释性的问题,该研究提出了一种多层级且具备可解释性的仇恨言论检测框架。该框架融合了DistilBERT、双向长短期记忆网络(BiLSTM)与注意力机制,旨在同时支持二分类与多类别分类任务,并增强模型预测推理过程的透明度与实际应用价值,助力内容审查系统的部署。
针对SHAP和LIME等事后解释方法在阿拉伯语、波斯语、乌尔都语和希伯来语等从右至左(RTL)语言中出现的可视化失效问题,该研究进行了系统评估与修正。论文指出,尽管特征归因在数学计算上依然有效,但现有可视化渲染会导致词元顺序错乱、连字符断裂及图表阅读方向错误。研究将此界定为可视化层面的工程缺陷,并提出了针对性的度量基准与渲染校正方案。
针对强化学习策略通常以不透明神经权重分发、训练日志难以解释模型具体学到何种行为的问题,该研究探讨了能否通过可审计的离散行为规则来表征和组合独立训练的策略。作者将“可审计性”拆解为轨迹完整性、无损编码、规则覆盖率、行为一致性、组合质量和价值模型可靠性六项独立可测试的属性,并采用共享冻结符号化器、被动规则提取及只追加的哈希绑定账本等机制构建验证协议。
序列推荐系统通过用户历史交互序列驱动下一步决策,是现代个性化服务的核心。基于CNN和Transformer的深度学习架构虽能有效捕获时序依赖,但其非线性特征导致模型沦为黑盒。为了提升模型透明度与信任度,帮助开发者审查模型行为并为用户提供推荐依据,该研究针对序列推荐系统中的时序归因可解释性方法展开系统化基准评估(注:原论文摘要结尾存在截断,具体评估结果详见完整论文)。