arXiv发布可解释的仇恨言论检测框架:结合DistilBERT与Bi-LSTM实现高效分类
文 / Mr.Xu
发布时间:
摘要:arXiv发布了一项关于仇恨言论检测的研究,提出了一种结合DistilBERT与Bi-LSTM的可解释框架。该框架通过注意力机制捕捉文本的上下文语义和序列依赖性,并使用LIME技术增强模型的可解释性。实验结果表明,该模型在二元和多分类任务中均表现出色,在Davidson和SMHS数据集上的F1分数分别达到96.78%和99.53%(二元分类),以及97.00%和94.99%(多分类),显著优于现有基线方法。该研究为构建准确、高效且可解释的仇恨言论检测系统提供了重要参考。
研究背景与挑战
随着社交媒体平台的普及,仇恨言论对社会的和谐、心理健康和公共安全构成了严重威胁。及时且准确的仇恨言论检测对于内容审核系统至关重要。然而,现有研究多集中于二元分类任务,且仅在单一数据集上评估模型性能,缺乏对决策过程的解释性,这限制了其在实际场景中的应用价值。
技术方案
本研究提出了一种多层次且可解释的仇恨言论检测框架,其核心创新点包括:
-
模型架构:
- 结合了DistilBERT(一种轻量级预训练语言模型)的嵌入表示与Bi-LSTM模型,以捕捉文本的上下文语义和序列依赖性。
- 引入了注意力机制,以增强模型对重要文本特征的聚焦能力。
-
可解释性增强:
- 采用LIME(Local Interpretable Model-agnostic Explanations)技术,对模型预测进行解释,通过高亮关键文本特征来提升透明度。
-
多层次评估:
- 在二元和多分类任务中分别进行评估,以验证模型的泛化能力和鲁棒性。
实验结果
-
二元分类:
- Davidson数据集:F1分数为96.78%
- SMHS数据集:F1分数为99.53%
-
多分类:
- Davidson数据集:F1分数为97.00%
- SMHS数据集:F1分数为94.99%
实验结果表明,该框架在多个数据集上的表现均优于现有基线方法,展示了其在实际应用中的潜力。
结论与展望
该研究展示了将可解释性与高效分类相结合的可行性,为仇恨言论检测领域提供了新的思路。未来研究方向包括进一步优化模型架构以适应更多语言和场景,以及探索更高效的可解释性方法。
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-09-25)
主题标签: #仇恨言论检测 #可解释性AI #DistilBERT #Bi-LSTM #LIME
社区整体评论区