智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #仇恨言论检测 #可解释性AI #DistilBERT #Bi-LSTM #LIME

arXiv发布可解释的仇恨言论检测框架:结合DistilBERT与Bi-LSTM实现高效分类

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:arXiv发布了一项关于仇恨言论检测的研究,提出了一种结合DistilBERT与Bi-LSTM的可解释框架。该框架通过注意力机制捕捉文本的上下文语义和序列依赖性,并使用LIME技术增强模型的可解释性。实验结果表明,该模型在二元和多分类任务中均表现出色,在Davidson和SMHS数据集上的F1分数分别达到96.78%和99.53%(二元分类),以及97.00%和94.99%(多分类),显著优于现有基线方法。该研究为构建准确、高效且可解释的仇恨言论检测系统提供了重要参考。


研究背景与挑战

随着社交媒体平台的普及,仇恨言论对社会的和谐、心理健康和公共安全构成了严重威胁。及时且准确的仇恨言论检测对于内容审核系统至关重要。然而,现有研究多集中于二元分类任务,且仅在单一数据集上评估模型性能,缺乏对决策过程的解释性,这限制了其在实际场景中的应用价值。

技术方案

本研究提出了一种多层次且可解释的仇恨言论检测框架,其核心创新点包括:

  1. 模型架构:

    • 结合了DistilBERT(一种轻量级预训练语言模型)的嵌入表示与Bi-LSTM模型,以捕捉文本的上下文语义和序列依赖性。
    • 引入了注意力机制,以增强模型对重要文本特征的聚焦能力。
  2. 可解释性增强:

    • 采用LIME(Local Interpretable Model-agnostic Explanations)技术,对模型预测进行解释,通过高亮关键文本特征来提升透明度。
  3. 多层次评估:

    • 在二元和多分类任务中分别进行评估,以验证模型的泛化能力和鲁棒性。

实验结果

  • 二元分类:

    • Davidson数据集:F1分数为96.78%
    • SMHS数据集:F1分数为99.53%
  • 多分类:

    • Davidson数据集:F1分数为97.00%
    • SMHS数据集:F1分数为94.99%

实验结果表明,该框架在多个数据集上的表现均优于现有基线方法,展示了其在实际应用中的潜力。

结论与展望

该研究展示了将可解释性与高效分类相结合的可行性,为仇恨言论检测领域提供了新的思路。未来研究方向包括进一步优化模型架构以适应更多语言和场景,以及探索更高效的可解释性方法。


消息来源:ArXiv NLP/LLM (cs.CL) (2026-09-25)

—— 完 ——

主题标签: #仇恨言论检测 #可解释性AI #DistilBERT #Bi-LSTM #LIME

社区整体评论区

正在加载实时智能评论与划词标注…