智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #大语言模型 #情感分析 #需求工程 #数据增强 #不平衡处理

ArXiv发布研究:利用大语言模型实现移动应用评论的细粒度情感分类

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:ArXiv发布了一项关于利用大语言模型(LLM)进行移动应用评论细粒度情感分类的研究。该研究基于Plutchik的情感分类体系,探讨了在大规模类别不平衡情况下,LLM在多标签情感分类任务中的表现。研究表明,LLM能够有效提升情感分类的准确性,尤其在处理罕见情感类别时表现突出。该研究还开源了实验流程、合成语料库和微调模型,为需求工程中的情感分析提供了新的技术路径。


研究背景与目标

移动应用评论的情感分类是需求工程中的重要环节,能够帮助开发者更好地理解用户需求和反馈。然而,细粒度情感分类由于其复杂性,一直是研究的难点。本研究旨在探讨大语言模型(LLM)在细粒度、多标签情感分类任务中的表现,特别是在类别严重不平衡的情况下。

研究方法

研究采用了以下方法:

  • 模型对比:对比了编码器-解码器模型和仅解码器模型在不同提示策略下的表现。
  • 不平衡处理策略:应用了多种不平衡处理策略,包括损失重加权、重采样和生成式数据增强。
  • 实验设计:通过内在增强效用排序选择合成评论生成器和提示策略。

主要发现

  1. 模型表现:仅解码器的少样本提示策略在基线条件下表现最佳(宏观F1 0.642),而编码器微调模型在多标签和二元集成形式下表现较差(分别为0.387和0.450)。
  2. 改进策略:将最佳多标签编码器与生成式数据增强和正权重损失结合后,显著缩小了与最佳解码器模型的差距(+0.204),且推理延迟降低了三个数量级。
  3. 稀有情感处理:在稀有情感类别上,模型表现提升最为显著,从未检测到提升到+0.501 F1。

结论与影响

LLM使得细粒度、多标签情感分类在需求工程中成为可能,尽管宏观F1值较为适中,但最佳模型和策略的选择取决于具体的模型架构和任务形式。研究团队还开源了实验流程、合成语料库和微调模型,为后续研究和应用提供了重要资源。

开发者建议

  • 模型选择:在处理细粒度情感分类任务时,建议优先考虑解码器模型,并结合生成式数据增强策略。
  • 资源优化:对于资源受限的应用场景,可以考虑使用编码器模型并应用正权重损失策略,以在较低延迟下获得较高性能。
  • 数据增强:利用合成数据生成器可以有效缓解类别不平衡问题,提升模型对稀有情感的识别能力。

消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-06)

—— 完 ——

主题标签: #大语言模型 #情感分析 #需求工程 #数据增强 #不平衡处理

社区整体评论区

正在加载实时智能评论与划词标注…