ArXiv发布研究:利用大语言模型实现移动应用评论的细粒度情感分类
文 / Mr.Xu
发布时间:
摘要:ArXiv发布了一项关于利用大语言模型(LLM)进行移动应用评论细粒度情感分类的研究。该研究基于Plutchik的情感分类体系,探讨了在大规模类别不平衡情况下,LLM在多标签情感分类任务中的表现。研究表明,LLM能够有效提升情感分类的准确性,尤其在处理罕见情感类别时表现突出。该研究还开源了实验流程、合成语料库和微调模型,为需求工程中的情感分析提供了新的技术路径。
研究背景与目标
移动应用评论的情感分类是需求工程中的重要环节,能够帮助开发者更好地理解用户需求和反馈。然而,细粒度情感分类由于其复杂性,一直是研究的难点。本研究旨在探讨大语言模型(LLM)在细粒度、多标签情感分类任务中的表现,特别是在类别严重不平衡的情况下。
研究方法
研究采用了以下方法:
- 模型对比:对比了编码器-解码器模型和仅解码器模型在不同提示策略下的表现。
- 不平衡处理策略:应用了多种不平衡处理策略,包括损失重加权、重采样和生成式数据增强。
- 实验设计:通过内在增强效用排序选择合成评论生成器和提示策略。
主要发现
- 模型表现:仅解码器的少样本提示策略在基线条件下表现最佳(宏观F1 0.642),而编码器微调模型在多标签和二元集成形式下表现较差(分别为0.387和0.450)。
- 改进策略:将最佳多标签编码器与生成式数据增强和正权重损失结合后,显著缩小了与最佳解码器模型的差距(+0.204),且推理延迟降低了三个数量级。
- 稀有情感处理:在稀有情感类别上,模型表现提升最为显著,从未检测到提升到+0.501 F1。
结论与影响
LLM使得细粒度、多标签情感分类在需求工程中成为可能,尽管宏观F1值较为适中,但最佳模型和策略的选择取决于具体的模型架构和任务形式。研究团队还开源了实验流程、合成语料库和微调模型,为后续研究和应用提供了重要资源。
开发者建议
- 模型选择:在处理细粒度情感分类任务时,建议优先考虑解码器模型,并结合生成式数据增强策略。
- 资源优化:对于资源受限的应用场景,可以考虑使用编码器模型并应用正权重损失策略,以在较低延迟下获得较高性能。
- 数据增强:利用合成数据生成器可以有效缓解类别不平衡问题,提升模型对稀有情感的识别能力。
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-06)
社区整体评论区
正在加载实时智能评论与划词标注…