ArXiv发布首个大规模波斯语-英语代码混合标注语料库PERCEPT
文 / Mr.Xu
发布时间:
摘要:ArXiv发布首个公开的大规模波斯语-英语代码混合语料库PERCEPT,该语料库包含6800条社交媒体帖子,并首次对代码混合词汇进行了通用依存关系(UD)词性标注。该语料库由X、Instagram和Digikala等平台收集,并采用大语言模型辅助标注框架进行自动化标注。PERCEPT的发布填补了波斯语-英语代码混合研究领域的空白,为语言学分析和NLP模型开发提供了重要资源。
核心突破
ArXiv近日发布了一个名为PERCEPT的新数据集,这是首个公开的大规模波斯语-英语代码混合语料库,并首次对代码混合词汇进行了通用依存关系(UD)词性标注。该语料库包含6800条来自X、Instagram和Digikala等社交媒体平台的帖子,填补了波斯语-英语代码混合研究领域的空白。
技术亮点
- 大规模标注:PERCEPT包含6800条帖子,是首个对波斯语-英语代码混合词汇进行UD词性标注的语料库。
- 自动化标注框架:采用大语言模型(LLM)辅助的标注框架,显著提高了标注效率和一致性。
- 多平台数据:数据来自多个社交媒体平台,包括X、Instagram和Digikala,提供了丰富的语言使用场景。
- 高可靠性:通过人工评估,自动化标注结果与黄金标准标注之间表现出高度一致性,证明了标注的可靠性。
行业影响
PERCEPT的发布为波斯语-英语代码混合研究提供了宝贵的数据资源,将推动以下领域的进展:
- 语言学分析:帮助研究人员更好地理解波斯语和英语在代码混合中的语法和语义交互。
- NLP模型开发:为开发更强大的跨语言和多语言NLP模型提供训练数据。
- 多语言AI应用:促进波斯语和英语混合场景下的AI应用,如机器翻译、情感分析和对话系统。
开发者建议
对于NLP研究人员,建议利用PERCEPT进行以下研究:
- 跨语言迁移学习:探索波斯语和英语之间的跨语言迁移学习技术。
- 多语言模型训练:使用PERCEPT训练多语言模型,提升其在代码混合场景下的表现。
- 语言混合模式分析:深入分析波斯语-英语代码混合的语言模式和规律。
原文链接
https://github.com/kalhorghazal/PERCEPT
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-08-12)
社区整体评论区
正在加载实时智能评论与划词标注…