arXiv发布Wieszcz-XIX:3.1亿词波兰历史语料库与时间受限语言模型
文 / Mr.Xu
发布时间:
摘要:arXiv发布了一款名为Wieszcz-XIX的波兰历史语料库,包含1800至1918年间出版的约6.75亿个token(3.1亿词),共294,369份文档。该语料库通过过滤、去重、检测1918年后的内容泄漏等处理流程构建而成,是现有同期时间段标注语料库的数千倍规模。研究团队基于该语料库训练了从4700万到3.49亿参数的一系列解码器模型,并验证了其在时间受限性上的表现。尽管存在部分识别错误和无法修正的文本内容,但该语料库为研究波兰历史语言提供了宝贵资源,并展示了在时间受限文本处理上的技术突破。
核心突破
-
大规模历史语料库构建:Wieszcz-XIX包含1800至1918年间出版的约6.75亿个token(3.1亿词),是现有标注语料库的数千倍规模,为研究波兰历史语言提供了丰富的数据资源。
-
数据处理与质量控制:通过严格的过滤、去重和1918年后内容泄漏检测等流程,确保语料库的质量。尽管存在部分识别错误和无法修正的文本内容,但整体字符错误率控制在0.68%。
-
时间受限语言模型训练:基于该语料库,研究团队训练了一系列从4700万到3.49亿参数的语言模型,并验证了其在时间受限性上的表现。与现代波兰语模型相比,这些模型在处理历史文本时表现出更低的词汇成本和更高的拼写一致性。
技术亮点
- 语料库规模与质量:Wieszcz-XIX的规模远超现有语料库,并通过多层次的质量控制流程,确保了数据的可靠性。
- 时间受限性验证:模型在处理历史文本时表现出色,保留了历史拼写习惯,而现代模型则未能完全做到这一点。
- 模型性能提升:增加参数规模带来的性能提升约为数据二次处理的两倍,展示了大规模数据训练的优势。
行业影响与开发者建议
- 历史语言研究:该语料库为研究波兰历史语言提供了宝贵资源,填补了现有数据的不足。
- 时间受限模型应用:对于需要处理历史文本或特定时间段数据的开发者,该模型提供了新的技术路径。
- 伦理与偏见问题:模型在训练过程中复制了历史偏见,包括反犹太主义言论,开发者需谨慎处理相关伦理问题。
未来展望
Wieszcz-XIX的发布不仅为波兰历史语言研究提供了新的工具,也为时间受限语言模型的发展开辟了新的方向。未来,随着更多类似语料库的发布,AI在处理历史文本和特定时间段数据方面的能力将得到进一步提升。
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-09)
社区整体评论区
正在加载实时智能评论与划词标注…