arXiv发布语言距离量化框架QuanLing,扩展至西方罗曼语系验证
文 / Mr.Xu
发布时间:
摘要:arXiv发布了一项关于语言距离量化的研究,扩展了其之前提出的QuanLing框架至西方罗曼语系(法语、葡萄牙语、西班牙语、意大利语)。该研究通过计算LaBSE句子嵌入距离、BERT分词碎片化率以及mBERT掩码语言模型的互理解性,验证了QuanLing在跨语系应用中的有效性。结果表明,葡萄牙语与西班牙语之间的语言距离最近,而法语与意大利语最远。此外,研究还发现西方罗曼语系的绝对距离跨度比北日耳曼语系更广,但相对比率相似,这与其更长的分化时间一致。
研究背景与动机
语言距离的量化是定量语言学中的一个核心挑战,尤其在处理密切相关的语言时。QuanLing(通过预训练语言模型进行定量语言学)是一种结合语言距离指标(如句子嵌入距离、分词碎片化率)和语言属性分析(如MLM预测概率)的定量框架,之前已在北日耳曼语系(丹麦语、挪威语书面语、瑞典语)上得到验证。
研究方法与实验
本研究将QuanLing扩展至西方罗曼语系,具体包括法语、葡萄牙语、西班牙语和意大利语。研究采用了以下方法:
- 数据集:使用150组四语言平行句子。
- 指标计算:
- LaBSE句子嵌入距离
- 四种单语BERT分词器的分词碎片化率
- mBERT掩码语言模型的互理解性
- 锚点语言:英语作为锚点语言,用于四语言组合构建。
主要发现
-
语言距离结果:
- 葡萄牙语与西班牙语之间的语言距离最近(LaBSE距离0.0229)。
- 法语与意大利语之间的语言距离最远(0.0338)。
- LaBSE和mBERT的排名在6对语言中有4对一致,验证了跨模型的鲁棒性。
-
语系比较:
- 西方罗曼语系的绝对距离跨度比北日耳曼语系更广(0.011 vs. 0.008),但相对比率相似(1.48 vs. 1.67),这与其更长的分化时间一致。
-
语言属性分析:
- 法语在MLM预测中表现出更高的可预测性(top-1准确率为36.12%,而意大利语为29.28%),这反映了其正字法与语音学的解耦。
行业影响与开发者建议
- 多语种应用:QuanLing框架的扩展验证了其跨语系的适用性,为多语种自然语言处理(NLP)应用提供了新的量化工具。
- 语言学研究:该研究为语言学家提供了更精确的语言距离量化方法,有助于深入理解语言间的相似性与差异性。
- 开发者建议:对于开发多语种AI模型或跨语言应用的开发者,QuanLing提供了一种有效的语言距离评估方法,可以用于优化模型训练和跨语言迁移学习。
未来展望
未来研究可以进一步扩展QuanLing框架至更多语系,并结合其他语言属性指标(如语法结构、语音特征)以提供更全面的语言距离量化分析。
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-08)
社区整体评论区
正在加载实时智能评论与划词标注…