智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #手语识别 #弱监督学习 #LLM辅助 #跨数据集迁移 #土耳其语

基于弱监督的跨数据集手语识别研究:提升时间定位与翻译性能

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:本研究提出了一种基于弱监督的跨数据集手语识别方法,旨在解决资源受限语言中手语研究面临的标注成本高昂问题。通过利用土耳其广播新闻语料库TSL-News中的弱对齐文本数据,研究团队开发了一种基于伪标注的预训练方法,并结合大语言模型(LLM)辅助的规范化技术,显著提升了手语识别的时间定位精度和下游翻译性能。实验结果表明,该方法在TSL Spotting Benchmark上实现了56.2%的样本IoU达到0.50以上,同时BLEU-4和ROUGE指标分别提升了15%和16.7%。这项研究为手语识别领域提供了新的技术路径,尤其适用于标注资源稀缺的语言环境。


研究背景与挑战

手语研究,尤其是针对资源受限语言的研究,常常受到高昂标注成本(如glosses、时间边界和手语顺序)的限制。广播新闻提供了一种替代方案,通过将连续手语与口语文本配对进行监督,但这种监督是弱对齐的,因为文本和手语之间的对应关系较为松散。此外,像土耳其语这样的形态丰富语言进一步增加了难度,因为同一词汇可能有多种屈折形式,而一些派生形式需要保持独立。

方法与创新

本研究提出了一种基于弱监督的跨数据集手语识别方法,主要创新点包括:

  • 伪标注预训练:利用从广播新闻文本中提取的伪标注(pseudo-gloss labels)进行预训练,而不是依赖昂贵的手动标注。
  • LLM辅助规范化:结合大语言模型(LLM)辅助的规范化技术,以应对形态丰富语言中的复杂词汇变化。
  • 跨数据集迁移:验证预训练模型在跨数据集手语识别任务中的表现,确保其可重用性和泛化能力。

实验与结果

研究团队在TSL-News土耳其广播新闻语料库上进行了预训练,并在TSL Spotting Benchmark上进行了评估。结果显示:

  • 时间定位精度提升:LLM辅助的编码器将top-5时间定位的平均IoU从0.235提升至0.465,56.2%的样本IoU达到0.50以上。
  • 下游翻译性能改善:BLEU-4从9.60提升至11.04,ROUGE从23.48提升至27.43。

行业影响与开发者建议

这项研究为手语识别领域带来了新的思路,尤其适用于标注资源稀缺的语言环境。以下是一些建议:

  • 开发者:可以尝试将类似的方法应用于其他弱监督场景,例如低资源语言的语音识别或图像标注。
  • 研究人员:可以进一步探索如何将LLM辅助的规范化技术应用于更广泛的自然语言处理任务。
  • 企业:可以考虑利用广播新闻等弱对齐数据源来降低标注成本,提高模型训练效率。

结论

本研究展示了利用弱对齐广播数据进行手语识别预训练的可行性,为未来在低资源语言环境下的手语研究提供了新的技术路径。


消息来源:ArXiv NLP/LLM (cs.CL) (2026-08-13)

—— 完 ——

主题标签: #手语识别 #弱监督学习 #LLM辅助 #跨数据集迁移 #土耳其语

社区整体评论区

正在加载实时智能评论与划词标注…