Transsion发布面向多语言对话的说话人归因ASR系统,MLC-SLM 2026挑战赛排名第二
文 / Mr.Xu
发布时间: · 2 次阅读
摘要:Transsion语音团队在MLC-SLM 2026挑战赛任务1中提交了一种创新的说话人归因多语言自动语音识别(ASR)系统。该系统采用级联框架,包括说话人分离模块、长篇多语言ASR模块和说话人-转录融合模块。实验结果显示,该系统在官方评估集上的tcp归一化最小错误率(tcpMER)达到15.41%,在所有参赛队伍中排名第二,展示了其在多语言对话场景下的高效性和准确性。
技术亮点解析
-
级联框架设计:该系统采用三级级联架构,包括说话人分离模块、长篇多语言ASR模块和说话人-转录融合模块。
- 说话人分离模块:基于DiariZen,通过局部说话人活动估计和全局说话人聚类生成说话人同质片段。
- 长篇多语言ASR模块:基于Qwen3-Omni模型,能够生成多语言转录文本。
- 说话人-转录融合模块:结合说话人分离输出和带有时间戳的转录文本,生成说话人归因的STM输出。
-
高精度时间戳对齐:系统使用基于CTC的外部对齐模型,提供精确的词级和字符级时间戳,确保转录文本与说话人信息的准确匹配。
-
多语言支持:该系统能够处理多语言对话场景,展示了其在跨语言应用中的潜力。
行业影响与开发者建议
- 行业影响:该系统的发布标志着多语言ASR技术在说话人归因领域的重大进展,尤其适用于多语言会议记录、跨文化对话分析等场景。
- 开发者建议:对于开发多语言ASR系统的团队,可以借鉴该系统的级联框架设计,并关注说话人分离和转录融合的协同优化。此外,开发者可以探索将类似技术应用于其他需要说话人归因的领域,如智能客服和语音助手。
结论
Transsion的这项研究展示了在多语言对话场景下实现高效说话人归因ASR的可行性,并为未来的技术发展提供了新的方向。
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-09-21)
主题标签: #Transsion #ASR #多语言处理 #说话人分离 #智能语音
社区整体评论区