智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #FireRedAudio #音频语言模型 #多任务学习 #语音识别 #语音合成

FireRedAudio发布:首个支持解耦连续表示的通用音频语言模型

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:FireRedAudio是一款由FireRed团队推出的通用音频语言模型,旨在统一音频理解与生成任务。该模型采用共享的9B参数大语言模型(LLM),并引入了分离的连续输入表示方法——音频编码器处理待识别的音频数据,而基于RedAE的路径则用于生成任务。通过渐进的多任务训练,FireRedAudio支持自动语音识别(ASR)、音频理解、零样本语音合成(TTS)、指令TTS以及语义和声学语音编辑。其在音频理解、多语言ASR、零样本TTS和语音编辑任务中表现出色,展示了分离连续表示在统一音频处理中的潜力。


核心突破

FireRedAudio是首个公开披露的通用音频语言模型,其核心创新在于引入了分离的连续输入表示方法:

  • 音频编码器(Audio Encoder):处理待识别的音频数据,专注于音频理解任务。
  • RedAE路径:用于生成任务,确保生成语音的声学细节得以保留。

这种分离的表示方法解决了传统统一模型在音频理解和生成任务中面临的表示冲突问题。

技术亮点

  1. 共享LLM架构:采用9B参数的大语言模型作为核心,支持多任务学习。
  2. 分离连续表示:通过音频编码器和RedAE路径分别处理理解和生成任务。
  3. 多任务训练:支持自动语音识别(ASR)、音频理解、零样本语音合成(TTS)、指令TTS以及语义和声学语音编辑。
  4. 长时音频处理:音频理解任务可处理长达一小时的录音,并实现秒级时间戳精度。
  5. 语音编辑能力:在语义和声学语音编辑任务中表现优异,超越了现有模型Ming-UniAudio-Edit。

应用场景

  • 多语言语音识别:支持多语言ASR,适用于跨语言应用场景。
  • 语音合成与编辑:实现高质量的零样本TTS和指令TTS,并支持复杂的语音编辑任务。
  • 音频分析:适用于长时音频的语义理解与环境分析。

行业影响

FireRedAudio的发布标志着音频语言模型领域的一个重要里程碑。其分离表示方法为音频处理提供了新的技术路径,有望推动音频理解与生成任务的进一步发展。此外,该模型在多语言ASR和语音编辑方面的强大能力,使其在跨语言沟通、语音内容创作和音频分析等应用场景中具有广泛的应用潜力。

开发者建议

  • 探索分离表示方法:开发者可以尝试将分离表示方法应用于其他多模态任务,以提升模型性能。
  • 多任务学习应用:利用FireRedAudio的多任务训练能力,开发跨音频和语言的多模态应用。
  • 长时音频处理:在需要处理长时音频数据的场景中,FireRedAudio提供了高效的解决方案。

消息来源:ArXiv cs.CL (2026-08-25)

—— 完 ——

主题标签: #FireRedAudio #音频语言模型 #多任务学习 #语音识别 #语音合成

社区整体评论区

正在加载实时智能评论与划词标注…