智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #StepAudio #音乐生成 #强化学习 #大语言模型 #音频处理

StepAudio发布音乐生成模型StepAudio 3 Music:支持显式音乐规划与开放域文本控制

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:StepAudio推出了其最新音乐生成模型StepAudio 3 Music,该模型支持显式音乐规划与开放域文本控制。模型采用离散-连续设计,通过Flow-matching扩散Transformer(DiT)预测连续VAE潜变量,并由VAE解码器生成48kHz音频。其独特之处在于使用ABC记谱法生成中间编排计划(ABC-CoT),并结合强化学习(DPO)优化生成质量。StepAudio 3 Music在多个基准测试中表现优异,尤其在音频质量、生成多样性和任务适应性方面取得了领先成绩。


StepAudio发布音乐生成模型StepAudio 3 Music:支持显式音乐规划与开放域文本控制

StepAudio近日发布了其最新音乐生成模型——StepAudio 3 Music。该模型旨在解决音乐生成中的复杂规划与开放域文本控制问题,其核心技术创新点包括:

  • 离散-连续设计:StepAudio Music Tokenizer将音频表示为65536个单代码本的50Hz流,Flow-matching扩散Transformer(DiT)预测连续VAE潜变量,并由VAE解码器生成48kHz音频。
  • 显式音乐规划:通过Mixture-of-Experts自回归模型使用ABC记谱法生成中间编排计划(ABC-CoT),将和声、节奏和旋律结构纳入生成上下文。
  • 强化学习优化:采用直接偏好优化(DPO)技术,显著提升了AudioBox内容享受度、内容有用性和制作质量评分,并在MuQ-MuLan相似性指标上表现优异。

此外,StepAudio 3 Music支持歌曲和乐器生成、从干声生成伴奏以及长达5分30秒的翻唱歌曲合成。其渐进式训练课程和监督微调策略进一步增强了模型的生成能力和适应性。

技术亮点

  • 离散-连续架构:结合VQ、语义和声学RVQ以及不同DiT配置的比较,实现高效音频生成。
  • 显式音乐规划:通过ABC-CoT将音乐结构纳入生成过程,提升生成质量。
  • 强化学习优化:DPO技术显著提升模型在多个基准测试中的表现。

行业影响

StepAudio 3 Music的发布标志着音乐生成领域的重大进步,为音乐创作、音频制作和娱乐行业提供了强大的工具。其在音频质量和生成多样性方面的优势,使其在专业音乐制作和AI音乐生成应用中具有广阔的应用前景。

开发者建议

  • 探索应用场景:开发者可以利用StepAudio 3 Music探索新的音乐创作和音频处理应用。
  • 结合其他工具:结合现有的音频处理工具和平台,进一步提升音乐生成的效果和效率。
  • 关注后续更新:关注StepAudio的进一步优化和功能扩展,以充分利用其潜力。

消息来源:Hugging Face Daily Papers (2026-09-11)

—— 完 ——

主题标签: #StepAudio #音乐生成 #强化学习 #大语言模型 #音频处理

社区整体评论区

正在加载实时智能评论与划词标注…