智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #视频生成 #DiT #压缩技术 #AI效率

Hugging Face发布GRACE框架:革新视频生成效率与质量

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出了一种名为GRACE(Generation-Aware Latent Compression for Efficient Video Generation)的新框架,旨在通过两阶段压缩技术优化视频生成效率,同时保持与预训练Diffusion Transformer(DiT)的兼容性。GRACE通过冻结预训练编码器的基线潜在表示,并学习压缩过程中丢失信息的残差潜在表示,从而在保持生成质量的同时,显著减少token数量并降低延迟。实验表明,GRACE在480x832x81分辨率下将Wan2.1-I2V-14B的token数量减少了8倍,延迟降低了11.1倍,同时在VBench上保持了与压缩前相同的生成质量。


背景与挑战

视频生成模型的效率一直是AI领域的重要研究方向。然而,高压缩率的视频自动编码器在训练过程中面临诸多挑战,例如高压缩比会降低重建质量,而增加通道数量以恢复质量又会减缓Diffusion Transformer(DiT)的收敛速度。此外,压缩后的潜在表示与DiT预训练时的表示存在差异,这要求DiT必须从零开始重新训练或进行代价高昂的适应调整。

GRACE框架的创新

为了解决上述问题,Hugging Face提出了GRACE框架,其核心创新点包括:

  1. 两阶段压缩技术:

    • 冻结预训练编码器的基线潜在表示。
    • 学习压缩过程中丢失信息的残差潜在表示。
    • 在DiT的特征空间中对齐压缩后的潜在表示与预训练的潜在表示,以优化生成质量。
  2. 轻量级微调与不对称去噪:

    • 对DiT进行轻量级微调。
    • 采用不对称去噪策略,先对基线进行去噪,再对残差进行去噪。

实验结果

GRACE在多个关键指标上表现出色:

  • 效率提升:在480x832x81分辨率下,将Wan2.1-I2V-14B的token数量减少了8倍,延迟降低了11.1倍。
  • 生成质量:在VBench上,GRACE的生成质量与压缩前的预训练管道保持一致。

技术亮点

  • 兼容性保持:通过两阶段压缩技术,GRACE在压缩过程中保持了与预训练DiT的兼容性,避免了重新训练或复杂适应过程。
  • 性能优化:GRACE不仅提升了生成效率,还通过轻量级微调和不对称去噪策略,确保了生成质量不受影响。

行业影响与开发者建议

GRACE的发布为视频生成领域带来了新的技术路径,尤其在需要高效生成高质量视频的场景中具有重要意义。对于开发者而言,GRACE提供了一种在不牺牲质量的前提下提升生成效率的方法,建议在以下场景中优先考虑使用:

  • 实时视频生成:如虚拟现实、增强现实等对实时性要求较高的应用。
  • 大规模视频处理:如视频平台的内容推荐和生成。
  • 资源受限环境:如移动设备上的视频生成应用。

未来展望

随着GRACE的推出,Hugging Face展示了其在视频生成领域的持续创新。未来,GRACE有望在更多应用场景中得到验证和优化,进一步推动AI视频生成技术的发展。


消息来源:Hugging Face Daily Papers (2026-10-07)

—— 完 ——

主题标签: #Hugging Face #视频生成 #DiT #压缩技术 #AI效率

社区整体评论区

正在加载实时智能评论与划词标注…