Hugging Face发布reViT:革新递归视觉Transformer架构,显著降低参数量
文 / Mr.Xu
发布时间:
摘要:Hugging Face推出了一种名为reViT的创新视觉Transformer架构,通过递归应用单个Transformer块并结合深度编程专家(Depth-Programmed Experts),实现了与全深度视觉编码器相当的精度,同时显著降低了存储参数数量(减少约70%)。该设计在ImageNet-1k训练和DINOv2教师模型的知识蒸馏两种模式下均表现出色,展示了其在分类、分割和深度预测任务中的强大泛化能力。此外,reViT的弹性深度训练机制允许单一模型在不同深度下运行,进一步提升了部署的灵活性和效率。
核心突破
Hugging Face推出的reViT架构通过以下创新点实现了视觉Transformer技术的重大突破:
- 递归Transformer块应用:通过递归使用单个Transformer块,reViT能够以较少的存储参数实现与全深度视觉编码器相当的精度。
- 深度编程专家(Depth-Programmed Experts):通过将每个递归深度的前馈网络(FFN)表示为共享专家库的凸组合,reViT能够动态调整模型行为,适应不同深度的需求。
- 弹性深度训练:该机制允许单一模型在多个深度下运行,通过重新采样相同的归一化坐标区间实现不同深度的推理,而无需重新训练。
技术亮点
- 高效参数利用:在ImageNet-1k训练中,reViT-B/16仅需约30%的存储参数即可达到与DeiT III相当的精度。
- 知识蒸馏的强大表现:使用DINOv2教师模型的输出特征进行蒸馏的8专家模型,保留了几乎所有线性探测精度,并在分类、分割和深度预测任务中表现出色。
- 跨任务迁移能力:reViT不仅在视觉任务中表现出色,还展示了其在多模态任务中的潜力。
行业影响
reViT的发布标志着视觉Transformer架构的重大进步,特别是在资源受限场景下的应用。其高效参数利用和弹性深度训练机制使其成为边缘计算和移动设备上视觉任务的理想选择。此外,reViT的泛化能力使其在多任务协同和跨领域应用中具有广泛的应用前景。
开发者建议
- 尝试弹性深度训练:开发者可以利用reViT的弹性深度训练机制,根据不同应用场景调整模型深度,以实现最佳性能与效率的平衡。
- 探索多模态应用:reViT的跨任务迁移能力使其成为多模态任务(如视觉-语言模型)的理想基础模型。
- 关注后续优化:随着reViT的进一步优化和扩展,开发者可以期待其在更多复杂任务中的表现提升。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-08)
社区整体评论区
正在加载实时智能评论与划词标注…