智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #HED-UCS #LOOM #循环深度扩展 #MoE架构

HED-UCS发布LOOM框架:提升大模型循环深度扩展效率

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:HED-UCS团队提出了一种名为LOOM的新型框架,旨在解决大模型中循环专家混合(MoE)架构的扩展难题。LOOM通过引入每层路由器和循环残差机制,在保持循环状态稳定的同时实现了计算多样性的提升。实验表明,LOOM在1.7B参数模型上可稳定扩展至9-12层循环,在FLOPs匹配条件下,700M模型在5层循环时困惑度从18.36降至16.54,平均零样本准确率从38.84%提升至39.53%。该框架为大规模循环深度扩展提供了新的技术路径。


核心突破

HED-UCS团队推出了一种名为LOOM的框架,旨在解决大模型中循环专家混合(MoE)架构的扩展难题。以下是LOOM的主要技术亮点:

  1. 循环深度扩展:通过反复应用共享的Transformer块,LOOM在不增加参数数量的情况下增加了有效深度。
  2. 稳定性与多样性:
    • 稳定性:通过缩放残差更新以限制方差增长,并在每层循环中重新注入输入嵌入,从而保持循环状态的稳定。
    • 多样性:引入每层路由器以选择不同的专家,并通过循环残差机制将早期输出传递到后续循环中。
  3. 实验结果:
    • 在100M至1.7B参数规模的模型上,LOOM实现了稳定的扩展能力,最高可达9-12层循环。
    • 在FLOPs匹配条件下,700M模型在5层循环时表现最佳,困惑度从18.36降至16.54,平均零样本准确率从38.84%提升至39.53%。
    • 在未进行FLOPs匹配的情况下,1.7B模型在60B token训练数据上达到9层循环时表现最佳,困惑度从9.62降至7.77,平均零样本准确率从42.4%提升至47.7%。

行业影响

LOOM框架的发布为大规模循环深度扩展提供了新的技术路径,特别是在处理复杂任务和长序列建模时具有重要意义。其在保持计算效率的同时提升了模型性能,为AI研究人员和工程师提供了更高效的工具。

开发者建议

  • 实验验证:建议开发者在大规模模型中尝试LOOM框架,以验证其在不同任务和数据集上的性能表现。
  • 优化策略:结合其他优化技术,如混合精度训练和模型并行化,以进一步提升训练效率。
  • 应用场景:探索LOOM在长序列建模、对话系统、文本生成等领域的应用潜力。

技术亮点

  • 循环稳定性:通过缩放残差更新和重新注入输入嵌入,解决了循环深度扩展中的稳定性问题。
  • 计算多样性:引入每层路由器和循环残差机制,提升了计算多样性,避免了专家选择崩溃问题。
  • 实验验证:在多个规模模型上的实验结果验证了LOOM的有效性和稳定性。

消息来源:Hugging Face Daily Papers (2026-10-01)

—— 完 ——

主题标签: #HED-UCS #LOOM #循环深度扩展 #MoE架构

社区整体评论区

正在加载实时智能评论与划词标注…