Hugging Face提出NowWAM:革新机器人控制中的生成式适应方法
文 / Mr.Xu
发布时间:
摘要:Hugging Face的研究团队提出了一种名为NowWAM的新型机器人控制框架,该框架通过去噪当前观测并从同一视觉流中预测机器人动作,实现了生成式适应与动作预测的直接耦合。NowWAM无需依赖未来视觉目标,在LIBERO-Plus基准测试中表现出色,显著提升了控制准确性和训练效率,同时减少了视觉token数量和推理时间,为机器人控制领域带来了突破性进展。
1. 研究背景与动机
预训练的生成式扩散Transformer(DiTs)通过大规模图像和视频生成训练,捕捉了丰富的像素级视觉和语言结构。然而,如何将这些生成式先验转移到机器人控制中仍然是一个未解的难题。现有的方法通常通过未来视觉预测来实现这种转移,但这种方法存在诸多局限性。
2. NowWAM框架介绍
NowWAM是一种未来目标无关的共训练方法,通过去噪当前观测并从同一视觉流中预测机器人动作,直接将生成式目标与动作表示耦合在一起。该方法的核心创新点包括:
- 去噪轨迹作为控制接口:利用去噪轨迹作为动作预测的接口,避免了对未来视觉目标的依赖。
- 视觉流耦合:将生成式目标与动作预测直接耦合,提升了模型的适应性和鲁棒性。
- 高效训练:通过减少训练视觉token数量和推理时间,显著提升了训练效率。
3. 实验结果与性能
在LIBERO-Plus基准测试中,NowWAM与FLUX2-Klein结合使用,达到了87.7%的控制准确率,比未来目标共训练基线提高了6.1个百分点,同时将训练视觉token数量减半(从784减少到392),并将推理时间从2.85秒缩短到1.63秒,实现了1.8倍的加速。此外,使用纯文本到图像的Z-Image骨干网络,NowWAM进一步达到了87.8%的控制准确率,证明了强大的控制适应能力并不依赖于视频生成或图像编辑骨干网络。
4. 技术亮点与优势
- 无需未来视觉目标:简化了训练过程,减少了对复杂数据的需求。
- 高效的训练与推理:通过减少视觉token数量和推理时间,提升了整体效率。
- 跨场景的适应性:在分布内和分布外场景中均表现出色,展示了强大的泛化能力。
5. 行业影响与开发者建议
NowWAM的提出为机器人控制领域提供了一种全新的思路,尤其在复杂环境下的机器人操作中具有广泛的应用前景。开发者可以参考以下建议:
- 尝试将NowWAM应用于不同的机器人平台,评估其在各种场景中的表现。
- 结合其他先进的AI技术,如强化学习和模仿学习,进一步提升控制性能。
- 关注Hugging Face的最新研究动态,以获取更多关于生成式适应和机器人控制的前沿信息。
6. 结论
NowWAM展示了生成式适应在机器人控制中的巨大潜力,为未来的研究和技术开发提供了新的方向。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-09-23)
主题标签: #Hugging Face #机器人控制 #生成式适应 #NowWAM #DiTs
社区整体评论区