Hugging Face发布Long-WAM:革新实时机器人控制中的长上下文世界动作模型
文 / Mr.Xu
发布时间:
摘要:Hugging Face推出Long-WAM,一种用于扩展因果世界动作模型上下文范围的模型系统框架,旨在解决实时机器人控制中处理长视觉历史数据带来的延迟问题。Long-WAM通过自回归预训练视频基础模型显著提升了历史数据的利用效率,在多个机器人平台上的实验表明,延长上下文时间显著提高了任务成功率。此外,Long-WAM支持流式编码、异步执行和硬件加速,使其能够在RTX 5090、DGX Spark和Jetson AGX Thor等硬件上实时运行。Long-WAM在动态和长时操作任务中表现出色,例如在动态杯堆叠任务中实现了95%的成功率。
核心突破
- 长上下文扩展:Long-WAM通过自回归(AR)预训练视频基础模型,显著提升了长视觉历史数据的利用效率。在RoboCasa GR-1平台上,将上下文时间从0秒增加到19.2秒,任务成功率从63.3%提升至78.7%。
- 硬件加速与实时性能:Long-WAM支持流式编码、异步执行和硬件加速,使其能够在RTX 5090、DGX Spark和Jetson AGX Thor等硬件上实时运行。在RTX 5090上,每个动作块的处理时间仅为107.4毫秒。
- 多平台验证:Long-WAM在多个机器人平台(如LIBERO-Long、RoboTwin 2.0和DOMINO)上进行了验证,均表现出色,尤其是在动态杯堆叠任务中实现了95%的成功率,而传统方法未能成功。
技术亮点
- 自回归预训练:通过自回归预训练,Long-WAM能够更有效地利用长视觉历史数据,从而提升任务成功率。
- 异步执行与硬件加速:该框架采用异步执行机制,并针对不同硬件进行优化,确保实时性能。
- 流式编码:支持流式编码,使得Long-WAM能够处理实时视频流,而不会因处理延迟影响机器人控制。
行业影响
Long-WAM的推出标志着AI在机器人控制领域的重要进展,特别是在需要长时记忆和实时处理的任务中。其高效的长上下文处理能力为复杂机器人任务提供了新的解决方案,例如动态操作和长时规划。此外,Long-WAM的硬件加速特性使其能够广泛应用于不同类型的机器人平台,推动AI驱动的机器人技术发展。
开发者建议
- 硬件适配:开发者应根据目标硬件平台优化Long-WAM的部署,以实现最佳性能。
- 任务定制:针对特定任务场景,开发者可以进一步微调Long-WAM模型,以提升任务成功率。
- 多模态融合:未来可以探索将Long-WAM与其他感知模块(如触觉传感器)结合,以实现更复杂的机器人控制任务。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-07)
主题标签: #Hugging Face #机器人控制 #长上下文 #实时AI #硬件加速
社区整体评论区