ZimaBlue框架发布:利用大规模视频预训练实现通用机器人动作模型
文 / Mr.Xu
发布时间:
摘要:ZimaBlue是一种用于机器人操作的新型框架,通过大规模视频预训练学习通用的世界动作模型(WAMs)。该框架采用三阶段训练流程:首先是因果具身视频预训练,然后通过视频-动作中段训练将视觉动态性与机器人轨迹结合,最后针对目标机器人进行模型微调。ZimaBlue采用异步慢-快双系统架构,在NVIDIA RTX 4090上实现了30 Hz的动作预测。在零样本机器人实验中,ZimaBlue将任务成功率从36.1%提升至77.8%,并在多个基准测试中表现出色,尤其在处理未见过的任务时表现突出。
核心突破
ZimaBlue框架旨在解决机器人操作中的泛化难题,通过利用大规模视频数据学习通用的世界动作模型(WAMs)。其主要技术亮点包括:
-
三阶段训练流程:
- 因果具身视频预训练:在大量人类和机器人第一人称视频上进行预训练,以学习视觉动态性。
- 视频-动作中段训练:通过统一的动作表示,将学习到的视觉动态性与异构机器人轨迹结合。
- 模型微调:针对目标机器人进行模型微调,以实现高效部署。
-
异步慢-快双系统架构:
- 慢速世界模型:提供高容量的时空表示,支持泛化能力。
- 快速分支:在NVIDIA RTX 4090上实现30 Hz的动作预测,满足实时控制需求。
-
性能提升显著:
- 在零样本机器人实验中,任务成功率从36.1%提升至77.8%。
- 在多个基准测试中表现优异,尤其在处理未见过的任务时表现突出。
技术解析
ZimaBlue框架的核心在于其创新的训练流程和架构设计。通过大规模视频预训练,ZimaBlue能够从丰富的具身经验中学习到通用的动作模式,而无需依赖昂贵的机器人轨迹数据。异步慢-快双系统架构则确保了模型在保持高容量的同时,能够实现实时动作预测。
行业影响
ZimaBlue的发布为机器人操作领域带来了新的可能性,特别是在数据稀缺和多样化场景下。其高效的泛化能力使得机器人能够在更广泛的环境中执行复杂任务,推动了机器人技术的进步。此外,ZimaBlue的架构设计也为其他领域的AI应用提供了新的思路,例如自动驾驶和虚拟现实等。
开发者建议
- 数据准备:开发者可以利用大规模视频数据集进行预训练,以提升模型的泛化能力。
- 模型微调:针对特定应用场景进行模型微调,以实现最佳性能。
- 硬件优化:利用高性能GPU(如NVIDIA RTX 4090)进行实时动作预测,以满足实时控制需求。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-08-31)
社区整体评论区
正在加载实时智能评论与划词标注…