智客 ZICQ
EN 登录 / 注册
智客前沿 智能体 #Hugging Face #VLA模型 #FailBank #机器人控制 #运行时反馈

Hugging Face发布FailBank框架:利用运行时反馈提升VLA模型性能

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出了一种名为FailBank的四阶段自进化框架,旨在通过将运行时反馈转化为持续的政策改进,提升视觉-语言-动作(VLA)模型在复杂环境中的表现。FailBank通过固定的安全模块生成反事实修正,并利用LoRA更新机制优化模型性能。在VLA-Arena基准测试中,FailBank在任务成功率上提升了6.9至8.5个百分点,同时显著降低了政策引起的累计成本,与现有运行时屏蔽方法相比表现出显著优势。


背景与挑战

视觉-语言-动作(VLA)模型在机器人操作任务中表现出色,但在复杂环境中平衡任务成功与意外接触仍然是一个重大挑战。现有的运行时屏蔽方法可以纠正个别动作,但无法改变底层政策,导致反复的政策-屏蔽不匹配,阻碍任务进展。

FailBank框架介绍

为了应对这一挑战,Hugging Face推出了FailBank框架。该框架分为四个阶段:

  1. 收集阶段:使用基于固定控制屏障函数(CBF)的安全模块作为仅观察的教师,生成反事实修正,而政策保持控制。
  2. 结果感知准入:将有用提案转换为修正目标,并将成功的未修正动作作为受保护的锚点用于LoRA更新。
  3. LoRA更新:通过受保护的LoRA更新机制,仅对模型进行局部调整,避免对全局性能的负面影响。
  4. 持续改进:通过不断迭代上述过程,将运行时反馈转化为持续的政策改进。

实验与结果

FailBank在VLA-Arena基准测试中进行了评估,测试涵盖了两个难度级别和两种VLA骨干网络。与基线政策相比,FailBank在联合成功-成本操作点上取得了显著提升:

  • 在两个骨干网络上,任务成功率分别提升了8.5和6.9个百分点。
  • 政策引起的累计成本分别降低了35.6%和23.8%。

与运行时屏蔽方法相比,FailBank在任务成功率上分别提升了25.4和9.5个百分点,同时保持了可比的累计成本。

行业影响与开发者建议

FailBank框架展示了运行时反馈作为持续政策监督的潜力,而不仅仅是作为临时动作约束。这一创新为VLA模型在复杂环境中的应用提供了新的技术路径。开发者可以参考以下建议:

  • 集成FailBank框架:在VLA模型中集成FailBank框架,以提升在复杂环境中的表现。
  • 优化LoRA更新机制:根据具体应用场景调整LoRA更新机制,以实现最佳性能。
  • 探索更多反馈机制:结合其他类型的反馈机制,进一步提升模型的自适应能力。

结论

FailBank框架通过将运行时反馈转化为持续的政策改进,显著提升了VLA模型在复杂环境中的表现。这一创新为AI在机器人操作领域的应用开辟了新的可能性。


消息来源:Hugging Face Daily Papers (2026-09-30)

—— 完 ——

主题标签: #Hugging Face #VLA模型 #FailBank #机器人控制 #运行时反馈

社区整体评论区

正在加载实时智能评论与划词标注…