Hugging Face发布ASCENT框架:革新智能体在线测试时训练方法
文 / Mr.Xu
发布时间:
摘要:Hugging Face推出了一款名为ASCENT(Agentic Self-distillation for Cross-task EvolutioN at Test-time)的智能体训练框架,旨在解决智能体在执行复杂任务时难以有效利用验证经验的问题。ASCENT通过自蒸馏验证经验并利用LoRA快速权重更新机制,使智能体能够在任务执行过程中持续改进,无需外部参考或教师模型。该方法在多个基准测试中表现出色,显著提升了任务成功率和交互效率,展示了其在动态任务环境中的强大适应能力。
背景与挑战
在复杂任务环境中,智能体需要处理长时推理和动作序列,并依赖验证信号来改进其策略。然而,传统的在线适应方法通常依赖于检索正确的经验或依赖固定的策略执行,这限制了智能体的灵活性和学习效率。
ASCENT框架的核心创新
Hugging Face推出的ASCENT框架通过以下方式革新了智能体在线测试时训练:
- 自蒸馏验证经验:ASCENT使用智能体的初始稳定版本作为教师模型,将验证后的轨迹作为特权信息进行自蒸馏,从而预测下一个token的分布。
- LoRA快速权重更新:通过将蒸馏后的知识注入到LoRA快速权重中,ASCENT实现了无需外部参考或更强教师模型的持续改进。
- 无效动作过滤:ASCENT进一步过滤掉无效动作回合,蒸馏出增强的特权经验,从而实现更高效的执行。
实验结果与性能
在ALFWorld、WebShop和AppWorld等多个基准测试中,ASCENT在模型规模各异的情况下均表现出色:
- 任务成功率提升:随着经验的积累,ASCENT显著提高了任务成功率。
- 交互效率改进:ASCENT在交互效率方面也表现出色,展示了其在动态任务环境中的适应能力。
- 跨场景迁移能力:ASCENT能够将经验迁移到未见过的场景中,展示了其泛化能力。
行业影响与开发者建议
ASCENT框架为智能体在复杂任务环境中的持续学习和改进提供了新的思路,尤其适用于需要高效处理长时任务的应用场景,例如机器人操作、自动化客服和智能助手等。开发者可以参考以下建议:
- 结合LoRA技术:在智能体训练中结合LoRA技术,可以有效降低计算成本并加速模型更新。
- 重视经验验证:在智能体设计中,应重视经验验证机制的设计,以确保学习过程的稳定性和可靠性。
- 探索多任务学习:ASCENT展示了在多任务场景中的潜力,开发者可以探索将其应用于更广泛的多任务学习领域。
结论
ASCENT框架展示了在线测试时训练的巨大潜力,为智能体在动态任务环境中的高效学习和改进提供了新的技术路径。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-04)
主题标签: #Hugging Face #智能体 #LoRA #自蒸馏 #AI训练
社区整体评论区