arXiv提出TGIT:革新航空视觉语言导航智能体指令翻译技术
文 / Mr.Xu
发布时间:
摘要:arXiv发布了一项关于航空视觉语言导航(VLN)智能体的研究,提出了一种名为轨迹基础指令翻译器(TGIT)的新方法。该方法通过学习轨迹结果,将用户简短的意图驱动指令转换为智能体可执行的命令,显著提升了导航成功率。在OpenFly导航器上,TGIT将弱指令的成功率从11.33%提高到37.93%,并成功迁移到真实人类指令中,将成功率从11.33%提升至32.51%。此外,TGIT在CityNav和AirVLN等场景中也表现出色,展示了其在跨场景指令翻译中的潜力。
背景与挑战
航空视觉语言导航(VLN)智能体通常在详细且与轨迹对齐的命令上进行训练,而用户提供的指令往往简短且以意图为导向。这种“指令差距”导致导航成功率大幅下降,例如在OpenFly导航器上,指令差距使成功率从31.03%降至11.33%。为了解决这一问题,研究人员提出了轨迹基础指令翻译器(TGIT)。
TGIT方法
TGIT通过以下步骤实现指令翻译:
- 指令转换:使用语言模型将原始命令转换为弱指令,这些弱指令以用户意图为中心。
- 学习轨迹结果:TGIT通过学习智能体的轨迹结果,将弱指令转换为可执行的命令。
- 提升成功率:在OpenFly导航器上,TGIT将弱指令的成功率从11.33%提高到37.93%。
技术亮点
- 跨场景迁移能力:TGIT不仅在OpenFly导航器上表现出色,还能成功迁移到真实人类指令中,将成功率从11.33%提升至32.51%。
- 多场景适用性:在CityNav和AirVLN等场景中,TGIT也展示了其强大的指令翻译能力。
- 无需冻结导航器:TGIT保持导航器冻结状态,仅通过前端指令翻译实现性能提升,降低了模型训练和部署的复杂性。
行业影响与未来展望
TGIT的提出为航空视觉语言导航领域提供了新的技术路径,特别是在处理用户简短、意图驱动指令方面具有重要意义。其跨场景迁移能力和多场景适用性使其在无人机导航、机器人导航等领域具有广泛的应用前景。未来,研究人员可以进一步优化TGIT的指令转换机制,并探索其在更多复杂场景中的应用。
开发者建议
- 尝试TGIT:对于从事航空视觉语言导航的开发者,建议尝试TGIT方法,以提升导航智能体的指令翻译能力。
- 探索多场景应用:开发者可以探索TGIT在无人机、机器人等领域的应用,并结合具体场景进行优化。
- 关注后续研究:关注arXiv上关于TGIT的后续研究,以获取最新的技术进展和应用案例。
—— 完 ——消息来源:ArXiv AI (cs.AI) (2026-10-09)
社区整体评论区
正在加载实时智能评论与划词标注…