智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #自动驾驶 #视觉-语言模型 #语义推理 #谓词知识图谱 #ArXiv

ArXiv提出多数据集谓词框架,革新自动驾驶场景理解与推理

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:ArXiv发布了一项关于自动驾驶场景理解的研究,提出了一种基于多数据集谓词框架的新方法。该方法通过几何、运动、时间、地图和交通控制等可测量证据,生成驾驶场景的语义表示,并在nuPlan和nuScenes数据集上实现了高精度的语义验证。实验结果表明,该框架在多个NuPlanQA子任务中显著提升了模型性能,尤其是在交通灯识别、情境评估和行动推荐方面表现突出,展示了谓词知识图谱在减少视觉依赖和提升推理可解释性方面的潜力。


研究背景与动机

近年来,视觉-语言模型在自动驾驶场景理解中的应用日益广泛,但其输出的语义关系往往难以与实际交通状况对应,导致推理结果难以验证。为解决这一问题,ArXiv发布了一项关于多数据集谓词框架的研究,旨在通过可测量的证据生成驾驶场景的语义表示,并实现跨数据集的一致性验证。

技术亮点

  1. 多数据集谓词框架:该框架通过几何、运动、时间、地图和交通控制等证据,生成驾驶场景的语义表示。谓词定义在nuPlan和nuScenes数据集上保持一致,并通过谓词知识图谱(Predicate Knowledge Graph, KG)实现统一管理。
  2. 高精度的语义验证:在nuPlan和nuScenes数据集的200个场景中,该框架的宏观F1得分分别达到0.94和0.93,跨数据集的平均差异仅为0.02。
  3. 提升推理性能:在NuPlanQA的九个任务中,谓词知识图谱在七个任务中表现最佳,尤其是在交通灯识别(从53.2%提升至71.5%)、情境评估(从76.2%提升至86.1%)和行动推荐(从82.9%提升至89.0%)方面表现突出。
  4. 减少视觉依赖:在天气/光照条件不变的情况下,谓词知识图谱的输入优于仅使用元数据的输入,展示了其在减少视觉依赖方面的潜力。

行业影响

该研究为自动驾驶场景理解提供了一种新的语义表示方法,能够显著提升模型的可解释性和推理性能。其在多个子任务中的优异表现表明,谓词知识图谱有望成为未来自动驾驶系统中的重要组成部分。此外,该方法也为其他需要高可靠性推理的应用场景提供了参考。

开发者建议

  1. 关注谓词定义的一致性:在跨数据集应用中,保持谓词定义的一致性是实现高准确率的关键。
  2. 探索更多证据来源:除了现有的几何、运动等证据,还可以考虑引入更多类型的证据以进一步提升语义表示的准确性。
  3. 结合其他技术:将谓词知识图谱与其他技术(如强化学习、因果推理)结合,可能会带来更强大的推理能力。

消息来源:ArXiv Machine Learning (cs.LG) (2026-09-30)

—— 完 ——

主题标签: #自动驾驶 #视觉-语言模型 #语义推理 #谓词知识图谱 #ArXiv

社区整体评论区

正在加载实时智能评论与划词标注…