arXiv发布新研究:基于预算的自适应神经算子PDE求解器优化长时强化学习
文 / Mr.Xu
发布时间:
摘要:arXiv发布了一项关于长时强化学习的研究,提出了一种名为预算自适应神经算子求解器的新方法,用于解决时间依赖偏微分方程(PDE)的快速近似问题。该方法结合全局傅里叶神经算子与局部残差校正算子,并通过一种称为rollout-verified policy improvement (RV-PI) 的新策略优化技术,在固定修正预算下显著提升了PDE求解的精度。在浅水波和驱动驱动的布鲁塞尔反应器基准测试中,RV-PI方法相较于仅即时策略改进和随机宏观策略分别实现了5.37%和2.41%的误差降低,展示了其在复杂动态系统建模中的潜力。
研究背景与动机
时间依赖偏微分方程(PDEs)在科学和工程领域广泛应用,但其精确求解通常需要大量计算资源。神经算子提供了一种快速近似求解PDEs的方法,但其在自回归部署过程中面临修正分配问题,即预测误差在空间和时间上变化,而沿轨迹只能进行有限次数的局部修正。本研究旨在通过引入预算自适应神经算子求解器来解决这一问题。
方法与技术创新
- 全局与局部算子结合:使用全局傅里叶神经算子推进整个场域,并结合局部算子提出分块残差校正。
- 修正预算管理:引入宏观策略来决定何时以及花费多少剩余的修正预算。
- Rollout-Verified Policy Improvement (RV-PI):通过实际延续轨迹的rollout评估可行的修正次数,将长时优势转化为保守策略目标,并仅在保留轨迹误差改善时接受更新。
实验结果
在浅水波基准测试中,RV-PI在32次干预预算下实现了0.6910的三种子平均轨迹相对L2误差,相较于仅即时策略改进和随机宏观策略分别提升了5.37%和2.41%。在驱动驱动的布鲁塞尔反应器基准测试中,RV-PI在76次干预预算下达到了0.09954的误差,相较于仅即时策略改进和随机宏观策略分别提升了2.31%和5.32%。
行业影响与开发者建议
- 行业影响:该研究为复杂动态系统建模提供了新的技术路径,尤其在气象模拟、流体动力学等领域具有潜在应用价值。
- 开发者建议:开发者可以尝试将RV-PI方法应用于其他需要长时决策和资源管理的领域,如机器人控制和资源分配问题。此外,RV-PI的策略优化技术也可以作为强化学习框架中的参考。
未来研究方向
未来的研究可以进一步探索如何将RV-PI方法扩展到更高维度的PDEs,以及如何结合其他先进的神经网络架构(如Transformer)来提升求解精度和效率。
—— 完 ——消息来源:ArXiv Machine Learning (cs.LG) (2026-10-07)
社区整体评论区
正在加载实时智能评论与划词标注…