非矩形不确定集下鲁棒MDP的策略梯度算法

Policy Gradient Algorithms for Robust MDP\(\text{s}\) with Nonrectangular Uncertainty Sets

SIAM Journal on Optimization · 2026
被引 0
ABS 3
强化学习鲁棒优化马尔可夫决策过程算法