顶见 · 经管顶刊中文导读
非矩形不确定集下鲁棒MDP的策略梯度算法
Policy Gradient Algorithms for Robust MDP\(\text{s}\) with Nonrectangular Uncertainty Sets
SIAM Journal on Optimization · 2026
被引 0
ABS 3
Mengmeng Li
Daniel Kühn
Tobias Sutter
强化学习
鲁棒优化
马尔可夫决策过程
算法
阅读原文 ↗