具有线性函数逼近的熵正则化自然策略梯度的收敛性

Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation

SIAM Journal on Optimization · 2024
被引 6
ABS 3
强化学习优化理论数学经济学算法收敛性分析