强化学习的策略镜像下降:线性收敛、新采样复杂度与广义问题类别

Policy mirror descent for reinforcement learning: linear convergence, new sampling complexity, and generalized problem classes

Mathematical Programming · 2022
被引 53 · 同刊同年前 2%
ABS 4
强化学习优化理论机器学习人工智能