UVIP:评估强化学习算法的无模型方法
UVIP: Model-Free Approach to Evaluate Reinforcement Learning Algorithms
Journal of Optimization Theory and Applications · 2026
被引 0 · 同刊同年前 8%
ABS 3
- Denis Belomestny
- Ilya Levin 通讯
- Alexey Naumov
- Sergey Samsonov
强化学习马尔可夫决策过程算法评估计算理论