顶见 · 经管顶刊中文导读
策略镜像下降天生探索动作空间
Policy Mirror Descent Inherently Explores Action Space
SIAM Journal on Optimization · 2025
被引 0
ABS 3
Yan Li
Guanghui Lan
强化学习
优化理论
机器学习
运筹学
阅读原文 ↗