Indi
范叶亮的博客 leovan.me

本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 时序差分预测 时序差分 (Temporal Difference,TD)和蒙特卡洛方法都利用经验来解决预测问题。给定策略 $\pi$ 的一些经验,以及这些经验中的非终止状态 $S_t$ ,一个适用于非平稳环境的…

讨论

还没有评论,来说第一句吧。

范叶亮的博客 的其他文章