Indi
范叶亮的博客 leovan.me

本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 动态规划 动态规划 (Dynamic Programming,DP)是一种用于解决具有如下两个特性问题的通用算法: 优化问题可以分解为子问题。 子问题出现多次并可以被缓存和复用。 马尔可夫决策过程正符合这两个特…

讨论

还没有评论,来说第一句吧。

范叶亮的博客 的其他文章