Indi
范叶亮的博客 leovan.me

本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 马尔可夫模型 马尔可夫模型是一种用于序列数据建模的随机模型,其假设未来的状态仅取决于当前的状态,即: $$ \mathbb{P} \left[S_{t+1} | S_t\right] = \mathbb{P} …

讨论

还没有评论,来说第一句吧。

范叶亮的博客 的其他文章