本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 蒙特卡洛算法仅需要 经验 ,即从真实或者模拟的环境交互中采样得到的状态、动作、收益的序例。从 真实 经验中学习不需要关于环境动态变化规律的先验知识,却依然能够达到最优的行为;从 模拟 经验中学习尽管需要一个模型…
本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 蒙特卡洛算法仅需要 经验 ,即从真实或者模拟的环境交互中采样得到的状态、动作、收益的序例。从 真实 经验中学习不需要关于环境动态变化规律的先验知识,却依然能够达到最优的行为;从 模拟 经验中学习尽管需要一个模型…
讨论
登录后参与讨论
还没有评论,来说第一句吧。