Indi
お前はどこまで見えている hotarugali.github.io

1. 定义 通过从交互中学习来实现目标的计算方法: 强化学习主要包括三个方面: 感知:在某种程度上感知环境的状态 行动:可以采取行动来影响状态或者达到目标 目标:随着时间的推移最大化累积奖励 2. 交互 强化学习与环境交互过程如下图: 3. 系统要素 历史(History):是观察、行动和奖励的序列。即一直到时间 t t t 为止的所有可观测变量: H t = O 1 , R 1 , A 1 , …

讨论

还没有评论,来说第一句吧。

お前はどこまで見えている 的其他文章