强化学习(Reinforcement Learning)是一种用于模拟现实世界的算法,而其中的一个重要的组成部分是 Q-Learning。 假设有一系列「状态」(state)组成的环境,在每一个状态中都可以采取一种「动作」(action)到达下一个状态。 这些状态并不都是相同的,根据实际应用,不同的状态有不同的「奖励」(reward),而且存在终止状态。我们的目标是从任意初始状态出发,到达终止状态…
强化学习(Reinforcement Learning)是一种用于模拟现实世界的算法,而其中的一个重要的组成部分是 Q-Learning。 假设有一系列「状态」(state)组成的环境,在每一个状态中都可以采取一种「动作」(action)到达下一个状态。 这些状态并不都是相同的,根据实际应用,不同的状态有不同的「奖励」(reward),而且存在终止状态。我们的目标是从任意初始状态出发,到达终止状态…
讨论
登录后参与讨论
还没有评论,来说第一句吧。