Indi
谭升的博客 face2ai.com

Abstract: 本文是第二章“多臂赌博机”的绪论,介绍本章主要内容 Keywords: 强化学习,多臂赌博机 多臂赌博机 强化学习与其他学习算法最大的不同在于训练信息,我们熟知的监督学习,无论从简单的线性回归,到复杂的深度学习,所有这些监督学习用到的训练信息都是Instructing(指导,讲授)的,也就是说训练信息中包含明确的行为指导,比如对于一张输入图片判断是否有人脸,标记好的训练数据会明…

讨论

还没有评论,来说第一句吧。

谭升的博客 的其他文章