书籍介绍
这是一本把重心压在“实现”上的强化学习入门书,与Sutton经典教材形成互补:理论部分与其高度重合,但作者用大量Python、Gym、TensorFlow 2及AlphaZero代码把算法落到可运行的实例上,从“小车上山”“悬崖寻路”到自动驾驶、棋盘游戏,覆盖了《自然》《科学》等期刊上的深度强化学习算法。读者最看重的,是它“理论与实操比例刚刚好”——既讲Markov决策过程、Bellman方程,也讲策略迭代与价值迭代。不过编辑要提醒:它更适合作为“看过Sutton之后”的补充,而非唯一入门;第一版存在一些小错误,部分算法讲解偏浅,新版Gym的示例也需自行调整。若想系统理解原理背后的数学,这本书能给你清晰的中文脉络;若追求深度推导,则需另寻出处。