Q-Learning(强化学习)

off-policy 时序差分控制。默认场景 CliffWalking 4×12,观察 Q 值更新与奖励收敛趋势

50
0.5
0.9
0.3
1
4x
Episode 0 / 50 0 本 Episode 累计奖励 0 探索/利用
网格世界(每格最优动作箭头)
智能体 出发格 悬崖(-100)
Q 值更新公式(实时代入)
点击"开始训练"后显示每步 TD 更新
奖励曲线(每 Episode 总奖励,越接近 0 越好)
当前步骤说明

尚未训练。点击"开始训练"

算法说明

核心更新:Q(s,a) ← Q(s,a) + α·[r + γ·maxa' Q(s',a') − Q(s,a)],TD 误差驱动值函数逼近最优

off-policy:用"最优"下一步价值更新(与行为策略无关),故 CliffWalking 会学到沿悬崖边缘的"贪心最短路"

自定义场景:切换到「自定义绘制」,选择工具后在网格上点击即可设置起点 / 终点 / 悬崖;悬崖即每步 -100 的惩罚区。设置完成后点「开始训练」

核心代码