← 首页

🎮 简化强化学习实验室:教 AI 下井字棋

请在右侧点击「我要挑战 AI」
👨‍🏫 老师的提示:
棋盘上的小数字是 AI 的「经验值」——它不是记"某个位置好不好",而是记"这个局面下"某个位置好不好
刚开始 AI 的脑子是空的(全是 0),你可以直接挑战(此时 AI 纯随机瞎走),也可以先让它闭关修炼几千盘再战。

📖 实验指南

🎯 简化 Q 表试错学习 —— AI 自己和自己下棋,从零积累经验

💡 一句话理解:AI把每个棋局当成一页账本,赢了给好走法加分,输了给坏走法扣分。

📌 实验目的:理解AI如何不需要人类数据,仅通过"试错"(赢→加分,输→扣分)自己学会下棋。AI 大脑里有一张巨大的"经验表"(Q表),记录每个局面下每种走法的好坏——训练越多,经验越准。

🌟 现实应用:AlphaGo(围棋AI)、自动驾驶(试错学习开车)、机器人控制(跌倒→爬起→学会走路)、游戏AI(StarCraft、Dota2)。

🧩 说明:为了让初中生先看懂“局面-动作-奖惩”的核心思想,本实验使用简化 Q 值更新;完整 Q-learning 还会继续估计下一步的未来收益。

📋 操作:① 直接点「我要挑战AI」体验(此时AI随机走) → ② 或在挑战前先点「练5000盘」让AI自己练 → ③ 观察棋盘上的Q值变化 → ④ 调整进阶参数看AI策略如何改变

🧠 AI 的学习逻辑

1. 看局面:当前棋盘长什么样?
2. 翻账本(Q表):这个局面下,历史上走哪里得分高?
3. 大冒险:偶尔不看账本,瞎走一步试试新路。
4. 拿奖惩+100 · −100 · 平局 +10

📐 本实验的简化 Q 值更新:
新值 = 旧值 + 0.2 × (奖惩 − 旧值)

🏋️ 闭关修炼(AI 自己和自己下)

🔧 进阶参数(点击展开)

赢棋奖励+100
调大 → AI拼命想赢,但可能死记硬背某条路线
输棋惩罚−100
调大(更负)→ AI极度怕输,被惩罚过的路永不触碰
平局奖励+10
调大 → AI觉得平局也不错,走法偏保守
学习率 α0.20
调大 → 新经验快速覆盖旧经验;调小 → 学得慢但稳
最低探索率5%
训练到最后保留多少随机瞎蒙的比例

📊 AI 档案

累计对弈0
大脑容量(见过的局面)0
探索率 ε100%

🎮 亲自检验

📖 当前局面 —— AI 的脑电波

等待开始…