请在右侧点击「我要挑战 AI」
👨🏫 老师的提示:
棋盘上的小数字是 AI 的「经验值」——它不是记"某个位置好不好",而是记"这个局面下"某个位置好不好。
刚开始 AI 的脑子是空的(全是 0),你可以直接挑战(此时 AI 纯随机瞎走),也可以先让它闭关修炼几千盘再战。
棋盘上的小数字是 AI 的「经验值」——它不是记"某个位置好不好",而是记"这个局面下"某个位置好不好。
刚开始 AI 的脑子是空的(全是 0),你可以直接挑战(此时 AI 纯随机瞎走),也可以先让它闭关修炼几千盘再战。
📖 实验指南 ▾
🎯 简化 Q 表试错学习 —— AI 自己和自己下棋,从零积累经验
💡 一句话理解:AI把每个棋局当成一页账本,赢了给好走法加分,输了给坏走法扣分。
📌 实验目的:理解AI如何不需要人类数据,仅通过"试错"(赢→加分,输→扣分)自己学会下棋。AI 大脑里有一张巨大的"经验表"(Q表),记录每个局面下每种走法的好坏——训练越多,经验越准。
🌟 现实应用:AlphaGo(围棋AI)、自动驾驶(试错学习开车)、机器人控制(跌倒→爬起→学会走路)、游戏AI(StarCraft、Dota2)。
🧩 说明:为了让初中生先看懂“局面-动作-奖惩”的核心思想,本实验使用简化 Q 值更新;完整 Q-learning 还会继续估计下一步的未来收益。
📋 操作:① 直接点「我要挑战AI」体验(此时AI随机走) → ② 或在挑战前先点「练5000盘」让AI自己练 → ③ 观察棋盘上的Q值变化 → ④ 调整进阶参数看AI策略如何改变
🧠 AI 的学习逻辑
1. 看局面:当前棋盘长什么样?
2. 翻账本(Q表):这个局面下,历史上走哪里得分高?
3. 大冒险:偶尔不看账本,瞎走一步试试新路。
4. 拿奖惩:赢 +100 · 输 −100 · 平局 +10
📐 本实验的简化 Q 值更新:
新值 = 旧值 + 0.2 × (奖惩 − 旧值)
🏋️ 闭关修炼(AI 自己和自己下)
▶ 🔧 进阶参数(点击展开)
赢棋奖励+100
调大 → AI拼命想赢,但可能死记硬背某条路线
输棋惩罚−100
调大(更负)→ AI极度怕输,被惩罚过的路永不触碰
平局奖励+10
调大 → AI觉得平局也不错,走法偏保守
学习率 α0.20
调大 → 新经验快速覆盖旧经验;调小 → 学得慢但稳
最低探索率5%
训练到最后保留多少随机瞎蒙的比例
📊 AI 档案
累计对弈0
大脑容量(见过的局面)0
探索率 ε100%
🎮 亲自检验
📖 当前局面 —— AI 的脑电波
等待开始…