训练数据(用于学习)
测试数据(检验泛化)
离群点(手动添加)
┅ 残差线
📖 实验指南 ▾
🎯 核心问题:多项式回归中,次数越高拟合能力越强——但次数过高时,模型会将训练数据中的噪声也一并"记住",导致在测试数据上表现反而下降。找到最优的模型复杂度,是所有机器学习算法的核心挑战。
💡 一句话理解:过拟合就像把练习册答案背熟了,但一到期末考换题就露馅。
📋 操作指南
① 切换多项式次数(1→3→9),观察拟合曲线和误差的变化
② 调节「噪声强度」,观察数据噪声对过拟合程度的影响
③ 调节「训练数据量」,观察样本数量与过拟合的关系
④ 调节「L2正则化系数λ」,观察正则化如何抑制过拟合
⑤ 点击「添加离群点」后在图上放置异常值,观察高次模型对异常值的过度追逐
⑥ 拖拽数据点:按住图上任意点拖动,实时观察曲线变化
🔍 观察什么:不要只看曲线有没有穿过训练点,还要同时看蓝色训练误差和红色测试误差。训练误差继续下降、测试误差反而上升,就是“练习册满分,期末考翻车”的过拟合信号。
📊 数据:训练集 ≈ 北京2023年月均气温(12条),测试集 ≈ 北京2022年月均气温(12条)。同一自然规律(季节循环),不同年份有随机波动——反映真实的泛化场景。
📖 概念字典(学生自学参考 · 点击展开) ▾
🎛️ 多项式次数
🔊 数据噪声 —— 就像量体温时每次读数有微小误差
📉 训练数据量 —— 做了几道练习题?
🛡️ 防作弊罚单 λ —— 模型每多弯一次就罚一次款
📊 误差成绩单 —— 练习册得分 vs 期末考得分
🟦 训练误差(练习册)--
🟥 测试误差(期末考试)--
📏 两个成绩的差距--
💡 当前状态一句话解读
📈 U型曲线 —— 找到最佳次数
横轴:多项式次数(1→9)。蓝线=训练误差(次数越多越低,因为弯越多越能"背"下训练数据)。红线=测试误差(先降后升,像个U——两条线差距最小的点,就是最佳次数)。
✅ 最佳次数出现在测试误差最低的地方——通常2~4次之间。这就是"刚刚好"的模型复杂度。