← 首页

📊 过拟合 · 模型复杂度的陷阱

| 数据:北京月均气温(训练≈2023 / 测试≈2022)
训练数据(用于学习) 测试数据(检验泛化) 离群点(手动添加) ┅ 残差线

📖 实验指南 ▾

🎯 核心问题:多项式回归中,次数越高拟合能力越强——但次数过高时,模型会将训练数据中的噪声也一并"记住",导致在测试数据上表现反而下降。找到最优的模型复杂度,是所有机器学习算法的核心挑战。

💡 一句话理解:过拟合就像把练习册答案背熟了,但一到期末考换题就露馅。

📋 操作指南

① 切换多项式次数(1→3→9),观察拟合曲线和误差的变化
② 调节「噪声强度」,观察数据噪声对过拟合程度的影响
③ 调节「训练数据量」,观察样本数量与过拟合的关系
④ 调节「L2正则化系数λ」,观察正则化如何抑制过拟合
⑤ 点击「添加离群点」后在图上放置异常值,观察高次模型对异常值的过度追逐
拖拽数据点:按住图上任意点拖动,实时观察曲线变化

🔍 观察什么:不要只看曲线有没有穿过训练点,还要同时看蓝色训练误差和红色测试误差。训练误差继续下降、测试误差反而上升,就是“练习册满分,期末考翻车”的过拟合信号。

📊 数据:训练集 ≈ 北京2023年月均气温(12条),测试集 ≈ 北京2022年月均气温(12条)。同一自然规律(季节循环),不同年份有随机波动——反映真实的泛化场景。

📖 概念字典(学生自学参考 · 点击展开) ▾

🎛️ 多项式次数

🔊 数据噪声 —— 就像量体温时每次读数有微小误差

💡 0°C=完美数据(现实中不存在)。5°C=极度嘈杂——AI为了追这些随机误差,曲线开始疯狂扭动。体会:噪声越大,过拟合越严重。AI不该去"记"这些随机波动。

📉 训练数据量 —— 做了几道练习题?

💡 12条=做够了题,模型能学到真正的季节规律。4条=只做了4道题——数据太少,9次多项式的9个弯只能"胡编乱造"来凑。这就是为什么ChatGPT需要海量数据训练:数据越多,越难过拟合。

🛡️ 防作弊罚单 λ —— 模型每多弯一次就罚一次款

💡 λ=0=不罚款,9次曲线疯狂扭动。试着拉到 λ=1.0——罚单开大了,9次曲线也被迫变平滑!这就是AI工程师对抗过拟合的"紧箍咒"。代价:训练误差会变大一丢丢,但测试成绩反而更好。

📊 误差成绩单 —— 练习册得分 vs 期末考得分

🟦 训练误差(练习册)--
🟥 测试误差(期末考试)--
📏 两个成绩的差距--

💡 当前状态一句话解读

📈 U型曲线 —— 找到最佳次数

横轴:多项式次数(1→9)。蓝线=训练误差(次数越多越低,因为弯越多越能"背"下训练数据)。红线=测试误差(先降后升,像个U——两条线差距最小的点,就是最佳次数)。
✅ 最佳次数出现在测试误差最低的地方——通常2~4次之间。这就是"刚刚好"的模型复杂度。