优化共7篇
L1 与 L2 正则化:稀疏与平滑的选择-子比笔记

L1 与 L2 正则化:稀疏与平滑的选择

L1 正则化(绝对值惩罚)倾向产生稀疏解,把不重要的参数直接压到零;L2 正则化(平方惩罚)倾向让所有参数都变小但不为零,解更平滑。选哪个取决于具体需求。 这两种惩罚方式折射出不同的处世...
admin的头像-子比笔记admin9小时前
0489
学习率:训练过程中最关键的超参数-子比笔记

学习率:训练过程中最关键的超参数

学习率决定模型每次参数更新的步长。太大会在最优解附近来回震荡甚至发散,太小则训练极慢、可能卡在局部最优。几乎所有的训练失败,最先要怀疑的就是学习率。 学习率是“欲速则不达”的算法版...
admin的头像-子比笔记admin9小时前
03213
批量大小:影响训练效果的无形之手-子比笔记

批量大小:影响训练效果的无形之手

批量大小指每次参数更新时使用的样本数。大批量训练快但容易陷入尖锐极小值,小批量噪声多但泛化更好。这个看似技术性的参数,其实深刻影响模型的最终表现。 批量大小的取舍揭示了一个深刻道理...
admin的头像-子比笔记admin9小时前
0236
正则化:给模型戴上“紧箍咒”-子比笔记

正则化:给模型戴上“紧箍咒”

正则化通过在损失函数里增加惩罚项,阻止模型把参数学得过于极端,从而抑制过拟合。它让模型“别太用力”,在训练数据上的表现略微下降,换来在新数据上更稳定。 正则化的思想充满东方智慧:留...
admin的头像-子比笔记admin9小时前
04113
模型量化:用更少显存跑更大模型-子比笔记

模型量化:用更少显存跑更大模型

量化是把模型参数从高精度(如 32 位浮点)压缩到低精度(如 8 位、4 位整数)的技术。它以极小的性能损失换取大幅的显存节省,是本地部署大模型的必备手段。 量化的意义在于让 AI 民主化:不是...
admin的头像-子比笔记admin9小时前
03510
知识蒸馏:大模型教小模型-子比笔记

知识蒸馏:大模型教小模型

知识蒸馏是用大模型(教师)的输出训练小模型(学生),让小模型在特定任务上逼近大模型的效果,同时保持小体积、低成本。这是“大而强”到“小而美”的转化桥梁。 对企业的实用价值是:不必所...
admin的头像-子比笔记admin9小时前
02511
损失函数:AI 学习的“错题本”-子比笔记

损失函数:AI 学习的“错题本”

损失函数衡量模型预测与真实答案的差距,差距越大损失越大。训练的目标就是不断调整参数让损失降到最低——可以说整个机器学习都在“最小化损失函数”。 损失函数像是给模型的评分标准:你定义...
admin的头像-子比笔记admin9小时前
0347