策略梯度:强化学习的另一条路
策略梯度不估计每个动作的价值,而是直接优化“在什么状态下该采取什么动作”的策略本身。它比基于价值的方法更适合连续动作空间,是机器人控制的常用方案。 策略梯度与基于价值的方法像两种处...
Actor-Critic:演员与评论家的双人舞
Actor-Critic 同时维护两个网络:Actor 负责决策“做什么”,Critic 负责评价“做得好不好”。两者相互配合,既解决了策略梯度方差大的问题,又保持了策略方法的灵活性。 Actor-Critic 是一个非...
反向传播:深度学习的高效引擎
反向传播是训练神经网络的核心算法:先正向计算输出与误差,再反向逐层计算每个参数对误差的贡献(梯度),最后据此更新参数。它让多层网络的可训练性成为现实。 反向传播的巧妙在于“责任分配...
逻辑回归:分类问题的经典解法
逻辑回归虽然名字里有“回归”,其实是做分类的:它输出一个 0 到 1 之间的概率,表示某件事发生的可能性。银行判断你违约的概率、邮箱判断邮件是垃圾的概率,背后常常是它。 逻辑回归的魅力在...
决策树:像人类一样做判断
决策树把决策过程画成一棵树:每个节点问一个问题,每个分支是一个答案,叶子是最终结论。“是否发烧?→ 是 → 体温多少?→ 超过 39 度 → 建议就医”,非常接近人类的推理方式。 决策树的存...
随机森林:三个臭皮匠顶个诸葛亮
随机森林同时训练许多棵决策树,每棵树只看部分数据、用部分特征,最后投票表决。这种“集成”策略大幅提升了预测的稳定性和准确率,是工业界最常用的算法之一。 随机森林的智慧是反直觉的:一...
支持向量机:寻找最佳分界线
支持向量机(SVM)的目标是在不同类别之间画出一条“最宽的分界线”,让两侧的数据离分界线都尽量远。它曾经在深度学习爆发前称霸图像与文本分类领域。 SVM 的“最大间隔”思想很有哲理:不要只...
朴素贝叶斯:简单但强大的概率推断
朴素贝叶斯基于贝叶斯定理做分类:已知某些特征出现,计算属于各类别的概率,取最大者。它之所以“朴素”,是假设各特征之间相互独立——虽然这个假设常常不成立,但效果出人意料地好。 朴素贝...
K 近邻:物以类聚的算法版本
K 近邻(KNN)的思路极其直白:想判断一个新数据属于哪类,就看它最近的 K 个邻居属于哪类,少数服从多数。它几乎不需要训练,是“懒学习”的典型代表。 KNN 证明了有时候最简单的逻辑最接近直...
梯度提升树:Kaggle 竞赛的常胜将军
梯度提升树通过串联很多棵弱决策树来强化模型:每棵新树专门纠正前面所有树犯的错误,一步步逼近最优解。XGBoost、LightGBM 是其集大成者,长期称霸数据科学竞赛。 梯度提升树的策略很励志:不...
监督学习:有标准答案的学习方式
监督学习用带标签的数据训练模型:给模型看大量“输入+正确答案”,让它学会从新输入预测答案。就像学生做有标准答案的习题集,做完对照答案不断纠正。 监督学习最朴素的智慧其实是“示例驱动”...
半监督学习:用少量标签撬动大数据
半监督学习介于监督与无监督之间:用少量有标签数据加大量无标签数据一起训练。它针对的是标注成本高、但原始数据充足的现实困境。 半监督学习体现了一种很实用的工程哲学:不追求完美条件,而...













