数据科学共5篇
混淆矩阵:看清模型到底错在哪-子比笔记

混淆矩阵:看清模型到底错在哪

混淆矩阵把模型的预测结果拆成四类:真正例、假正例、真反例、假反例。它不只告诉你“对了多少”,更告诉你“错在哪里”,是诊断模型问题的第一步。 混淆矩阵最深刻的启示是:错误与错误并不等...
admin的头像-子比笔记admin9小时前
0458
主成分分析(PCA):给数据做减法-子比笔记

主成分分析(PCA):给数据做减法

PCA 是一种降维技术:在尽量保留信息的前提下,把高维数据压缩到低维。一张人脸有上万个像素,PCA 能用几十个“主成分”就大致还原它,是数据压缩与可视化的利器。 PCA 的哲学很迷人:任何复杂...
admin的头像-子比笔记admin9小时前
02413
交叉验证:科学评估模型的正确姿势-子比笔记

交叉验证:科学评估模型的正确姿势

交叉验证把数据分成多份,轮流用其中一份做测试、其余做训练,综合多次结果评估模型。它能有效避免“恰巧碰到简单测试集”的评估偏差,是判断模型好坏的基本功。 交叉验证的本质是“不要用一次...
admin的头像-子比笔记admin9小时前
0399
什么是特征:机器认识世界的方式-子比笔记

什么是特征:机器认识世界的方式

特征是数据中可被模型利用的、有区分度的信息片段。判断一封邮件是否垃圾邮件,“是否含敏感词”“发送频率”都是特征。传统机器学习把大量精力花在特征构造上。 工业界有句老话:“数据决定上...
admin的头像-子比笔记admin9小时前
05010
数据:AI 的燃料与枷锁-子比笔记

数据:AI 的燃料与枷锁

数据是训练 AI 的原材料,模型的一切知识都来自训练数据。数据的质量、数量、多样性直接决定模型能力上限——垃圾数据只能训练出垃圾模型,这是 AI 领域最朴素的真理。 一个常被忽视的事实:模...
admin的头像-子比笔记admin9小时前
0365