机器学习共42篇
数据标注:被低估的关键环节-子比笔记

数据标注:被低估的关键环节

数据标注是给原始数据贴标签的过程:这张图里是猫还是狗、这条评论是正面还是负面。它是监督学习的燃料,也被称为“AI 行业里最苦的活”。 数据标注行业藏着 AI 繁华背后的另一面:全球有数以百...
特征工程实战:让数据更好用-子比笔记

特征工程实战:让数据更好用

特征工程是把原始数据加工成模型可用特征的技术:时间戳拆成“星期几”“是否节假日”,地址转成经纬度与到地铁站的距离。它决定了模型看到的世界长什么样。 特征工程最像做菜:同样的食材(数...
模型部署:从 notebook 到生产环境-子比笔记

模型部署:从 notebook 到生产环境

在 notebook 里跑通模型只完成了 20% 的工作。部署到生产环境,要解决 API 封装、负载均衡、版本管理、监控告警、A/B 测试、回滚机制——这些才是真正决定项目成败的部分。 研究员与工程师的最...
A/B 测试与模型迭代:让数据说话-子比笔记

A/B 测试与模型迭代:让数据说话

新模型到底好不好,不能看离线指标,要看真实用户行为。A/B 测试把用户分流对比新旧模型,用业务指标(转化率、留存率)而非技术指标做决策。 A/B 测试的本质是谦卑:承认我们无法预测用户的反...
模型监控:上线只是开始-子比笔记

模型监控:上线只是开始

模型上线后会慢慢变坏:用户行为变了、数据分布变了、对手适应了。没有监控的模型就像不体检的人——出问题时往往已经晚了。 模型监控的哲学适用于所有系统:维护比建设更考验耐心。很多组织热...
机器学习项目的失败模式-子比笔记

机器学习项目的失败模式

机器学习项目的失败,90% 不是因为算法不行,而是因为:问题定义不清、数据质量太差、期望管理失败、与业务脱节。这些坑,每一个都价值不菲。 所有失败案例归结为一条:把机器学习当成技术问题...
迁移学习:站在巨人的肩膀上-子比笔记

迁移学习:站在巨人的肩膀上

迁移学习把在一个任务上学到的知识迁移到另一个相关任务上——先用大数据训好通用模型,再用少量领域数据微调。它让小团队也能用上顶级 AI 能力。 迁移学习最动人的地方在于“知识可复用”这件...
小样本学习:几个例子就能学会-子比笔记

小样本学习:几个例子就能学会

小样本学习(Few-shot Learning)研究如何用极少量样本掌握新任务——人类看一个苹果就能认识苹果,机器却需要成千上万张图。这是当前 AI 与人类智能差距最明显的地方之一。 小样本学习触及了智...
元学习:让模型学会学习-子比笔记

元学习:让模型学会学习

元学习(Meta-Learning)的训练对象不是某个具体任务,而是“快速学习新任务的能力”。它让模型面对新问题时能用更少数据、更短时间适应,被称为通向 AGI 的路径之一。 元学习把“学习”本身变...
在线学习:模型与时俱进-子比笔记

在线学习:模型与时俱进

在线学习让模型随着新数据持续更新,而不是固定不变。在推荐、风控、舆情等场景,用户行为和攻击手段每天都在变,模型必须跟着变才能保持有效。 在线学习印证了一个常识:世界在变,静止的模型...
早停法:训练何时该喊停-子比笔记

早停法:训练何时该喊停

早停法在验证集误差开始上升时停止训练——虽然训练误差还在下降,但模型已经开始过拟合。它是最简单、最有效的正则化手段,几乎不需要额外计算成本。 早停法教会我们一件重要的事:懂得停下来...
数据增强:不增加数据却让模型更强-子比笔记

数据增强:不增加数据却让模型更强

数据增强通过对现有数据做变换(翻转、旋转、裁剪、加噪声)生成“新”样本,扩大有效训练集。它不需要采集新数据,却能显著提升模型的泛化能力。 数据增强的精髓是“换角度看问题”。同一张图...