自编码器:学会自我压缩
自编码器由编码器和解码器组成:把输入压缩成低维表示,再尝试从表示重建输入。它不需要标签,纯粹靠“重建自己”学到数据的本质特征。 自编码器的学习方式很像费曼的名言:“如果你不能把它重...
层归一化:稳定训练的幕后功臣
层归一化对每一层的激活值做标准化,防止数值在深层传递中爆炸或消失。它配合残差连接,让深层 Transformer 能够稳定训练。 层归一化的作用可以类比为社会治理中的“调控”:任由各种信号自由放...
循环神经网络(RNN):会记忆的网络
循环神经网络专门处理序列数据:它每处理一步,就把当前状态传给下一步,从而拥有“记忆”。语音、文本、股票曲线这类有先后顺序的数据,曾主要靠它建模。 RNN 的局限很有哲学意味:它像一个人...
什么是深度学习:让机器拥有“多层理解”
深度学习是机器学习的一个分支,使用多层(深层)神经网络自动从数据中提取特征。浅层网络只能学简单模式,深层网络能逐层组合出抽象概念——从像素到边缘,从边缘到器官,从器官到人脸。 深度...
神经元与感知机:神经网络的最小单元
神经元是神经网络的基本计算单元:接收多个输入,各乘以权重求和,再通过激活函数输出。1957 年提出的感知机是最早的人工神经元模型,也是所有现代深度网络的祖先。 一个神经元的计算简单到小学...
激活函数:给神经元注入非线性
激活函数给神经元的输出加一层非线性变换。没有它,无论网络多深都等价于一个线性模型,深度就失去了意义。小小的激活函数,其实是深度学习能成的关键。 激活函数的故事很有启示:一个看起来不...
前馈神经网络:最朴素的网络结构
前馈神经网络是最经典的网络结构:数据从输入层单向流经若干隐藏层,最终到达输出层,没有回路。它是理解所有更复杂网络架构的基础课。 前馈网络像一条流水线:原料进来,一道道工序加工,成品...
参数与权重:模型内部的数字海洋
参数是模型内部可学习的数值,权重是参数中最主要的部分。一个 70 亿参数的模型,意味着它内部有 70 亿个数字在共同决定输出结果。参数量常被用来粗略衡量模型规模。 一个直观类比:参数就像大...









