深度学习 第4页
循环神经网络(RNN):会记忆的网络-子比笔记

循环神经网络(RNN):会记忆的网络

循环神经网络专门处理序列数据:它每处理一步,就把当前状态传给下一步,从而拥有“记忆”。语音、文本、股票曲线这类有先后顺序的数据,曾主要靠它建模。 RNN 的局限很有哲学意味:它像一个人...
LSTM:给网络装上“记忆门”-子比笔记

LSTM:给网络装上“记忆门”

LSTM(长短期记忆网络)通过遗忘门、输入门、输出门精细控制信息的保留与丢弃,让网络能记住几百步之前的依赖关系。它曾是自然语言处理的不二选择。 LSTM 最动人的设计是“主动遗忘”。它不是努...
admin的头像-子比笔记admin11小时前
03312
GRU:LSTM 的轻量化替代-子比笔记

GRU:LSTM 的轻量化替代

GRU(门控循环单元)把 LSTM 的三个门简化为两个,参数更少、训练更快,在很多任务上效果与 LSTM 相当。它是“够用就好”工程哲学的典范。 GRU 的故事是给所有工程师的提醒:不是越复杂越好。当...
admin的头像-子比笔记admin11小时前
02314
Transformer 架构:大模型时代的基石-子比笔记

Transformer 架构:大模型时代的基石

Transformer 用注意力机制完全取代了循环结构,让序列建模可以全并行计算。2017 年的一篇论文把它带到世界面前,此后几乎所有大模型都建立在它之上。 Transformer 的名字本身就是一个预言:它真...
自注意力:一个词如何“看见”整句话-子比笔记

自注意力:一个词如何“看见”整句话

自注意力让序列中的每个位置都直接与其他所有位置计算关联强度。读“苹果”这个词时,模型会结合上下文判断它是水果还是手机——这种能力正是语言理解的关键。 自注意力的深刻之处在于:意义不...
什么是深度学习:让机器拥有“多层理解”-子比笔记

什么是深度学习:让机器拥有“多层理解”

深度学习是机器学习的一个分支,使用多层(深层)神经网络自动从数据中提取特征。浅层网络只能学简单模式,深层网络能逐层组合出抽象概念——从像素到边缘,从边缘到器官,从器官到人脸。 深度...
神经元与感知机:神经网络的最小单元-子比笔记

神经元与感知机:神经网络的最小单元

神经元是神经网络的基本计算单元:接收多个输入,各乘以权重求和,再通过激活函数输出。1957 年提出的感知机是最早的人工神经元模型,也是所有现代深度网络的祖先。 一个神经元的计算简单到小学...
激活函数:给神经元注入非线性-子比笔记

激活函数:给神经元注入非线性

激活函数给神经元的输出加一层非线性变换。没有它,无论网络多深都等价于一个线性模型,深度就失去了意义。小小的激活函数,其实是深度学习能成的关键。 激活函数的故事很有启示:一个看起来不...
前馈神经网络:最朴素的网络结构-子比笔记

前馈神经网络:最朴素的网络结构

前馈神经网络是最经典的网络结构:数据从输入层单向流经若干隐藏层,最终到达输出层,没有回路。它是理解所有更复杂网络架构的基础课。 前馈网络像一条流水线:原料进来,一道道工序加工,成品...
卷积神经网络(CNN):AI 的眼睛-子比笔记

卷积神经网络(CNN):AI 的眼睛

卷积神经网络是为图像而生的架构:用小窗口(卷积核)在图像上滑动提取局部特征,再逐层组合成高级概念。它让计算机视觉从实验室走向了现实世界。 CNN 的设计充满仿生智慧:人类视觉皮层也是先...