多头注意力:从多个角度同时看
多头注意力并行运行多组注意力,每组关注不同维度的信息——有的头看语法关系,有的头看语义相似,有的看长距离依赖。多个视角综合起来,理解就更完整。 多头注意力很像一个优秀的团队:每个人...
位置编码:给注意力补上时间感
注意力机制本身对顺序不敏感——打乱句子顺序可能得到同样的结果。位置编码把每个位置的位置信息编码成向量加进去,让模型知道谁在谁前面。 位置编码的存在提醒我们一件容易忽略的事:信息不只...
Transformer 架构:大模型时代的基石
Transformer 用注意力机制完全取代了循环结构,让序列建模可以全并行计算。2017 年的一篇论文把它带到世界面前,此后几乎所有大模型都建立在它之上。 Transformer 的名字本身就是一个预言:它真...
自注意力:一个词如何“看见”整句话
自注意力让序列中的每个位置都直接与其他所有位置计算关联强度。读“苹果”这个词时,模型会结合上下文判断它是水果还是手机——这种能力正是语言理解的关键。 自注意力的深刻之处在于:意义不...
MoE:混合专家模型的工作原理
MoE(Mixture of Experts)把模型拆成多个“专家”子网络,每次推理只激活其中少数几个。这样既保持了总参数带来的能力,又大幅降低了实际计算量。 MoE 的思想非常人性化:就像医院分科,病人来...
Transformer:改变世界的架构
Transformer 是 2017 年 Google 论文《Attention is All You Need》提出的架构。它完全基于注意力机制,抛弃了传统循环结构,凭借并行训练优势成为大模型时代的事实标准。 Transformer 的成功是...







