NLP基础共3篇
分词器(Tokenizer):模型如何切分语言-子比笔记

分词器(Tokenizer):模型如何切分语言

分词器把连续文本切成模型能处理的 token 序列。它决定了模型如何“看待”语言,直接影响效率、多语言能力与代码处理能力。小小的分词器,其实深刻影响模型表现。 分词器是一个被严重低估的组件...
admin的头像-子比笔记admin10小时前
03510
Token:大模型的“最小阅读单位”-子比笔记

Token:大模型的“最小阅读单位”

Token 是大模型处理文本的最小单位,可能是一个字、一个词或一个词根。中文一句话通常被切成多个 token,英文一个单词可能是 1-3 个 token。模型按 token 计费、按 token 计数上下文。 理解 tok...
admin的头像-子比笔记admin10小时前
0387
上下文窗口:模型的“工作记忆”-子比笔记

上下文窗口:模型的“工作记忆”

上下文窗口是模型一次对话能记住的最大 token 数。窗口小的模型聊几句就“失忆”,窗口大的模型能处理整本书。它是衡量模型实用能力的重要指标。 一个常见误区:把所有资料塞进上下文就觉得模型...
admin的头像-子比笔记admin10小时前
0327