admin的头像-子比笔记
吉林管理员
这家伙很懒,什么都没有写...
GloVe:基于共现矩阵的词向量-子比笔记

GloVe:基于共现矩阵的词向量

GloVe 从全局词共现统计出发训练词向量,与 Word2Vec 的局部上下文思路互补。它曾是词向量的另一主流方案,在多项任务上与 Word2Vec 各有胜负。 Word2Vec 与 GloVe 的对比很像两种学习方式:一...
TF-IDF:最朴素也最有效的关键词算法-子比笔记

TF-IDF:最朴素也最有效的关键词算法

TF-IDF 用“词频 × 逆文档频率”衡量一个词对某篇文档的重要性:在本文出现得多(TF 高)、但在别的文档里少见(IDF 高),就是关键词。简单到不可思议,至今仍是文本分析的基石。 TF-IDF 的美...
文本分类:把文章放进对的抽屉-子比笔记

文本分类:把文章放进对的抽屉

文本分类给文档打标签:垃圾邮件识别、新闻分类、情感判断、意图识别。它是 NLP 最基础也应用最广的任务,几乎所有文本系统都从分类开始。 文本分类教会我们一个朴素的道理:分类是一切认知的起...
情感分析:读懂文字背后的情绪-子比笔记

情感分析:读懂文字背后的情绪

情感分析判断文本是正面、负面还是中性,广泛用于舆情监测、商品评价、品牌分析。它让企业第一次能“量化”用户的情绪。 情感分析最深刻的挑战在于:人类的情感表达充满言外之意。“你可真行”...
文本相似度:判断两段话是不是一回事-子比笔记

文本相似度:判断两段话是不是一回事

文本相似度计算两段文本在语义上有多接近。查重、搜索、推荐、客服路由,都建立在它之上。从字面匹配到语义匹配,是 NLP 进化的主线之一。 “相似”这个概念远比想象中复杂:王之涣的《登鹳雀楼...
机器翻译:打破语言巴别塔-子比笔记

机器翻译:打破语言巴别塔

机器翻译跨越语言障碍,让不同语言的人自由交流。从早期基于规则的蹩脚翻译,到神经网络的流畅自然,再到大模型的信达雅,它可能是 AI 造福人类最直接的应用。 机器翻译最动人的愿景是打破巴别...
问答系统:从 FAQ 到 ChatGPT-子比笔记

问答系统:从 FAQ 到 ChatGPT

问答系统让用户用自然语言提问、机器给出答案。从早期死板的 FAQ 库,到知识图谱问答,到基于 RAG 的文档问答,再到大模型的自由问答,它经历了四次范式跃迁。 问答系统的发展史,其实是人类与...
信息抽取:从文本里“淘金”-子比笔记

信息抽取:从文本里“淘金”

信息抽取从非结构化文本中提取结构化知识:实体、关系、事件。它是构建知识图谱、做商业情报分析、支撑问答系统的底层技术。 信息抽取的本质是“把文字变成数据”。人类世界的大部分知识藏在文...
知识图谱:AI 的结构化记忆-子比笔记

知识图谱:AI 的结构化记忆

知识图谱用“实体-关系-实体”的三元组结构化存储世界知识。刘德华→配偶→朱丽倩,北京→首都→中国。它让机器能做逻辑推理,是搜索、推荐、问答背后的知识底座。 知识图谱的价值在于“连接”...
对话系统:聊天机器人的进化之路-子比笔记

对话系统:聊天机器人的进化之路

对话系统分两类:任务型(订机票、查天气)与开放域(闲聊)。任务型讲究准确完成目标,开放域讲究自然有趣。大模型的出现让两者的边界开始模糊。 对话系统最深的挑战是“上下文”:人说一句话...
实体消歧:一个词可以指很多人-子比笔记

实体消歧:一个词可以指很多人

实体消歧判断文本里的实体指哪一个:说“苹果”,是水果还是公司?它依赖于上下文、领域知识与常识,是知识图谱与信息抽取的关键难点。 实体消歧的困难暴露了语言的一个本质属性:词汇是有限的...
指代消解:读懂代词背后的指代-子比笔记

指代消解:读懂代词背后的指代

指代消解判断代词指向谁:“小王给了小李一本书,他很开心”,这个“他”是谁?人类凭语感能判断,机器要经过专门的建模。它是篇章理解的基础能力。 指代消解看似是个小问题,实则触及语言的核...