知识图谱:AI 的结构化记忆
知识图谱用“实体-关系-实体”的三元组结构化存储世界知识。刘德华→配偶→朱丽倩,北京→首都→中国。它让机器能做逻辑推理,是搜索、推荐、问答背后的知识底座。 知识图谱的价值在于“连接”...
对话系统:聊天机器人的进化之路
对话系统分两类:任务型(订机票、查天气)与开放域(闲聊)。任务型讲究准确完成目标,开放域讲究自然有趣。大模型的出现让两者的边界开始模糊。 对话系统最深的挑战是“上下文”:人说一句话...
实体消歧:一个词可以指很多人
实体消歧判断文本里的实体指哪一个:说“苹果”,是水果还是公司?它依赖于上下文、领域知识与常识,是知识图谱与信息抽取的关键难点。 实体消歧的困难暴露了语言的一个本质属性:词汇是有限的...
指代消解:读懂代词背后的指代
指代消解判断代词指向谁:“小王给了小李一本书,他很开心”,这个“他”是谁?人类凭语感能判断,机器要经过专门的建模。它是篇章理解的基础能力。 指代消解看似是个小问题,实则触及语言的核...
语料库:NLP 研究的数据基石
语料库是按特定标准收集的语言数据集合:维基百科语料、新闻语料、对话语料。没有大规模语料库,就没有统计 NLP 与深度学习 NLP 的今天。 语料库是语言学的“实验室”:关于语言的一切假设,都...
依存句法分析:找出句子的“骨架”
依存句法分析找出句子中词与词的修饰与被修饰关系,画出句子的“依存树”。主谓宾、定状补,机器用图结构表示它们,进而理解句子的深层结构。 依存树的美在于它揭示了语言的层级性:一句话不是...
Word2Vec:词向量的开山之作
Word2Vec 把每个词训练成一个低维向量,语义相近的词在向量空间里彼此靠近。它让“计算机理解语义”第一次变成了可计算的几何问题,是 NLP 进入深度学习时代的里程碑。 Word2Vec 最深远的贡献不...
GloVe:基于共现矩阵的词向量
GloVe 从全局词共现统计出发训练词向量,与 Word2Vec 的局部上下文思路互补。它曾是词向量的另一主流方案,在多项任务上与 Word2Vec 各有胜负。 Word2Vec 与 GloVe 的对比很像两种学习方式:一...
TF-IDF:最朴素也最有效的关键词算法
TF-IDF 用“词频 × 逆文档频率”衡量一个词对某篇文档的重要性:在本文出现得多(TF 高)、但在别的文档里少见(IDF 高),就是关键词。简单到不可思议,至今仍是文本分析的基石。 TF-IDF 的美...
文本分类:把文章放进对的抽屉
文本分类给文档打标签:垃圾邮件识别、新闻分类、情感判断、意图识别。它是 NLP 最基础也应用最广的任务,几乎所有文本系统都从分类开始。 文本分类教会我们一个朴素的道理:分类是一切认知的起...
情感分析:读懂文字背后的情绪
情感分析判断文本是正面、负面还是中性,广泛用于舆情监测、商品评价、品牌分析。它让企业第一次能“量化”用户的情绪。 情感分析最深刻的挑战在于:人类的情感表达充满言外之意。“你可真行”...
文本相似度:判断两段话是不是一回事
文本相似度计算两段文本在语义上有多接近。查重、搜索、推荐、客服路由,都建立在它之上。从字面匹配到语义匹配,是 NLP 进化的主线之一。 “相似”这个概念远比想象中复杂:王之涣的《登鹳雀楼...












