自然语言处理共24篇
文本生成:从模板到自由创作-子比笔记

文本生成:从模板到自由创作

文本生成(NLG)让机器写出流畅自然的文字:天气播报、财报摘要、诗歌小说。从早期死板的模板填充,到现在大模型的自由创作,它已经能骗过大部分读者。 文本生成最有意思的哲学问题是:写作的本...
语音与文本的桥梁:ASR 与 TTS 的协作-子比笔记

语音与文本的桥梁:ASR 与 TTS 的协作

语音助手背后是 ASR(听)与 TTS(说)的接力,中间夹着 NLP 的理解与生成。这条链条每一环的质量,共同决定了“跟机器说话”的体验。 语音交互的魅力在于它是最自然的交互方式——人类交流的本...
admin的头像-子比笔记admin9小时前
04912
低资源语言处理:AI 的普惠难题-子比笔记

低资源语言处理:AI 的普惠难题

世界上有 7000 多种语言,大多数只有少量数字文本。AI 在英文和中文上表现优异,对小语种却常常无能为力。低资源语言处理是 AI 普惠的关键挑战。 低资源语言的困境本质上是一个公平问题:互联网...
大模型如何重塑 NLP 任务-子比笔记

大模型如何重塑 NLP 任务

在 BERT 之前,NLP 有几十个专门任务、专门模型:分词、词性、句法、NER、分类、摘要……每个都要单独训。大模型把这一切统一成“预训练 + 提示”,整个领域的结构被彻底重写。 这是技术史上最...
对话系统:聊天机器人的进化之路-子比笔记

对话系统:聊天机器人的进化之路

对话系统分两类:任务型(订机票、查天气)与开放域(闲聊)。任务型讲究准确完成目标,开放域讲究自然有趣。大模型的出现让两者的边界开始模糊。 对话系统最深的挑战是“上下文”:人说一句话...
实体消歧:一个词可以指很多人-子比笔记

实体消歧:一个词可以指很多人

实体消歧判断文本里的实体指哪一个:说“苹果”,是水果还是公司?它依赖于上下文、领域知识与常识,是知识图谱与信息抽取的关键难点。 实体消歧的困难暴露了语言的一个本质属性:词汇是有限的...
指代消解:读懂代词背后的指代-子比笔记

指代消解:读懂代词背后的指代

指代消解判断代词指向谁:“小王给了小李一本书,他很开心”,这个“他”是谁?人类凭语感能判断,机器要经过专门的建模。它是篇章理解的基础能力。 指代消解看似是个小问题,实则触及语言的核...
语料库:NLP 研究的数据基石-子比笔记

语料库:NLP 研究的数据基石

语料库是按特定标准收集的语言数据集合:维基百科语料、新闻语料、对话语料。没有大规模语料库,就没有统计 NLP 与深度学习 NLP 的今天。 语料库是语言学的“实验室”:关于语言的一切假设,都...
admin的头像-子比笔记admin9小时前
0349
依存句法分析:找出句子的“骨架”-子比笔记

依存句法分析:找出句子的“骨架”

依存句法分析找出句子中词与词的修饰与被修饰关系,画出句子的“依存树”。主谓宾、定状补,机器用图结构表示它们,进而理解句子的深层结构。 依存树的美在于它揭示了语言的层级性:一句话不是...
Word2Vec:词向量的开山之作-子比笔记

Word2Vec:词向量的开山之作

Word2Vec 把每个词训练成一个低维向量,语义相近的词在向量空间里彼此靠近。它让“计算机理解语义”第一次变成了可计算的几何问题,是 NLP 进入深度学习时代的里程碑。 Word2Vec 最深远的贡献不...
admin的头像-子比笔记admin9小时前
02015
GloVe:基于共现矩阵的词向量-子比笔记

GloVe:基于共现矩阵的词向量

GloVe 从全局词共现统计出发训练词向量,与 Word2Vec 的局部上下文思路互补。它曾是词向量的另一主流方案,在多项任务上与 Word2Vec 各有胜负。 Word2Vec 与 GloVe 的对比很像两种学习方式:一...
admin的头像-子比笔记admin9小时前
0456
TF-IDF:最朴素也最有效的关键词算法-子比笔记

TF-IDF:最朴素也最有效的关键词算法

TF-IDF 用“词频 × 逆文档频率”衡量一个词对某篇文档的重要性:在本文出现得多(TF 高)、但在别的文档里少见(IDF 高),就是关键词。简单到不可思议,至今仍是文本分析的基石。 TF-IDF 的美...
admin的头像-子比笔记admin9小时前
0279