问答系统:从 FAQ 到 ChatGPT
问答系统让用户用自然语言提问、机器给出答案。从早期死板的 FAQ 库,到知识图谱问答,到基于 RAG 的文档问答,再到大模型的自由问答,它经历了四次范式跃迁。 问答系统的发展史,其实是人类与...
知识图谱:AI 的结构化记忆
知识图谱用“实体-关系-实体”的三元组结构化存储世界知识。刘德华→配偶→朱丽倩,北京→首都→中国。它让机器能做逻辑推理,是搜索、推荐、问答背后的知识底座。 知识图谱的价值在于“连接”...
对话系统:聊天机器人的进化之路
对话系统分两类:任务型(订机票、查天气)与开放域(闲聊)。任务型讲究准确完成目标,开放域讲究自然有趣。大模型的出现让两者的边界开始模糊。 对话系统最深的挑战是“上下文”:人说一句话...
实体消歧:一个词可以指很多人
实体消歧判断文本里的实体指哪一个:说“苹果”,是水果还是公司?它依赖于上下文、领域知识与常识,是知识图谱与信息抽取的关键难点。 实体消歧的困难暴露了语言的一个本质属性:词汇是有限的...
指代消解:读懂代词背后的指代
指代消解判断代词指向谁:“小王给了小李一本书,他很开心”,这个“他”是谁?人类凭语感能判断,机器要经过专门的建模。它是篇章理解的基础能力。 指代消解看似是个小问题,实则触及语言的核...
语料库:NLP 研究的数据基石
语料库是按特定标准收集的语言数据集合:维基百科语料、新闻语料、对话语料。没有大规模语料库,就没有统计 NLP 与深度学习 NLP 的今天。 语料库是语言学的“实验室”:关于语言的一切假设,都...
词性标注:判断每个词的“身份”
词性标注给每个词打上名词、动词、形容词等标签。“我要报名”里的“报名”是动词,“那个报名的人”里是修饰语。它是句法分析、信息提取的基础环节。 词性标注展示了一个有趣现象:语言中几乎...
什么是自然语言处理:教机器读懂人类语言
自然语言处理(NLP)是让机器理解、生成人类语言的技术。从搜索引擎到翻译软件到 ChatGPT,它早已无处不在,是连接人与机器最自然的桥梁。 语言是人类最独特的发明,也是 AI 最难征服的领域。它...
中文分词:比英文难十倍的第一步
英文单词间有空格天然分隔,中文则连成一片,必须先切词。“乒乓球拍卖完了”可以切出完全不同的意思。中文分词是中文 NLP 的第一道门槛,也是绕不开的基础。 中文分词的困难源于一个根本事实:...
语言模型的概率:它真在“想”吗
语言模型的本质是:给定上文,输出下一个 token 的概率分布。它不“思考”,只是基于训练数据中的统计规律做高概率的续写。理解这一点,是理解它所有优点与缺点的钥匙。 接受“AI 是概率机器”...
BERT:理解语言的一代宗师
BERT 是 Google 2018 年推出的双向语言模型,通过掩码预训练让模型深度理解文本语义。它统治了自然语言理解任务三年,是 Transformer 编码器路线的巅峰之作。 BERT 与 GPT 代表了两种哲学:BERT...












