机器翻译:打破语言巴别塔
机器翻译跨越语言障碍,让不同语言的人自由交流。从早期基于规则的蹩脚翻译,到神经网络的流畅自然,再到大模型的信达雅,它可能是 AI 造福人类最直接的应用。 机器翻译最动人的愿景是打破巴别...
问答系统:从 FAQ 到 ChatGPT
问答系统让用户用自然语言提问、机器给出答案。从早期死板的 FAQ 库,到知识图谱问答,到基于 RAG 的文档问答,再到大模型的自由问答,它经历了四次范式跃迁。 问答系统的发展史,其实是人类与...
信息抽取:从文本里“淘金”
信息抽取从非结构化文本中提取结构化知识:实体、关系、事件。它是构建知识图谱、做商业情报分析、支撑问答系统的底层技术。 信息抽取的本质是“把文字变成数据”。人类世界的大部分知识藏在文...
知识图谱:AI 的结构化记忆
知识图谱用“实体-关系-实体”的三元组结构化存储世界知识。刘德华→配偶→朱丽倩,北京→首都→中国。它让机器能做逻辑推理,是搜索、推荐、问答背后的知识底座。 知识图谱的价值在于“连接”...
对话系统:聊天机器人的进化之路
对话系统分两类:任务型(订机票、查天气)与开放域(闲聊)。任务型讲究准确完成目标,开放域讲究自然有趣。大模型的出现让两者的边界开始模糊。 对话系统最深的挑战是“上下文”:人说一句话...
实体消歧:一个词可以指很多人
实体消歧判断文本里的实体指哪一个:说“苹果”,是水果还是公司?它依赖于上下文、领域知识与常识,是知识图谱与信息抽取的关键难点。 实体消歧的困难暴露了语言的一个本质属性:词汇是有限的...
指代消解:读懂代词背后的指代
指代消解判断代词指向谁:“小王给了小李一本书,他很开心”,这个“他”是谁?人类凭语感能判断,机器要经过专门的建模。它是篇章理解的基础能力。 指代消解看似是个小问题,实则触及语言的核...
语料库:NLP 研究的数据基石
语料库是按特定标准收集的语言数据集合:维基百科语料、新闻语料、对话语料。没有大规模语料库,就没有统计 NLP 与深度学习 NLP 的今天。 语料库是语言学的“实验室”:关于语言的一切假设,都...
什么是自然语言处理:教机器读懂人类语言
自然语言处理(NLP)是让机器理解、生成人类语言的技术。从搜索引擎到翻译软件到 ChatGPT,它早已无处不在,是连接人与机器最自然的桥梁。 语言是人类最独特的发明,也是 AI 最难征服的领域。它...
中文分词:比英文难十倍的第一步
英文单词间有空格天然分隔,中文则连成一片,必须先切词。“乒乓球拍卖完了”可以切出完全不同的意思。中文分词是中文 NLP 的第一道门槛,也是绕不开的基础。 中文分词的困难源于一个根本事实:...
词性标注:判断每个词的“身份”
词性标注给每个词打上名词、动词、形容词等标签。“我要报名”里的“报名”是动词,“那个报名的人”里是修饰语。它是句法分析、信息提取的基础环节。 词性标注展示了一个有趣现象:语言中几乎...
命名实体识别:找出文本里的“关键角色”
命名实体识别(NER)从文本中挑出人名、地名、机构名、时间等关键实体。它是信息抽取、知识图谱构建、搜索引擎理解查询的基础,几乎每个文本系统都用得到。 NER 的价值在于“让文本可计算”。一...













