多语言能力:大模型不只是英语模型
大模型的多语言能力极不均衡:英语最好,中文次之,小语种常常一塌糊涂。这不只是数据问题,也关乎 tokenizer 设计与训练资源分配。 多语言问题是 AI 公平性的一个具体侧面:英语世界的人用着更...
低资源语言处理:AI 的普惠难题
世界上有 7000 多种语言,大多数只有少量数字文本。AI 在英文和中文上表现优异,对小语种却常常无能为力。低资源语言处理是 AI 普惠的关键挑战。 低资源语言的困境本质上是一个公平问题:互联网...
大模型如何重塑 NLP 任务
在 BERT 之前,NLP 有几十个专门任务、专门模型:分词、词性、句法、NER、分类、摘要……每个都要单独训。大模型把这一切统一成“预训练 + 提示”,整个领域的结构被彻底重写。 这是技术史上最...
TF-IDF:最朴素也最有效的关键词算法
TF-IDF 用“词频 × 逆文档频率”衡量一个词对某篇文档的重要性:在本文出现得多(TF 高)、但在别的文档里少见(IDF 高),就是关键词。简单到不可思议,至今仍是文本分析的基石。 TF-IDF 的美...
文本分类:把文章放进对的抽屉
文本分类给文档打标签:垃圾邮件识别、新闻分类、情感判断、意图识别。它是 NLP 最基础也应用最广的任务,几乎所有文本系统都从分类开始。 文本分类教会我们一个朴素的道理:分类是一切认知的起...
情感分析:读懂文字背后的情绪
情感分析判断文本是正面、负面还是中性,广泛用于舆情监测、商品评价、品牌分析。它让企业第一次能“量化”用户的情绪。 情感分析最深刻的挑战在于:人类的情感表达充满言外之意。“你可真行”...
文本相似度:判断两段话是不是一回事
文本相似度计算两段文本在语义上有多接近。查重、搜索、推荐、客服路由,都建立在它之上。从字面匹配到语义匹配,是 NLP 进化的主线之一。 “相似”这个概念远比想象中复杂:王之涣的《登鹳雀楼...
文本摘要:让机器学会“划重点”
文本摘要让机器把长文压缩成短文,抽取式从原文挑关键句,生成式则用自己的话重写。在信息过载的时代,它是每个人都需要的能力。 摘要能力其实是人类的高级认知技能:它要求在理解全文的基础上...
机器翻译:打破语言巴别塔
机器翻译跨越语言障碍,让不同语言的人自由交流。从早期基于规则的蹩脚翻译,到神经网络的流畅自然,再到大模型的信达雅,它可能是 AI 造福人类最直接的应用。 机器翻译最动人的愿景是打破巴别...
问答系统:从 FAQ 到 ChatGPT
问答系统让用户用自然语言提问、机器给出答案。从早期死板的 FAQ 库,到知识图谱问答,到基于 RAG 的文档问答,再到大模型的自由问答,它经历了四次范式跃迁。 问答系统的发展史,其实是人类与...
知识图谱:AI 的结构化记忆
知识图谱用“实体-关系-实体”的三元组结构化存储世界知识。刘德华→配偶→朱丽倩,北京→首都→中国。它让机器能做逻辑推理,是搜索、推荐、问答背后的知识底座。 知识图谱的价值在于“连接”...
对话系统:聊天机器人的进化之路
对话系统分两类:任务型(订机票、查天气)与开放域(闲聊)。任务型讲究准确完成目标,开放域讲究自然有趣。大模型的出现让两者的边界开始模糊。 对话系统最深的挑战是“上下文”:人说一句话...












