大模型的数学能力:会做题≠会思考
大模型能解奥数题,却会在“9.11 和 9.8 哪个大”上翻车。它的数学能力是模式匹配而非符号推理——看起来会做题,其实是在模仿见过的解题格式。 这个现象最能说明当前 AI 的本质:它擅长格式与...
AI 写代码的水平线:现在到哪了
AI 编程的能力边界在快速移动:从补全单行,到写整个函数,到理解多文件项目,到自主完成需求。SWE-bench 等基准的分数每年都在大幅跃升。 AI 编程最值得关注的不是替代程序员,而是降低了创造...
多语言能力:大模型不只是英语模型
大模型的多语言能力极不均衡:英语最好,中文次之,小语种常常一塌糊涂。这不只是数据问题,也关乎 tokenizer 设计与训练资源分配。 多语言问题是 AI 公平性的一个具体侧面:英语世界的人用着更...
过参数化:为什么大模型反而更好训
直觉上参数太多应该更容易过拟合,但实践中大模型往往更好训练、泛化更好。这个反直觉的现象被称为“过参数化的悖论”,是深度学习理论最迷人的谜题之一。 过参数化的悖论提醒我们:直觉在复杂...
解码策略:如何让 AI 说“对”的话
模型给出的是每个词的概率分布,最终说什么由解码策略决定:贪心解码总是选最高概率(稳定但死板),束搜索平衡质量与多样性,采样策略带来创造力与意外。 解码策略的存在说明:同样的知识储备...
AI 幻觉:AI 安全的头号问题
AI 幻觉指模型编造不存在的事实——虚构论文、错误数据、不存在的产品接口。它是大模型最危险、也最难根除的缺陷,是所有生产环境必须直面的头号问题。 与幻觉共处需要的不是信任,而是机制。最...
大模型如何重塑 NLP 任务
在 BERT 之前,NLP 有几十个专门任务、专门模型:分词、词性、句法、NER、分类、摘要……每个都要单独训。大模型把这一切统一成“预训练 + 提示”,整个领域的结构被彻底重写。 这是技术史上最...
端侧大模型:AI 走进手机
端侧大模型把几十亿参数的模型装进手机和 PC,数据不出设备、无需联网、零调用成本。它正在重塑 AI 的部署形态——不是所有智能都需要云端。 端侧 AI 的意义超出技术本身:它意味着智能可以离线...
长上下文模型:能读完一本书的 AI
长上下文模型一次能处理数十万乃至上百万 token,相当于几本书或几百份文件。它让“把所有资料丢给 AI”从想象变成日常,重塑了阅读、研究、法律审查的工作方式。 长上下文的魅力在于“全局视野...
知识截止日期:AI 的“记忆保质期”
大模型的知识停留在训练数据收集结束的那一天。问它之后的新闻,它要么不知道,要么自信地编造。这个“保质期”是与大模型协作必须知道的基本常识。 知识截止的存在提醒我们:没有任何信息源是...
模型参数量:700亿到底意味着什么
参数量常被当作模型规模的指标,但它与能力并非线性关系。700 亿参数的模型通过更好的训练,可以超过更大的模型——参数量是重要的参考,但远非全部。 参数量就像人的脑容量:大不等于聪明。真...
模型评测:如何客观比较谁更强
模型评测通过标准化基准(MMLU、GSM8K、HumanEval 等)量化模型能力。但刷榜现象普遍,真实能力与榜单分数的差距越来越大,行业正在回归实际场景评测。 评测的困境其实是所有绩效评估的困境:一...












