大语言模型是怎么「学会说话」的
如果你用过 ChatGPT、Claude 或国内的 DeepSeek、通义千问,大概率会感叹:这些东西怎么这么会说话?它们不仅能回答问题,还能写代码、写诗、陪你聊哲学。但「会说话」三个字背后,其实是一套相当精巧的技术栈。这篇文章用尽量通俗的语言,把大语言模型(LLM)「学会说话」的完整链条讲清楚。
一、从「字」到「向量」:Token 的世界
人脑理解文字是一句一句读的,模型却不是。它先把文本切成一个个 Token——可以简单理解为一个「最小语义单元」。一个中文 Token 可能是一个字,也可能是一个词。切好之后,模型会把这些 Token 转成高维向量。向量是模型的「母语」:在向量空间里,意思相近的词,距离也近;语法相近的句子,方向也相似。
这就是为什么模型能「举一反三」:它不是在死记硬背单词,而是在一个连续的空间里理解概念之间的关系。
二、Transformer:注意力机制
2017 年 Google 提出的 Transformer 架构,是大语言模型真正的基石。它最核心的组件叫注意力机制(Attention)。简单说,它让模型在处理一个词时,能够「回头看看」整个句子里哪些词和它关系最密切,并据此调整理解。
想象你在读「苹果咬了一口,很好吃」,你知道「好吃」指的是苹果而不是咬的动作,靠的就是对上下文里「苹果」的关注。注意力机制把这个能力形式化了,而且可以并行计算,效率远高于以前的循环神经网络。
三、预训练:让模型「读万卷书」
有了架构,接下来是喂数据。大模型的训练分两大阶段,第一个叫预训练。工程师把互联网上海量的文本——书籍、网页、论文、代码——喂给模型,任务是让模型预测「下一个 Token」是什么。
听起来很简单,但量变引发质变。当训练数据达到几十 TB、模型参数达到千亿级别时,模型会自发涌现出语法、常识甚至一定的推理能力。它读过的「书」比任何一个人一辈子读的都多,于是它「知道」了很多东西。
四、对齐:让它「懂礼貌、讲道理」
光会预测还不够。一个只做预训练的模型,可能满嘴胡话、答非所问,甚至输出有害内容。所以第二个阶段叫对齐(Alignment),核心方法之一是 RLHF(基于人类反馈的强化学习)。
人类标注员给模型的回答打分,模型学习「什么样的回答是好的」,从而学会遵守指令、拒绝不当请求、保持诚实。这一步让模型从「聪明但桀骜不驯」变成「聪明且听话」。
五、从「原理」到「日常」
理解了这条链路,你会发现:LLM 的强大不是魔法,而是「海量数据 + 精巧架构 + 人类对齐」三者叠加的结果。它也解释了模型的几个典型「毛病」——为什么它会一本正经地胡说八道(幻觉)、为什么它有时答非所问。这些不是 bug,而是这套机制本身的副产品。
下一篇我们会聊一个最实用的主题:RAG,如何让大模型学会「查资料再回答」,大幅缓解幻觉问题。