从「文字接龙」说起
大语言模型(LLM)的本职工作只有一件事:根据已有文字,预测下一个 Token 出现的概率。给它「今天天气真」,它会算出「好」出现的概率远高于「椅子」。生成一整段回答,就是不断重复「预测 → 采样 → 拼接 → 再预测」的接龙过程。
一切从 Token 开始
模型并不直接认识汉字或单词,它处理的是 Token(词元)——把文本切分后的最小单位。一个英文单词可能是 1 个 Token,一个汉字通常是 1~2 个 Token。
我爱学习 → [我] [爱] [学习] → 每个 Token 变成一串数字(向量)再进入模型
模型的「上下文窗口」限制了它能同时处理的 Token 总数——可以理解为工作台的面积,桌面上放不下的资料,模型根本看不到。
预测不是背诵
训练时,模型读入海量文本,学习「给定前文,哪个 Token 最该出现」的统计规律;使用时,它按概率分布采样出下一个 Token。
temperature(温度) 控制采样的随机程度:
- 温度低 → 总是选概率最高的词 → 输出稳定、适合写代码
- 温度高 → 更愿意选冷门词 → 输出多样、适合头脑风暴,但更容易跑偏
上下文窗口与幻觉
两个新手最容易误解的现象:
- 遗忘:对话超过窗口长度,最早的内容就「出界」了,模型并不存在一个会自动扩容的硬盘。
- 幻觉:模型按概率接词,而不是查证事实,所以会一本正经地编造不存在的引用和数据。知识库检索(RAG)正是针对这个问题的解药——下一章见。
💡 直觉公式:LLM = Transformer 架构 + 海量训练数据 + 下一词预测目标。理解了这个接龙游戏的本质,很多「玄学」现象都能解释了。