深学 DeepLearn纯静态学习平台 · 借鉴 DeepTutor

1. 大模型是如何工作的

从 Token、下一个词预测到上下文窗口,建立对大语言模型(LLM)的正确直觉。

约 9 分钟3 道测验 6 张抽认卡

从「文字接龙」说起

大语言模型(LLM)的本职工作只有一件事:根据已有文字,预测下一个 Token 出现的概率。给它「今天天气真」,它会算出「好」出现的概率远高于「椅子」。生成一整段回答,就是不断重复「预测 → 采样 → 拼接 → 再预测」的接龙过程。

一切从 Token 开始

模型并不直接认识汉字或单词,它处理的是 Token(词元)——把文本切分后的最小单位。一个英文单词可能是 1 个 Token,一个汉字通常是 1~2 个 Token。

我爱学习  →  [我] [爱] [学习]     → 每个 Token 变成一串数字(向量)再进入模型

模型的「上下文窗口」限制了它能同时处理的 Token 总数——可以理解为工作台的面积,桌面上放不下的资料,模型根本看不到。

预测不是背诵

训练时,模型读入海量文本,学习「给定前文,哪个 Token 最该出现」的统计规律;使用时,它按概率分布采样出下一个 Token。

temperature(温度) 控制采样的随机程度:

  • 温度低 → 总是选概率最高的词 → 输出稳定、适合写代码
  • 温度高 → 更愿意选冷门词 → 输出多样、适合头脑风暴,但更容易跑偏

上下文窗口与幻觉

两个新手最容易误解的现象:

  1. 遗忘:对话超过窗口长度,最早的内容就「出界」了,模型并不存在一个会自动扩容的硬盘。
  2. 幻觉:模型按概率接词,而不是查证事实,所以会一本正经地编造不存在的引用和数据。知识库检索(RAG)正是针对这个问题的解药——下一章见。

💡 直觉公式:LLM = Transformer 架构 + 海量训练数据 + 下一词预测目标。理解了这个接龙游戏的本质,很多「玄学」现象都能解释了。

✍️章节测验(3 题)

选好后点击提交,成绩会记录到数据库,帮你追踪掌握情况。

  1. 1. 大语言模型生成文本时,本质上在做一件什么事?

  2. 2. 把 temperature(温度)参数调高,模型的输出会怎样?

  3. 3. 当对话内容超过模型的上下文窗口时,会发生什么?

进度加载中…