先说结论

大语言模型不是先在数据库里找出完整答案,而是把输入转换为 token,在多层神经网络中计算上下文关系,再按概率逐个生成后续 token。训练让它学到语言与知识模式,但不自动保证每句话都真实。

第一步:文本变成 Token

模型不能直接读取句子。分词器会把文本切成 token,再把每个 token 映射成数字向量。同一个词在不同模型中可能有不同切法;中文字符、标点、英文和代码的切分方式也不完全相同。

向量不是字典定义,而是一组在训练中学到的数值表示。它让模型可以计算哪些表达在特定上下文中更相关。

第二步:注意力计算上下文关系

Transformer 的核心机制之一是注意力。生成当前位置时,模型会对上下文中不同 token 赋予不同权重。例如处理代词时,前文的人名可能比相邻的标点更重要。

注意力并不是人类意义上的理解或意识,而是一种计算关系的机制。2017 年的 Transformer 论文展示了基于注意力机制、无需传统循环结构的序列建模架构,后来成为许多大语言模型的基础。

第三步:预测下一个 Token

  1. 01

    读取已有上下文

    包括系统规则、你的问题、对话历史和模型已经生成的内容。

  2. 02

    计算候选概率

    模型为可能的下一个 token 计算概率分布,不是只查一个固定答案。

  3. 03

    选择并继续

    选出一个 token 后加入上下文,再重复计算,直到完成或达到限制。

这解释了哪些现象

  • 同一问题多次回答可能不同,因为生成过程可以带有采样
  • 提供清晰上下文能改变后续 token 的概率分布
  • 模型能写出格式正确但事实错误的内容,因为语言连贯性不等于外部验证
  • 对话太长时,早期细节可能因上下文限制或注意力分配而被忽略
常见问题

你可能还想问

大语言模型就是搜索引擎吗?

不是。搜索引擎主要检索已有页面,语言模型主要生成文本。某些产品会把检索和模型结合,但两部分仍有不同职责。

模型参数里是不是存着整篇文章?

参数学习的是复杂统计模式,不能简单理解为按原样存放的文档数据库。特定内容仍可能被记忆或复现,因此版权与隐私问题不能忽略。

注意力越高就代表模型越懂吗?

不能这样直接推断。注意力权重是内部计算的一部分,不等同于可靠的人类式解释。

参考资料

本文为面向普通使用者的解释与操作建议。关键概念参考以下一手资料:

  1. Vaswani 等《Attention Is All You Need》Transformer 架构的一手论文资料。
  2. NIST《生成式人工智能风险管理框架》用于核对生成式 AI 的虚构、隐私与风险管理表述。