一题一页 · 技术方法 · 也叫 大模型、LLM

AI 的回答是怎么写出来的?它在「想」吗?

读过海量文字后学会「接着往下写」的模型。你输入一段话,它算出下一个词最可能是什么,一个词一个词地生成回答。

先看懂

技术方法
大语言模型(LLM)
只会「接着往下写」的模型
模型本身不上网、不操作、不存状态

此刻在看:静态解释,这一页的 4 个部分都是这一种。

主张依据 2 类:公开报道与实践记录、编辑解释。

核实状态:这一页没有需要核实的结论,所以这一维是空的。

三个维度分别看:演示方式、主张依据、核实状态

演示方式

表示此刻展示方式,不是准确性等级。

  • 顶部三秒卡 静态解释
  • 举例与能/不能三栏 静态解释
  • 别和这几个搞混 静态解释
  • 展开后的正文 静态解释

主张依据

可多选,每种都有实际引用;「本站实验」需有记录。

  • 公开报道与实践记录 Introducing ChatGPT
    这一页挂的唯一一条外部来源是 ChatGPT 的发布公告,它支持的是本页指向那件事的关系(这类模型此前已存在,是它让大众第一次直接用上);两段正文的解释没有一句引自它。
  • 编辑解释
    本站自己写的,没有外部引用。
    「只会接着往下写的模型」与「模型本身不上网、不操作、不存状态」是本站为三秒卡写的说法。
    「今天天气很好,我们去」那个例子与「它能」「它不能」六条,是本站按这类模型的通行用法写的界定,没有引任何一份材料。
    与智能体的那条区别是本站写的对照。
    「它只做一件事」「这解释了很多现象」两段是本站的解释。这一页没有结构关系可显示。

核实状态

附范围、时间及必要原因,不等于全页绝对正确。

这一页没有需要核实的结论,所以这一维是空的——不会因为它挂着论文就替它标一个「已核对」。

举个例子

你输入「今天天气很好,我们去」,它算出后面最可能是「公园」「爬山」之类的词,选一个接上,再算下一个。

它能
  • 生成通顺的文字,按要求改写、总结、翻译
  • 在生成的文字里写出「请调用某个工具」这样的请求
  • 在给定的资料范围内回答问题
它不能 / 不是
  • 自己不能执行任何操作:不能上网、不能读你的文件、不能发消息
  • 模型这一侧不保存上一轮的状态;产品里的「记得」来自程序把之前的内容再送进来,或者另存了摘要
  • 不保证说的是事实,通顺不等于正确

别和这几个搞混

想看细节再点开

它只做一件事

它的生成过程可以归结为一件事:给定前面的文字,算下一个词。回答一个问题,就是把这一步重复到抽中结束记号为止;重复多少次取决于回答多长,几十到几千次都有。

这解释了很多现象

它为什么会一本正经地说错话:因为它算的是在这个上下文里分数最高的下一个词,分数高低和事实对不对是两回事。它为什么「忘了」你上一轮说的:因为模型这一侧不保存状态,是程序每次把之前的对话再送进去。它为什么能「调用工具」:因为程序约定好了,只要它写出某种格式的文字,程序就去执行。

理解了这一件事,后面的大部分新词都能看懂了。

谁指向了这个词

  • ← 容易和……混淆AGI(通用人工智能)模型是具体的东西,AGI 是对能力的要求
  • ← 运行时依赖AI 智能体(Agent)每一步的判断由模型生成
  • ← 容易和……混淆AI 智能体(Agent)模型只会写字;智能体是模型加上一个会执行的程序
  • ← 是……的组成部分KV 缓存它是模型生成过程中的一块临时数据,不是模型的一部分
  • ← 是……的组成部分混合专家(MoE)它是大模型内部的一种结构,不是另一类模型
  • ← 运行时依赖OpenClaw理解你的指令、生成回复,靠的是接入的模型

看它发生

教学脚本 约 2 分钟
AI 的回答是怎么写出来的?它在「想」吗?
每一步只算下一个候选
前面的字 模型打分 程序抽一个 接上,再来 每出一个 token(不一定是一个汉字),都按前面已有的内容重新打分
教学简化模型:场景按编辑写好的剧本逐屏播放;这里只摆了六个候选词,真实模型要在几万个 token 上做同一步归一化候选词和百分比是编的,用来示意;真实模型的候选是几万个「token」,不一定是一个汉字
你看到的
还没有字
幕后:每一步的候选词
还没开始算
你输入了半句话。
第 1 步 / 5

按暂停会把这一步的文字整段显示出来。这段字本来就是预先写好的,逐字出现只是展示方式,不是模型正在生成。 键盘:焦点在这个实验里时,← → 切换步骤,空格 播放或暂停。

拖一下

拖动温度,看候选词怎么变

同样一句「今天天气很好,我们去」,只改这一个旋钮,看每个词被选中的机会怎么重新分配。

分数是编的,用来演示。这里算的是 p = softmax(分数 ÷ 温度), 分母只有上面这 6 个候选词——真实模型要在几万个 token 上做同一步归一化, 所以同一个词在这里的百分比比在场景那一屏上大:场景那两屏的分母是整个词表, 这个旋钮的分母是这 6 个。两处不是同一个分母,不能互相替代。 「有效候选数」= exp(这一步分布的香农熵,以 e 为底),单位是「个」, 读作「相当于有几个候选在均匀竞争」,不是真实候选个数,最大就是 6。

此刻在看:浏览器计算 + 教学脚本——2 个部分各自标着自己的那一种,没有一个徽章能概括整页。

主张依据 2 类:公开报道与实践记录、编辑解释。

部分核对 核实状态:部分核对 · 核于 2026-09-07。

三个维度分别看:演示方式、主张依据、核实状态

演示方式

表示此刻展示方式,不是准确性等级。

  • 分步场景:每一步只算下一个候选 教学脚本
    教学简化模型:场景按编辑写好的剧本逐屏播放;这里只摆了六个候选词,真实模型要在几万个 token 上做同一步归一化
  • 温度旋钮 浏览器计算
    教学简化模型:浏览器当场算的是 p = softmax(分数 ÷ 温度),算的是编辑给定的六个候选词,不是真实模型的整个词表
    「简化」说的是模型简化,这一块此刻仍然在真的算。

主张依据

可多选,每种都有实际引用;「本站实验」需有记录。

  • 公开报道与实践记录 Introducing ChatGPT
    「逐个 token 打分再抽样」这条生成路径按这份公开发布说明核过
  • 编辑解释
    本站自己写的,没有外部引用。
    屏幕上的六个候选词与它们的分数由本站编写,不是某个真实模型的输出
    候选词与它们的分数是编辑给定的教学设定,浏览器按这组设定当场把百分比算出来

核实状态

附范围、时间及必要原因,不等于全页绝对正确。

  • 部分核对
    本站核对这条结论: 核的范围:「逐个 token 打分再抽样」这条生成路径按公开资料核过;页面上的六个候选词与它们的分数是编写的示意,没有对照任何一个真实模型的输出
    「它在算」说的是这一层算法在做什么,不是在裁定它有没有在想——那是另一类问题,这一页没有证据
这个动画没有说的事
  • 候选词和百分比是编的,用来示意;真实模型的候选是几万个「token」,不一定是一个汉字
  • 「抽一个」的随机程度由设置决定,有的产品几乎总选分数最高的
  • 这只解释语言模型的生成过程,不能概括所有 AI
  • 「它在算」说的是这一层算法在做什么,不是在裁定「它有没有在想」——那是另一类问题,本页没有证据
  • 「按前面的内容打分」是依赖关系,不代表实现上每一步都把前面重算一遍;真实系统用 KV 缓存正是为了少重算
这一场戏的说明

这个单元把大模型写一句话的过程拆成五步。看完之后,你应该能说出:它为什么会一本正经地说错话,为什么同一个问题两次答案不一样。

这个实验解释了哪些词

查证据

这一场戏的结论

每一步只是给下一个 token 打分再抽一个;读起来通顺不保证内容属实。

成立条件
  • 候选词和百分比是编写的示意,不是某个真实模型的输出
  • 数的单位是 token,不一定正好是一个汉字
「AI 的回答是怎么写出来的?它在「想」吗?」的完整结论:必要条件、指标口径与已归档的旧结论

看完你应该能说出

模型每一步只做一件事:按前面已有的内容给下一个候选打分,再抽一个接上。它数的单位是 token,不一定是一个汉字;「要用到前文」是这个算法的依赖关系,不等于每一步真把前文重算一遍(KV 缓存省的正是这一步)。读起来通顺不保证内容属实。

成立条件:少一条,上面那句话就不成立
  • 候选词和百分比是编写的示意,不是某个真实模型的输出
  • 数的单位是 token,不一定正好是一个汉字
这条结论的边界
  • 抽样的随机程度由设置决定,有的产品几乎总选分数最高的那一个
  • 这只解释语言模型的生成过程,推广不到别的 AI 系统
核验
部分核对 · 本站核对这条结论: · 核的范围:「逐个 token 打分再抽样」这条生成路径按公开资料核过;页面上的六个候选词与它们的分数是编写的示意,没有对照任何一个真实模型的输出(「它在算」说的是这一层算法在做什么,不是在裁定它有没有在想——那是另一类问题,这一页没有证据)
证据
  • 本站条目 sources/openai-chatgpt-2022

它从哪来

档案目录

  1. 发布或实践记录英文馆藏已关联

    openai-chatgpt-2022

    Introducing ChatGPT

    出版方/保存方
    OpenAI
    原页语言
    英文
    来源发布
    本站访问
    核对程度:没有记录,说不出读到哪一层没有记录具体读到哪一层,因此不能把这条记录当作全文核对。
    访问结果:正常取到

    ChatGPT 发布公告。

    馆内关联藏品《Introducing ChatGPT》
    打开原始来源