自回归生成(Autoregressive Generation)是大语言模型生成文本的基本方式:模型每次只做一件事——根据已有内容预测下一个词(token)。预测出的词被追加到序列末尾,成为下一步预测的输入,如此循环直到生成结束符。
为什么叫“自回归”
统计学术语“回归”指预测数值,“自”指预测的输入包含模型自己此前的输出。即“用自己已经说过的话,预测接下来要说的词”。
特点
- 生成速度与输出长度成正比:越长越慢,且必须逐词串行生成
- 一次一个 token:这是“流式输出”能逐字显示的技术根源
- 错误会累积:前面某个词预测偏了,后面会在错误的轨道上继续
关联技术
推测解码(Speculative Decoding)用小模型先“抢答”多个词、大模型一次性验证,把串行生成并行化;KV 缓存则避免每生成一个词就重算全部历史。
对照
扩散模型(图像/视频生成主力)走的是另一条路——从噪声整体逐步去噪,不是逐块生成。