用 TutorFlow 制作的示例视频

大语言模型的工作原理

文字稿

我们借助几幅简单的画面,一起来拆解大语言模型。你可以把它看成一个系统,一遍又一遍地预测下一个词。

首先,模型会阅读海量的文本。这样的训练让它发现各种规律,比如词语通常怎样搭配在一起。

想象一个超大的自动补全工具,对各种规律记得特别牢。它不是去查词典,而是估算接下来最可能出现什么。

模型内部有一层层的数学运算,会把词语变成数字。靠这些数字,它能比较不同的概念,把相关的意思联系起来。

你输入提示词后,模型会先看它周围的上下文,再给许多可能的下一个词打分,从中选出一个。

它会不断重复这一步,每次生成一个词元,直到回答完整为止。所以输出是一个词一个词构建出来的,而不是查出来的。

说到底,核心道理很简单:语言模型学习规律,结合上下文,预测接下来的文字。正因为这样,它说起话来才会像人一样,自然得让人惊讶。