用 TutorFlow 製作的範例影片

大型語言模型如何運作

逐字稿

我們用幾個簡單的畫面,來拆解大型語言模型。你可以把它想成一套系統,一次又一次地預測下一個詞。

首先,模型會讀進大量的文字。這樣的訓練讓它察覺其中的模式,例如詞語通常怎麼搭配在一起。

想像一個超大型的自動完成功能,對各種模式記得特別清楚。它不是在查字典,而是在推估接下來會出現什麼。

模型內部有一層又一層的數學運算,會把文字轉換成數字。靠著這些數字,它能比較不同的概念,並把意思相關的內容連結起來。

當你輸入提示詞,模型會先看看它周圍的上下文。接著替許多可能的下一個詞打分數,再從中選出一個。

它會重複這個步驟,一次產生一個 token,直到回覆完整為止。所以輸出是一個詞一個詞組出來的,而不是從哪裡找出來的。

核心觀念其實很簡單。語言模型會學習模式、運用上下文,再預測下一段文字。正因如此,它說起話來才會像人一樣自然,自然到讓人驚訝。