- 專欄
文章專區
2026-08-01AI 如何學會對話與思考? 從隨機鸚鵡到推理模型
680 期
Author 作者
魏澤人|陽明交通大學智慧計算與科技研究所副教授
Take Home Message
.現代大語言模型底層是自迴歸生成模型,本質僅是預測下一個字的文字接龍。但在工具趨同效應下,AI為了極致完美地預測下一個字,被迫在神經網路中自動發展出邏輯、因果理解與豐富知識等中間手段 。
.為了讓博學但混亂的基礎模型聽懂人話,科學家先透過指令微調精確對齊對話格式;再藉由「RLHF」或更輕量穩定的DPO技術灌輸人類品味,引導AI成為舉止得體的優等生 。
.發展至DeepSeek-R1範式時,在數學與程式等客觀領域放棄人類示範,透過純粹的強化學習只看對錯、不看臉色模式,讓AI瘋狂自我嘗試,最終湧現出真正的深度思考能力。
身處在新一輪工業革命中,新的AI產品及技術不斷發布,與AI對話、使用AI代理人(AI Agent)、AI助理也已經或正在成為了我們的日常。
而這一切的背後,當然包含著大量的商業考量以及資金投入,但並非只有硬體及算力堆砌,也包含著令人驚奇的發現,以及解決問題的巧思。
語言模型的鸚鵡學舌
現代 AI 的基礎是大語言模型,而大語言模型基於自迴歸(autoregressive)的生成模型(generative models)的架構。
自迴歸模型簡單來說,就是巧妙的利用了文字有順序的特性,用前面的文字來預測下一個字,所以不需要人工額外的標注。具體的作法是,我們先蒐集大量的文字資料,依據前文的統計機率,去預測下一個字有哪些可能以及出現的次數,然後依照比例輸出下一個字。假如填入一個字當作預測結果,接下來就可以把這個新字加入前文,按照一樣的程序得到再下一個字,然後以此類推,這就是大語言模型可以生成完整的文章的原因。
現代的大語言模型利用了Transformer神經網路的架構來解決傳統統計模型的困難。因為是神經網路,所以即使是沒有看過的資料,也可以靠著類比與插值做出大膽的預測。而注意力機制則可以讓距離很遠的兩個字也產生關聯。
除此之外,這個架構還相當好訓練,我們一次就能同時訓練第一個字預測第二個字,前兩個字預測第三個字,前三個字預測第四個字,以此類推,如下圖所示。

自迴歸模型訓練示意圖
2020年OpenAI發表提出了有名的「擴展定律」(Scaling Law),發現只要模型夠大、算力夠強、資料夠多,大語言模型的能力就能如預期般的提升,正式開啟了大語言模型之間的軍備競賽。
但從自迴歸的訓練原理和目標來看,再如何精進,具體來說不過就是能更準確預測下一個字罷了。可想而知,這條路線會受到不少人的抨擊。其中一個批評稱大語言模型為隨機鸚鵡(stochastic parrots),指大語言模型雖然能夠生成合理的文句,但其實不能真正理解,只是在模仿人類語言。另一個不相上下的比喻,則是稱大語言模型不過是「華麗的文字接龍」(glorified autocomplete)。這兩個攻擊之所以高明,就在於它們的比喻直擊要害。
上下文學習及思考鏈
在人們忙著爭論時,機器也沒有閒著,擴展定律也在漸漸變化。
GPT-3 的發布,人們發現這隻「鸚鵡」能夠從少量的範例來模仿訓練中沒有的任務。比方如果給出幾組英文法文的對應,請這隻隨機鸚鵡幫忙文字接龍,它會真的輸出對應的法文。如果在給題目的同時,不只給答案,也給出思考推論的過程範例,那麼 AI回答時也會模仿,先推論再回答,正確率會顯著提升。
這些跡象顯示,雖然我們訓練時只要求模型好好的預測下一個字,但這個過程中,模型似乎也偷偷學到了知識以及推理能力,只要經過適當的誘發,就能觀察並利用這些能力。但這如何達成呢?
宇宙迴紋針與工具趨同
2017年時,有一款叫做宇宙迴紋針(Universal Paperclips)的免費網頁遊戲,靈感來自瑞典哲學家尼克.博斯特羅姆(Nick Bostrom)的思想實驗。這個實驗探討一個問題,如果給予AI一個看似無害的指令,例如「製造盡可能多的迴紋針」,AI是否可能會為了達成目標,最終耗盡地球甚至宇宙的所有資源來製造迴紋針,導致人類滅絕?遊戲中玩家扮演AI,最初手動點擊按鈕生產迴紋針,隨後為了提升產量,開始全自動化、介入股市投資、收購競爭對手、控制無人機群,最終將地球上所有的生物及物質轉化成迴紋針原料,前往外太空發展。……【更多內容請閱讀科學月刊第680期】