看完文章後我有跟我的chatgpt , claude聊一下
大家記得幾20幾年前 裘德洛?演的電影 AI 人工智慧那時候有發布一個聊天網頁
那時候就覺得很新奇 但那是人工寫死的規則庫,再怎麼升級也就是規則多一點
但現在這個LLM 是餵了足夠多資料之後 自己長出了設計者沒寫進去的能力
AI comment:
1:GPU 不是為 AI 發明的。 它本來是圖形運算,後來大家發現大量平行乘加運算剛好
非常適合神經網路。
2:Transformer/LLM 也不是原本只想做假聊天機器人。 到 GPT 時代,研究者本來就希望
language model 能學到一般性的語言與知識能力。
3:真正超乎很多研究者預期的,是:同一套「預測下一個 token」的訓練目標,
在模型、資料、算力一直 scaling 之後,竟然長出了 coding、數學、工具使用、
跨領域推理、agent 規劃,甚至協助 AI 研究本身的能力。
科學家知道它「怎麼算」——矩陣乘法、attention、gradient descent、weight
都清楚
但科學家還不能完整回答:「為什麼幾兆個參數經過這種訓練後,
內部會自發組織出這些高階能力?」更做不到對每個複雜行為都精確預測。
這是 **mechanistic interpretability(機制可解釋性)**仍然沒有完全解決的問題。
而現在更恐怖的是,
AI 又開始拿來幫忙寫 code、做研究、開發下一代 AI。
所以簡單來講
人類不是意外發明了自己完全不懂的黑魔法,而是發明了一套數學與訓練方法,底層每一
步都懂;
但把它 scale 到今天這個程度後,系統整體呈現出的高階能力、泛化能力和自
主行為,超出了早期很多人的預期,而且我們對其內部形成機制的理解,
已經落後於它的能力增長速度。