Re: [爆卦] Claude抄襲中國AI

作者: sxy67230 (charlesgg)   2026-07-23 10:24:00
餓死抬頭,阿肥外商碼農阿肥啦!
剛好今天早上有空就說一下,其實蒸餾就是美國一堆矽谷公司老闆為了盡可能壟斷市場的話
術。
如果真的在機器學習領域內,從數學上不管SFT (監督微調)、RL (強化學習)、KD (知識
蒸餾)本質上都是同一件事,目標就是分佈逼近。手段有用Forward KL、Reversed KL,For
ward KL白話說就是填鴨式學習讓模型死記目標數據,Reversed KL則是由模型自己演出目標
數據僅擔任指導的角色告訴他們哪裡有錯。
Forward KL的代表範式就是SFT、經典的知識蒸餾,Reversed KL就是RL跟改良後知識蒸餾,
目標數據可以是人類數據或其他甚至是自己模型本身。如果你理解知識蒸餾的本質就知道用
抄襲來說嘴蒸餾是沒什麼意義不現實的事情,蒸餾其實本質跟經典的機器學習理論一樣就是
壓縮數據到模型的高維分佈中,跟人類的學習模式沒什麼區別,只是機器的學習方式沒人類
高效而已。
再來就是所謂的蒸餾有分為白盒的軟式蒸餾跟黑盒的硬式蒸餾,所謂的白盒蒸餾通常數據效
率比黑盒要高,但他有一個前提是當前模型要能看到目標模型實際上的輸出分佈也就是要知
道目標模型是怎麼思考的,這個如果是商業閉源模型想要調用根本不可能。
至於黑盒的硬式蒸餾要成功蒸餾商業閉源模型必須要有一個前提就是你要能夠大量打對方的
API到癱瘓的等級去取得海量數據,從數學上來說就是無窮採樣逼近母體才有可能蒸出來,
不然妄想幾個點就可以畫出完整曲面就是完全沒常識的人才會覺得可行。黑盒蒸餾少量數據
基本上是蒸餾不出通用性跟泛化能力,頂多補齊模型在某些狹窄領域的知識跟講話風格而已
,而且前提是這顆模型本身就已經足夠強,就是在狹窄領域沒那麼好(分佈上有缺一點東西
),這時候補齊幾個點可以逼近人類領域知識才是正常的。
所以這邊就帶出一個Claude可能的迴力鏢就是當前英文模型對中文窄領域的缺失知識,有一
種可能就是他們拿了千問去當老師,然後在某些場合Claude喚醒了千問作為教師的指令就回
應了他是千問。
有人可能會說當老師算蒸餾嗎?但從第一段回覆就說了數學上其實不管是SFT、RL或是KD在
目標函數上其實都是一模一樣的,數學上就能證明他是等價的東西。記住,人類可能會出於
意識形態騙人睜眼說瞎話(尤其是笨鳥),但數學不會,不會就是不會。
以上

Links booklink

Contact Us: admin [ a t ] ucptt.com