作者:
sxy67230 (charlesgg)
2026-09-19 00:31:17※ 引述 《kls》 之銘言:
: Anthropic上週有出份報告,真的是完全在恥笑中國
阿肥外商碼農阿肥啦!
剛好看到這篇就回覆一下,如果有認真看報告的話,其實報告裡面針對Qwen 有提到「可能
」這個字,也就是說Anthropic也不敢斷定真的是拿來做SFT pipeline的訓練軌跡。
然後另一項指控是說阿里拿來寫RL的environment,這點算是比較有趣的。熟悉RL的小朋友
大概都知道做強化學習的時候其實很多時候是可以不需要模型知道正確答案去跟著正確答案
微調的,只需要獎勵訊號即可。而這個獎勵訊號可以從真機實操來判斷(有報error一定錯
),但很多時候開放式問題獎勵其實很難評判,這個時候主流會考慮用另一個模型來評分。
然後RL中其實這個獎勵模型是不直接參與學習過程的,從技術上來看RL中AI其實是自己學習
自己產生的數據,只是透過這個獎勵模型來決定哪些自己產生的數據不要學而已。
然後報告其實沒有提供這些調用類型的佔比,但如果Qwen實驗室是拿來做後者某種程度不能
算上嚴格意義的蒸餾,甚至連SFT都算不上。不過從數學上廣義來看要把reverse KL算是蒸
餾也沒什麼話可以說,就是如果學生模型都是自產自銷的話,算不算是人類語句中所說的抄
襲同義就很難說了。畢竟學生確實沒抄教師答案,所有過程都是學生自己想的,只是有一個
老師在跟你說你哪個推理有問題而已。
最後就是kimi、DS反而沒蒸餾指控,就是指控他們把服務轉接到Claude 然後Anthropic指控
說用戶帶個資傳東西過來被Anthropic看到了(依照報告說詞很含糊推測就是少量含個資被
放大了)。
不過轉接服務也算合理(就是很醜陋就是了),畢竟脖子GPU晶片都被美國卡死了,就是卡
不夠的情況下轉接過去,這東西法律上也沒什麼違法疑慮,不然一堆SaaS服務接別人API的
都違法了。
不過有趣的點就是報告其實是給美國商務部的,所以用意更多是為了推銷政府Anthropic很
重視AI安全,就是重視安全到可以監聽大家在問Claude什麼問題就是了(API企業用戶一樣
也會監聽)。