Re: [問卦] Deepseek是不是真的不行了?

作者: sxy67230 (charlesgg)   2025-06-07 10:04:38
阿肥外商碼農阿肥啦!
這邊說一下目前產學界一些比較新的研究,可以從一些方向捕捉DeepSeek研究團隊想從事的
研究方面。
1. Self-Evolution: 當前包含Google Deepmind很多研究都逐漸走向當我們有一個能力不錯
的大模型要怎麼去讓LLM自我進化。過往訓練Reasoning或是RLFH哪怕是說真的無標其實都還
是需要一個接受過人為標籤訓練的獎勵模型來評判LLM的生成到底是好是壞。
但是2025前半年蠻多所謂的零標籤的訓練範式已經開始成熟,所謂的零標籤就是直接讓模型
生成多決策就像人腦我們可能會想出很多的策略,然後直接讓決策給LLM做共識決去直接接
受環境評價(無需要再一個經過人類價值灌輸的獎勵模型或是去像DeepSeek的GRPO一樣要人
為定義獎勵機制)。這樣根據研究發現模型是可以進一步迭代出更好的版本,也就是真正的
Alpha-Zero-LLM。
這個進一步延伸就是達爾文-哥德爾機,核心理念就是所有的進化在還沒有經歷過環境篩選
都是有用的,經歷過環境篩選不一定是最優模型而是只要訓練出最適應環境的機器就好。
2. KV Cache碎片化緩存: 這算是比較system architecture 層級的問題。隨著語言模型的
發展,很多時候就算你做了cache compression 還是會發現LLM能處理超長上下文的能力有
限。除了更改模型的Rotary或加入sliding window外,另一個思路是讓語言模型的KV cache
碎片化需要時再進行檢索,就像人類記憶也是採用跳躍碎片化檢索的能力一樣。而且因為機
器跟人腦不一樣的是可以大規模分散式部署,所以可以把記憶碎片分散在不同的節點上需要
再重組成完整片段記憶。
除此之外,今年上半年很多都是SLM(小語言模型)跟機器人(Embodies AI)的整合,讓語言
模型能突破人類語料接受真正物理世界的數據的時候進化才能真正開始。另外還有一些是想
突破Auto Regression 的架構採用擴散模型的方法也是一個值得期待的關注方向。
我感覺DeepSeek有可能會在R2上嘗試一些新的論文的方向,還有他們上週那篇ESFT(高效微
調專家模塊)也是蠻值得參考的,如果想做自我進化又不想讓模型過於偏離原始能力那僅微
調專家模型的話是不是能保證自我進化不會走歪也是很有趣的實驗。
差不多是這樣

Links booklink

Contact Us: admin [ a t ] ucptt.com