Re: [問卦] Deepseek新框架 增速85%

作者: sxy67230 (charlesgg)   2026-07-03 15:41:43
※ 引述 《logical01》 之銘言:
: DeepSeek創始人梁文輝與北京大學
: 聯合發表論文,並公開推理
: 加速框架“DSpark”。
: 該框架採用了半自回歸生成和信賴度
: scheduling驗證機制,在不改變硬體
: 或降低輸出品質的情况下,將DeepSeek-V4的用户端生成速度
: 提升了60%至85%,並将推理成
: 本降低了約40%。"
: 很厲害嗎?
餓死抬頭,阿肥外商碼農阿肥啦!
其實現在所有投機解碼的整個核心概念最早可以追溯到Deepmind兩三年前的論文,deepmind
最先是驗證了先投機後驗證的方式在數學上是可以證明嚴格的下限就是不投機。
舉個例子就是大家高中數學解題有時候時間限制不可能從頭推理到答案,所以考試就會有一
些小技巧就是我們刪去最不可能的答案再驗證可能的答案,這樣解題速度就會加倍,這也是
最日常的投機解碼的例子。
最早樸素的概念就是我們隨便拿一個很小的語言模型當主模型的draft model,然後讓小模
型快速先猜,猜出來大模型驗證對的就留下,accept rate越高就越好。相對來說就越能提
速,不過代價就是犧牲一些內存空間來換時間。
後來衍生出Medusa、EAGLE這些方法,Medusa是用多頭直接併行的,理論上他可以做到非常
快,但是代價就是他不是時序嚴格依賴的,所以只要draft token一提高accept rate就會急
速下降,最後退回全部依賴主模型解碼。EAGLE則是用llm 的一層當作draft model,但是這
樣其實架構會變很肥,提高accept rate的代價就是開銷變大。
然後去年的DFlash直接把draft model改成一層擴散模型,擴散模型的優點就是可以把draft
model當作是完全併行又時序依賴的直接打開大家的想法,才有了deepseek 5天前的Dspark
,本質上Dspark也是想做到並行又時序依賴。
以上

Links booklink

Contact Us: admin [ a t ] ucptt.com