Re: [閒聊] RTX3060 12G復產兩個月 漲比5050更貴且慢

作者: kimisawa (楊)   2026-08-26 11:27:40
: 推 kimisawa: AI那段不對,12G可以放比5050大的模型 08/26 10:16
: 這句話只對30%
: 當你模型大到8G塞不下,12G以下可以塞的情況是成立
: 但是超過12G的時候又反過來,
: 另外8G塞的下的輕模型也是5050快得多
: 而且3060不支援FP8 E4M3/E4M2還有INT 4,遇到這種量化模型會被5050按在地上擦..
: 推 GenShoku: 這張是買來多卡AI的,你用遊戲性能來看肯定不值 08/26 10:23
: 推 sleep30hours: 有什麼模型是剛好8GB塞不下而12GB塞得下的嗎? 08/26 10:44
: → sleep30hours: 這年頭不就三個等級:8~9B以下,30B左右,數百B以上 08/26 10:44
: → sleep30hours: 以前還有不少12B~14B的量化後8GB很緊繃,但現在也只 08/26 10:45
: 推 laeva75: Gemma 12B 08/26 10:46
: → sleep30hours: 剩一個量化的Gemma4 12B僅此一家了。 08/26 10:46
: → laeva75: 單純跑minimax h3擴容買DRAM比買3060划算簡單.... 08/26 10:48
: → laeva75: VRAM大一點同一模型可以用更高精度的量化減少能力損失 08/26 10:50
: → gbcg9725: 9060xt 跑llm沒壓力,minimax所需時間大概是n卡6倍 08/26 10:55
: → gbcg9725: 所以我也看不懂在3060在貴什麼 08/26 10:56
: → gbcg9725: 實測llama-cpp用rocm版跟4070速度差不多 08/26 10:57
: → gbcg9725: 我是指9060xt 16g 08/26 10:58
: → tsunamimk2: 光12G vram就無敵了 08/26 11:14
: → tsunamimk2: 問題不只是權重本身 context長度差非常多 08/26 11:15
: → kimisawa: 3060貴因為被拿來AI多卡啊 08/26 11:15
: → tsunamimk2: 很多benchmark只看模型是不準的 08/26 11:15
: → tsunamimk2: 3060貴什麼喔 cuda啊 08/26 11:16
: → kimisawa: 你手上有一張24G N卡,插一張3060變成36G不香嗎? 08/26 11:16
: → tsunamimk2: 還有可以裝很多張 08/26 11:16
: → kimisawa: 或是一張16G的 再插一張3060變成30G 08/26 11:17
: → kimisawa: 50XX+3060雖然說頻寬損失一些但便宜就可以增加大VRAM 08/26 11:18
https://www.youtube.com/watch?v=hqrBC4EgqbY
這邊就有實測了 5060TI 16G 加插一張 3060 12G
https://i.imgur.com/ZoXzgvJ.png
用Gemma3 27B
5060TI 16G x 2 = 22 tok/s
5060TI 16G單卡 + CPU offload = 5 tok/s
5060TI+3060 可以跑到 17 tok/s,價格卻低很多
國外很多都把3060拿來插多卡,所以這波才漲上去
用一張50系當主輸出處理FP8 E4M3/E4M2/INT 4這些,然後offload到 3060去
你可以3060插四張弄個48G,也才1500鎂
所以3060在國外才會被炒,因為太萬用了
作者: Yoimiya (煙花易逝人情長存)   2026-08-26 11:30:00
文藝復興
作者: davidex (  ̄□ ̄)/喔~~喔喔~~喔喔)   2026-08-26 11:31:00
GDDR7可以和GDDR6混用呀
作者: jazon (Perhaps, Love)   2026-08-26 11:32:00
好神奇 因為AI伺服器太貴就把腦筋動到高VRAM舊顯卡上
作者: ninnyshadow (Lonely Liquid)   2026-08-26 11:38:00
不是啊 源頭問題不就是因為50系買不到只好回頭去搶3060 如果50系沒缺誰沒事想回頭用30系啊
作者: laeva75 (laeva75)   2026-08-26 11:47:00
影片中的是跑layer split,只是把模型切分到2個gpu接力運算。沒有甚麼主卡計算副卡vram offload喔...真要用另一張gpu做offload的話還不如直接用主記憶體就好,反正瓶頸同樣是被pcie卡住,還可以少走一段路
作者: ninnyshadow (Lonely Liquid)   2026-08-26 11:54:00
就老黃實在是太邪惡了 我開始考慮改買新的MAC M5MAX
作者: laeva75 (laeva75)   2026-08-26 11:58:00
犧牲的不是PCIe,而是5060Ti上面的那些較新的加速功能
作者: kausan (葛林)   2026-08-26 12:09:00
不如直上70ti
作者: laeva75 (laeva75)   2026-08-26 12:15:00
若模型大到16GB VRAM放不下的話,5070ti會比這種5060ti+3060的組合慢非常多喔反之若模型與KV都在16GB內的話,單5070Ti碾壓這種雙卡組合
作者: tsunamimk2 (我愛你 我需要你)   2026-08-26 16:01:00
問題是主機板與電力..XD還有分配管理記憶體需要driver另外其實那個邊際效益不高 看你要做什麼自己架設的推論機還是訓練機 訓練機其實永遠不夠推論機的話 這投資又不一定划算 包括算圖算影片目前實際的感覺是個人的顯卡大概16GB~24GB VRAM然後用來當本地的script/agent第一層/RAG平台context 能撐到32K還有一定速度就好了kv cache/context/權重的比例其實是很微妙的再往上加其實可以考慮排隊買mac mini/mac studio了事實上我預期一開始賣就會排到明年那個電力/算力/系統穩定度比真的很高另外認真做事大概無法避免每個月三千去買max pro那是必要的 因為大型的效果實在差很多
作者: DonnyDon (社會促進黨)   2026-08-26 17:49:00
30系真的是最操勞的一代,挖完礦出來又被叫去跑AI

Links booklink

Contact Us: admin [ a t ] ucptt.com