作者:
arsl400 (dark hatter)
2026-08-30 02:47:38最近OPENAI突然在幾天前宣布plus要限制字數,不然就卡幾小時
Pro的token數量比較多
可是要3000摳摳
請問大家有淪陷嗎?
還是寫程式公司會補助pro?
pro方案很值 沒事還會reset用量 還會給你reset ticket因為太值了 我都直接開2~3個repo同時用codex 要不然根本用不完
作者:
USD5566 (美金五千五百六十六)
2026-08-30 10:42:00這個 id直接噓就好 平常電影版洗不夠來這洗
上週我才碰到 chatgpt 算錯一個變數的代數問題…..
公司有提供claude MAX 不過我自己也是訂閱了GPT pro
作者:
Obama19 (^_^)
2026-08-31 01:34:00AI頂多拿來查資料吧 生產環境最好別用
作者:
jobintan (Robin Artemstein)
2026-08-31 07:05:00算力緊張(×)開割韭菜(○)
你要AI直接算代數 錯誤的機率很高 因為他是文本產生器但是你可以較AI用python lapack解 或是用julia寫出script 跑答案比較快
作者:
CoNsTaR ((const *))
2026-08-31 11:23:00自己跑 glm-5.3-flash, deepseek-v4-flash-0731 和 qwen3.8-flash-next,永遠不會被限制qwen3.8-flash-next 只要 80GB RAM 就可以跑 Q4 full context
很有意思,以前網路時代大家把黏度高的客戶當高價值客戶,AI時代反而是要趕走那些用的多的叫他們滾去自架
因為網路時代重度用戶為企業帶來價值,現在重度用戶反而是讓算力成本爆增
作者:
jobintan (Robin Artemstein)
2026-09-03 07:03:00CoNsTaR所說的80GB,所指的是RAM還是VRAM?兩者差很大。
作者:
CoNsTaR ((const *))
2026-09-03 15:01:00RAM+VRAM 總合大於 80GB 就可以,qwen3.8-flash-next 只有 6b active parameters 所以就算大部分 parameters 都spill over 到 RAM 速度也不會太慢,你的 VRAM 只要能放得下 kv cache 就可以,而且它有 51b 是 per layer embedding,所以大概有 102GB 是可以直接從 SSD 串流,不需要常駐在 RAM 的,所以才只需要 80GB RAM265k context 的話 kv cache 只有 6.2 GB,所以就算你只有 8GB VRAM 也行*256k算錯,256k context Q8 kv cache 需要 14GB RAM,所以至少要 16GB VRAM 才塞得下 256k kv cache,但如果你只用 128k context 雖然有點小,但 8GB 就夠了然後有一個 AtomicChat 的 quant 他的 Q4 因為把 per layer embedding 也算進 bpw,然後又用 bpw 來命名,所以只要 56GB RAM 就可以跑 "Q4",雖然沒有統一的 KLD 跑分,但是其他人的 Q4 KLD 大概都是 0.04,AtomicChat 的 Q4是 0.08,比其他人的 divergence 高了一倍,但如果 RAM吃緊,用 AtomicChat 的 quant 只要 16GB VRAM + 56GB RAM 也能號稱跑 Q4(但實際上更像 IQ2 或 IQ3)