[新聞] DeepSeek發布V4新模型

作者: freeunixer (御劍客)   2026-04-24 18:09:35
聯合報
2026-04-24
陳宥菘/即時報導
時隔1年多...DeepSeek發布V4新模型 處理百萬字長文成標配
https://udn.com/news/story/7333/9462536
 就在OpenAI發布GPT-5.5幾個小時後,大陸AI新創深度求索(DeepSeek)
24日宣布,全新系列模型DeepSeek-V4的預覽版本正式上線,並同步開源。最新
模型具有能力處理長達百萬字的超長上下文,在Agent能力、世界知識和推理性
能上均實現大陸國內與開源領域的領先。陸媒研判,新模型使用的是華為昇騰晶
片。這距離DeepSeek去年1月的大版本更新已時隔15個月。
 上海第一財經報導,V4模型按大小分為Pro和Flash兩個版本,其中,Pro版參
數為1.6兆,啟動參數490億,預訓練資料量33兆;Flash版參數為2840億,啟動
參數130億,預訓練資料量32兆。
 DeepSeek表示,Pro版本主打高性能,在Agentic Coding(智能體編程)評測
中已達到目前全球開源模型的最優水平,也已成為公司內部開發的首選工具;在
數學、STEM及競賽型代碼評估中,其表現已能與目前全球頂級閉源模型比肩。
 Pro和Flash兩個版本的上下文都是1M(百萬),均同時支持「非思考模式」與
「思考模式」。「從現在開始,一百萬上下文將是 DeepSeek 所有官方服務的標
配。」DeepSeek表示,V4開創了一種全新的注意力機制,在token維度進行壓縮,
結合DeepSeek Sparse Attention(DSA,深度求索稀疏注意力機制,實現了全球
領先的長上下文能力,並且相比於傳統方法大幅降低了對計算和顯存的需求。
 從價格看,DeepSeek指出,V4-Pro每百萬tokens輸入是1元(人民幣,單位下
同,約新台幣4.62元),輸出是12元,V4-Flash每百萬tokens輸入是0.2元,輸
出是2元。有評論認為,價格仍相當普惠。
 報導指出,業界一直在關注DeepSeek-V4是否會使用大陸國產算力,從推文來
看確實是與華為昇騰合作。DeepSeek表示,受限於高端算力,目前Pro的服務吞
吐十分有限,預計下半年昇騰950超節點批量上市後,Pro的價格會大幅下調。
 相比前代模型, V4-Pro 的Agent能力顯著增強。在Agentic Coding(代理驅
動的程式撰寫)評測中,V4-Pro達到當前開源模型最佳水平。
 在推理上,官方在論文中表示,總體約落後前沿閉源模型3至6個月。
Pro-Max(Max表示最大推理能力模式)推理擴展後在標準推理基準上優於OpenAI
的GPT-5.2、Gemini-3.0-Pro,略遜於GPT-5.4、Gemini-3.1-Pro
備註:
所以今天 ChatGPT 5.5 跟 DeepSeek V4 同日公開.
之前從阿里離開的一個 LLM 開發研究人員說,目前中國的 LLM 跟外國的 LLM 差距
正在擴大,目前看來這說法是符合的.
他的幾個理由包括
1.使用人數不夠,無法產生回饋 - 改善正循環
2.中國的 AI 軟硬體基礎不足,只能走偏門壓榨效能
3.沒有自己的完整訓練方式,偷工去蒸餾別人的
4.為求表現,努力的 BenchMark,導致使用感與分數有落差
這跟我整整一年前的文裡 #1dZrxjXu 提到的問題是一樣的,我說了的一年後得到確認.
所以去年他們瘋狂的 Open 給外國的 Close Model 很大的壓力,其實不能使他們獲益,
因為人家可以下載你的 model 去搞自己的,就不會去用你的,你就不會有 data 來源,
更何況他們的使用者,主要來源本來就只有十億顆韭菜中國人...
但無論如何 DeepSeek 在拋棄 NVidia 的工作進展上依然是巨大的,
也許我們也可以開始去進口中國卡來自己搞,踹開發爐卡... (~笑你沒那個 guts
他今天公開 DeepSeek V4,周末又有一堆人要跟瘋子一樣在那瞎搞一堆有的沒的,
你們也快關掉 ptt,趕快去加入當貢獻 token 費的分子吧...
最後,這個記者非常懶,可能也不專業,
連中國的數字都沒有轉化,直接用中國慣用的幾兆、幾千億參數...

Links booklink

Contact Us: admin [ a t ] ucptt.com