PTT
Submit
Submit
選擇語言
正體中文
简体中文
PTT
MobileComm
[新聞] Snapdragon 8 Elite Gen 6的Hexagon NPU
作者:
takeshi911
(L.Lawlite)
2026-09-11 17:53:54
1.原文連結:https://reurl.cc/vGK9V1
2.原文標題: Snapdragon 8 Elite Gen 6的Hexagon NPU為代理AI與專家混合
模型而生,新增Element加速器與更大共享快取
3.原文來源(媒體/作者):Cool3c/Chevelle.fu
4.原文內容:
高通繼為即將在9月下旬於Snapdragon高峰會公布的Snapdragon 8 Elite Gen 6搶先預覽
CPU、GPU的特色後,再針對新一代Hexagon NPU進行預覽解密;Snapdragon 8 Elite Gen
6的Hexagon NPU將是為代理式AI與專家混合模型而生,加入Element加速器、進一步增加
共享快取與支援廣泛的精度,提供自預填充、推論到輸出更迅捷、低延遲的代理AI體驗。
AI運算需求從單一推論轉化為持續、多模、低延遲
高通提到,隨著代理式AI成為繼生成式AI後的新趨勢,AI的運算需求也從原本聚焦在執行
單一模型、追求推論速度轉化為需要具備持續、多模態及低延遲,也成為高通在規劃新一
代Hexagon NPU的重點;具體而言,高通全新Hexagon NPU聚焦在兩個重點:Element加速
器與增加50%容量的共享快取。
為代理式AI執行設計的Element加速器
Element是因應新一代生成式與代理式AI所設計的加速器,結合純量、向量與矩陣擴展,
可加速大型模型最重要的運算,使代理式AI可更快的反應、更有效率的推論,進而在不影
響續航力的前提提供豐富的代理體驗。
更大的共享快取減少頻繁的資料傳輸
新一代Hexagon NPU也將共享快取容量提升50%,藉由更大的記憶體系統容納更多模型狀態
、啟動質與中間張量,減少資料需要頻繁傳輸到外部的DDR記憶體的情況,可以減少記憶
體瓶頸,加速AI執行速度與響應,也能降低資料頻繁傳輸的能耗。
因應代理式AI負載需求的設計
代理式AI的效能關鍵在於維持代理式AI執行多個任務時仍可維持響應迅速、上下文相關與
高效率運作,新一代Hexagon NPU借助添加上述兩項特色,使得在進行AI、長上下文推論
、多模態模型具有更出色的持續性能,並帶來低延遲。
更大的快取能使NPU把資料盡可能保持在近端,可協助代理式AI更快完成響應、修正、規
劃與行動,帶來更豐富的上下文視窗、更快的Token輸出與多工具、多任務的代理式AI轉
換。Element加速器則提升生成式與代理式AI最關鍵的轉換器操作效能,透過項量擴展加
速高吞吐量AI數學運算與純量擴展,支援代理最關鍵的決策邏輯、路由與編排。
藉更低記憶體頻寬執行更大的模型
新一代Hexagon NPU也放眼下一代模型架構,高通攜手領先的記憶體與模型供應商合作,
將基於MoE專家混合模型的新一代裝置端AI架構整合至Hexagon NPU,載入一個30B參數的
MoE模型時,在NPU輸出Token階段僅需動用3B的參數。
MoE模型與密集模型不同,MoE會透過動態方式從混合模型中選擇任務對應的專家模型,進
而使運算資源與記憶體頻寬需求降低;在整合智慧的快閃記憶體及記憶體專家管理與快取
技術,專家混合模型能夠以低功耗、低記憶體需求時現更廣泛全面的AI體驗,並提供手機
快速回應、安全的產生高品質的AI代理。
支援廣泛精度及提升預填充
為了應對專家混合模型需求及降低對記憶體頻寬需求,新一代Hexagon NPU具體的作法是
支援更廣泛的精度,提供自INT2、INT4、INT8、FP8至FP16的支援,開發者可靈活的在效
能、記憶體、模型品質與功耗之間選擇合宜的格式與模型規模。
此外對於影響響應最關鍵的預填充,新一代Hexagon NPU在INT4模型提高50%的預填充性能
,並具備更快的解碼吞吐、更強的預測性解碼能力及更高的每秒Token,最終提供即時、
流暢的裝置端AI體驗。
與CPU及GPU異構運算同樣重要
雖然Hexagon NPU的目的是高效率的盡可能執行所有階段的AI任務,不過現行的AI負載仍
須仰賴異構運算,其中任務於核心之間移動的智慧路由、編排與資料可用性需要透過CPU
,而GPU也同樣在現代圖形運算納入特定的AI運算需求。
Snapdragon 8 Elite Gen 6引入超越5GHz時脈的下一代Oryon CPU及Oryon Flex Cache快
取架構,協助在AI任務編排的CPU負載更高效的完成;而全新Adreno GPU亦納入神經網路
加速架構,於圖像處理階段自管線進行AI增強處理,帶來更出色的視覺體驗。
5.心得/評論:
新一代Hexagon NPU憑藉快取與加速器升級,完美解答代理式AI的低延遲與高算力需求。
作者: Hohenzollern
2026-09-11 22:05:00
高通S8 Elite Gen6晶片多核CPU應該贏過蘋果A20 Pro晶片三大晶片廠牌 高通最後發表產品壓力最大蘋果CPU單核和聯發科GPU比不上 高通只能極限壓榨多核CPU跑分
作者:
shengshampoo
(Sheng Shampoo)
2026-09-12 11:29:00
不懂就問,板上鄉民版友怎麼用AI?聊天機器問問?會應用到AI agent 融入整合工作流?邊緣運算場景,鄉民版友的等級會怎麼做?
繼續閱讀
[討論] i18pro各電商預購優惠比較
aa98403
Re: [問題] iPhone Duo 最後會跟Air一樣後繼無力嗎
deann
[問題] iPhone Duo 最後會跟Air一樣後繼無力嗎
xz4979265
Re: [討論] iPhone Duo後發先至fold不斷退步
asahi98
Re: [討論] 搞得好像折疊手機第一次發明?
neil136
[問題] Sony 10 viii 比 1 viii 有質感
senma
Re: [問題] 安卓後來怎麼捨棄全面屏的
AUQ
[討論] 鍾文澤 蘋果新品各顏色推薦
oopsskimo
Re: [問題] 為什麼1999美金兌換臺幣74900
yokann
Re: [問題] 為什麼1999美金兌換臺幣74900
xross
Links
booklink
Contact Us: admin [ a t ] ucptt.com