研究熱門

DeepSeek 開源昇騰組件:六套基礎設施如何對應 Nvidia 平台

DeepSeek 開源一整套面向華為昇騰算力平台的基礎設施組件,涵蓋編譯工具、計算庫與通訊庫,每項都與其 Nvidia 平台版本一一對應。這篇說明這些組件是什麼、對開發者有何意義。

陳柏宇陳柏宇
熱度:1,450
DeepSeek 開源昇騰組件:六套基礎設施如何對應 Nvidia 平台

DeepSeek 把一整套面向華為昇騰算力平台的基礎設施組件開源出來,每個組件都與它先前針對 Nvidia 平台釋出的版本一一對應。這對在昇騰上開發的人意味著什麼?

DeepSeek 開源昇騰組件是怎麼一回事

DeepSeek 透過官方管道宣布,正式開源面向華為昇騰算力平台的基礎設施組件。這次釋出的內容涵蓋編譯工具、計算庫與通訊庫,是一整組而非單一工具。

關鍵在於對應關係。DeepSeek 表示,這些組件與它此前面向 Nvidia 平台開源的同類組件一一對應。也就是說,原本只在 Nvidia 生態裡能用的軟體堆疊,現在有了昇騰版本。

官方說法提到,在面向昇騰平台的研發過程中,團隊把整套自研的關鍵組件都開放了出來。

這次開源包含哪些組件

這批組件不是零散的,而是一條完整的技術鏈。列表如下:

  • TileLang 高階語言編譯工具
  • DeepGEMM 通用矩陣運算庫
  • DeepEP 大規模跨裝置通訊庫
  • TileKernels 向量計算與訪存算子
  • FlashMLA 長上下文稀疏注意力算子
  • DeepSelect 高效資料選擇

每一項都對應 AI 訓練與推理流程中的某個環節。從寫程式的工具、底層的矩陣運算,到多卡之間的通訊,幾乎涵蓋了把模型跑起來所需的整條路徑。

對開發者來說,這代表遷移到昇騰時,不必從頭打造這些基礎零件,可以直接取用經過驗證的版本。

為什麼要與 Nvidia 平台一一對應

「一一對應」是這次最值得注意的細節。

過去在 Nvidia 平台上,DeepSeek 釋出過 DeepGEMM、DeepEP、FlashMLA 等組件,開發者已經用了一段時間。如今同一批能力的昇騰版本出現,等於把原本綁在特定硬體上的軟體經驗,搬到另一個平台。

這降低的是遷移成本。開發者若原本熟悉 Nvidia 版本的用法,面對昇騰版本時,學習曲線相對平緩。對想在不同硬體間切換的團隊來說,這種對稱性比單一組件的效能數字更有價值。

效能數字該怎麼看

DeepSeek 在說明中給出了一些效能數據。以 GEMM(通用矩陣乘法,AI 運算的核心步驟之一)為例,DeepGEMM Ascend 報告達到硬體極限的 99.8%;MegaMoE 則提到 98%。

這些數字需要留意來源。它們是開發者方的說法,並非經過獨立第三方驗證,因此應理解為「DeepSeek 聲稱」的成績,而非公認標準。

即便如此,這類指標代表的意義是:軟體層盡可能貼近硬體的理論上限,減少運算資源的浪費。對實際使用者來說,意味著同樣的硬體可能跑出更高的吞吐量。

對開發者與生態的實際影響

最直接的受益者,是在昇騰平台上做 AI 開發的團隊。過去他們可能得花大量時間處理底層優化,現在可以直接採用這批組件。

其次是關注多平台部署的企業。若同一套軟體堆疊能在 Nvidia 與昇騰之間對應,選擇硬體時的彈性就更大,不必被單一生態綁死。

官方提到,這批組件在程式設計上比 CUDA 更簡單高效。這是 DeepSeek 的說法,實際體驗是否如此,仍需使用者自行驗證。

這批開源的後續觀察點

值得追蹤的有幾點:一是社群是否會回報實際效能與官方數據的落差;二是這批組件能否吸引更多開發者在昇騰上投入;三是 DeepSeek 是否會持續更新、把更多組件對應到昇騰平台。

這是一則技術與生態面的消息,重點在於軟體堆疊的完整度與可用性。對一般使用者來說,短期內感受不到變化,但對做 AI 開發的人而言,多了一個可選的平台路徑。

分享這則新聞

來源

相關 AI 新聞

評測 LLM 的五類工具:從基準測試到 LLM 評審
研究

評測 LLM 的五類工具:從基準測試到 LLM 評審

換模型、改提示後到底有沒有變好,憑感覺不算數。這篇介紹五類實用的 LLM 評測工具,從學術基準、應用層框架到 LLM 評審與人類偏好競技場,並說明該如何組合、要避開哪些陷阱。

熱度:1,000
LLM 是什麼?從詞元到上下文視窗,一次搞懂大型語言模型
研究

LLM 是什麼?從詞元到上下文視窗,一次搞懂大型語言模型

LLM 是大型語言模型的縮寫,靠海量文字訓練來預測下一個詞。這篇從詞元、訓練流程講到上下文視窗與幻覺,把它的運作邏輯與能力邊界拆開來看,並說明它跟搜尋引擎差在哪。

熱度:1,050
模型上線之後才是難關:生產環境常踩的五個坑
研究

模型上線之後才是難關:生產環境常踩的五個坑

模型在測試環境表現亮眼,不代表上線後能穩定服務。本文整理生產環境最常見的五個挑戰,包括訓練與服務的資料落差、缺乏壓力測試與回滾、監控盲區、大型模型的資源難題與資料漂移。

熱度:900
RAG 如何讓模型回答得更可靠:檢索增強生成完整拆解
研究

RAG 如何讓模型回答得更可靠:檢索增強生成完整拆解

RAG 是一種讓模型先查外部資料再生成答案的做法,用來補上知識截止與缺乏私有資料的缺口。本文拆解它的運作步驟、與直接塞長文的差別、常見錯誤來源,以及哪些場景用起來最划算。

熱度:1,100