研究注目

DeepSeekが華為昇騰向け基盤ソフトをオープンソース化、Nvidia向けと対をなす構成

DeepSeekが、華為のAIチップ「昇騰」向けの基盤ソフトウエア一式をオープンソース化した。Nvidia向けと一対一で対応する構成で、開発者は自前の環境で高性能な処理を組めるようになる。

佐藤健太佐藤健太
人気度:1,450
AIチップとソフトウエア層を組み合わせた抽象ビジュアル

DeepSeekが、華為のAIチップ「昇騰」向けの基盤ソフトウエア一式をオープンソース化した。Nvidia向けと一対一で対応する構成で、開発者は自前の環境で高性能な処理を組めるようになる。

DeepSeekの昇騰向けオープンソースとは

DeepSeekは、華為のAIチップ「昇騰(Ascend)」向けの基盤コンポーネント一式をオープンソースとして公開した。対象はTileLangコンパイラやDeepGEMMなど、モデルの学習と推論を支える低レイヤーの部品群になる。

オープンソース化されたのは、これまでDeepSeekがNvidiaのプラットフォーム向けに公開してきたものと対になる構成だ。Nvidiaのチップ向けに最適化した部品を、昇騰でも同様に使えるよう移植した格好になる。

開発者にとっての意味は大きい。高性能なAIモデルを動かすには、計算をどう回すかという低レイヤーの最適化が欠かせない。その部分が公開されたことで、昇騰上でも同じ水準を狙える土台が整う。何が公開されたのか? 続けて見ていく。

公開された6つの基盤コンポーネント

公開された部品は、それぞれ役割が決まっている。どれも訓練や推論の速度に直結する部分だ。

TileLangは、計算処理を書くためのコンパイラ基盤だ。DeepSeekのV4シリーズの学習で使う演算の多くを支えている。昇騰版は低レイヤーのAscend C命令を包み込んでおり、学習で使う演算の一つひとつに対応する高性能な実装がそろったという。

DeepGEMMは、行列演算を速く処理するための部品。AIモデルの中核になる計算を担う。DeepEPは、大規模にデバイスをまたいで通信するためのもので、多数のチップを連携させるときに効く。

TileKernelsは、ベクトル計算とメモリの読み書きを担う。FlashMLAは長い文脈を扱うときの疎な注意機構、DeepSelectはデータの絞り込みを高速化する部品だ。

Nvidiaとの一対一対応とは何か

では「一対一対応」とは何を意味するのか。ここは誤解しやすい部分なので丁寧に見ておく。

「一対一対応」というのは、Nvidia向けに提供していた部品と、昇騰向けの部品が同じ顔ぶれでそろうことを指す。

これまでは、あるチップ向けに最適化した部品を別のチップで使うと、書き直しや調整が必要だった。実装がそろっていれば、開発者はプラットフォームを切り替えるときの手間を減らせる。同じコードの流れで、複数のチップを対象にできる。

ただし両プラットフォームの性能が同じになる、という意味ではない。あくまで使える部品の構成が対応する、という話だ。実際の速度はチップの特性や使い方によって変わる。

報告されている性能

開発者側の報告では、DeepGEMM Ascendは行列演算でハードウエアの限界の99.8%に達し、MegaMoEでは98%を記録したとされる。これは開発者の主張であり、独立した第三者による検証ではない点に注意したい。

ハードウエア限界に近い数字は、理論上の上限に迫る速度で処理できていることを意味する。数字だけを見ると高水準だが、どのような条件で測ったかによって結果は変わる。あくまで開発者による自己申告として受け止めるのが妥当だ。

なぜ今、国産チップ向けの基盤整備が進むのか

AIモデルの性能を引き出すには、チップ本体だけでなく、その上で動くソフトウエアが要る。ここが弱いと、チップの潜在能力を引き出せない。

Nvidiaが強いのは、ハードだけでなく、その上で動くソフトウエアの蓄積があるためだ。競合のチップが性能面で追いついても、ソフト側が整っていなければ実用の場面で見劣りする。逆に言えば、ソフト基盤を自前でそろえられれば、チップの選択肢は広がる。

DeepSeekの今回の公開は、このソフト側の穴を埋める動きにあたる。部品をオープンソースにすることで、DeepSeek以外の開発者も昇騰上でモデルを組みやすくなる。

開発者にとっての意味と留意点

昇騰上でAIモデルを動かしたい開発者にとって、公開された部品は出発点になる。行列演算や通信、注意機構といった重い処理を、自前で一から書かずに済む。

気をつけたいのは、部品がそろってもすぐに動くとは限らない点だ。実際に使うには環境の構築や調整が要る。性能の数字も開発者の報告であり、自分の用途で同じ結果が出るとは限らない。まず小さな構成で試すのが現実的になる。

基盤ソフトの公開は、ハードの性能競争とは別の次元で進む動きだ。チップの選択肢が広がるかどうかは、こうしたソフト側の整備にかかっている。

このニュースを共有

出典

関連AIニュース

LLM評価ツール比較:公開ベンチマークと自前テストの使い分け
研究

LLM評価ツール比較:公開ベンチマークと自前テストの使い分け

LLM評価ツールが何を測り、公開ベンチマークとどう違うのかを整理。DeepEval・Ragasなど代表ツールの比較、LLM-as-a-Judgeの限界、自前テストの作り方までをまとめる。

人気度:810
LLMとは何の略か?大規模言語モデルの仕組みと限界
研究

LLMとは何の略か?大規模言語モデルの仕組みと限界

LLMはLarge Language Modelの略で、大量のテキストを学習し言葉の続きを予測する仕組み。トランスフォーマーの構造、パラメータの意味、生成AIとの違い、苦手なことを基礎から整理する。

人気度:720
作ったモデルが現場で動かない:AIデプロイの落とし穴
研究

作ったモデルが現場で動かない:AIデプロイの落とし穴

学習済みモデルを本番で動かす配備には、精度の低下、コストと速度の壁、運用の維持という難しさがある。つまずきやすい地点と対策を整理する。

人気度:820
AIが社内文書を答えられない理由とRAGの仕組み
研究

AIが社内文書を答えられない理由とRAGの仕組み

RAG(検索拡張生成)は、外部の情報を検索してからAIに答えさせる仕組み。検索と生成の二段階、従来の生成AIとの違い、精度が落ちる場面と対策を解説する。

人気度:860