DeepSeek ouvre l'ensemble de ses briques logicielles pour les puces Ascend de Huawei. Du calcul matriciel à la communication entre machines, chaque composant répond à un équivalent conçu pour les puces Nvidia, un pas de plus vers une pile logicielle alternative.
DeepSeek ouvre sa pile logicielle pour les puces Huawei Ascend
DeepSeek a publié en open source une série de composants logiciels destinés aux puces Ascend de Huawei. Le mouvement porte sur l'infrastructure, la couche discrète qui relie les modèles aux processeurs, celle dont dépend la vitesse réelle d'un modèle.
L'annonce est technique. Mais elle compte. Une puce sans logiciel qui l'exploite pleinement reste sous-employée. En libérant ces briques, DeepSeek donne à d'autres équipes les moyens de faire tourner des modèles sur Ascend sans réinventer la plomberie.
Le choix de la licence accompagne cette logique : des composants comme la bibliothèque de noyaux TileKernels sont diffusés sous licence MIT, l'un des régimes les plus permissifs.
TileLang, l'outil qui traduit les calculs pour Ascend
TileLang est la pièce de tête. Il s'agit d'un outil de compilation : vous décrivez un calcul de manière lisible, et l'outil le traduit en instructions efficaces pour la puce visée.
Pourquoi est-ce si important ? Parce que sans ce traducteur, chaque équipe devrait réécrire ses calculs à la main pour le matériel. Selon DeepSeek, TileLang sert désormais de socle pour obtenir des implémentations performantes sur Ascend. C'est le type d'outil qui manquait pour rapprocher l'écosystème Ascend de la maturité atteinte par celui des puces Nvidia, où CUDA joue ce rôle depuis des années.
DeepGEMM, DeepEP, FlashMLA : la boîte à outils complète
Les composants publiés couvrent chacun un étage de la pile. DeepGEMM traite les opérations matricielles générales, le cœur de calcul qui revient sans cesse dans les modèles. DeepEP gère la communication à grande échelle entre appareils, une brique dont dépend la répartition d'un modèle sur plusieurs puces.
Viennent ensuite TileKernels pour le calcul vectoriel et les accès mémoire, FlashMLA pour l'attention creuse sur de longs contextes, et DeepSelect pour la sélection efficace de données. Mis bout à bout, ils forment une chaîne complète, du calcul brut à la préparation des données.
Le point notable, c'est la correspondance. Cette pile répond composant par composant à celle que DeepSeek avait déjà ouverte pour les plateformes Nvidia. Autrement dit, une équipe qui connaît la version grand public retrouve la même architecture, transposée à un matériel différent.
Les performances revendiquées par DeepSeek
DeepSeek avance des chiffres élevés. DeepGEMM Ascend atteindrait 99,8 % des limites théoriques du matériel sur les opérations matricielles, et MegaMoE 98 %. Ces mesures viennent du développeur lui-même et n'ont pas fait l'objet d'une validation indépendante à notre connaissance.
Des chiffres forts. À confirmer.
Il faut donc les lire comme des objectifs tenus par la source, pas comme un résultat vérifié. Coller à un plafond théorique reste en pratique la partie la plus difficile, notamment sur des charges réelles où la mémoire et les échanges de données deviennent limitants.
Pourquoi ces briques logicielles comptent
Un modèle ne tourne jamais directement sur une puce. Il passe par une couche logicielle qui organise les calculs. Sans elle, la meilleure puce du monde reste à moitié inutilisée.
C'est exactement le rôle de ces composants pour Ascend. Ils comblent l'écart entre un matériel en progrès et un environnement de développement encore jeune. Pour les équipes qui veulent porter un modèle sur ce type de puces, la barrière technique baisse nettement.
Le contexte technique de l'open source DeepSeek pour Ascend
Le rapprochement entre DeepSeek et Huawei s'inscrit dans une dynamique plus large d'outils logiciels qui visent à rendre les puces Ascend exploitables à grande échelle. Le sujet est technique avant tout : compilateur, opérations matricielles, communication entre cartes.
Reste une zone d'incertitude. La publication en open source ne dit rien de la facilité réelle d'usage. Les gains annoncés devront être reproduits par des équipes extérieures, sur des configurations variées, avant qu'on puisse parler de maturité. Les prochains mois diront si ces briques deviennent un standard ou restent un ensemble isolé.






