RecherchePopulaire

DeepSeek ouvre sa pile logicielle pour les puces Huawei Ascend

DeepSeek publie en open source une série de composants logiciels pour les puces Ascend de Huawei, du calcul matriciel à la communication entre appareils, avec une brique TileLang en tête.

Julien MartinJulien Martin
Popularité : 1,450
DeepSeek ouvre sa pile logicielle pour les puces Huawei Ascend

DeepSeek ouvre l'ensemble de ses briques logicielles pour les puces Ascend de Huawei. Du calcul matriciel à la communication entre machines, chaque composant répond à un équivalent conçu pour les puces Nvidia, un pas de plus vers une pile logicielle alternative.

DeepSeek ouvre sa pile logicielle pour les puces Huawei Ascend

DeepSeek a publié en open source une série de composants logiciels destinés aux puces Ascend de Huawei. Le mouvement porte sur l'infrastructure, la couche discrète qui relie les modèles aux processeurs, celle dont dépend la vitesse réelle d'un modèle.

L'annonce est technique. Mais elle compte. Une puce sans logiciel qui l'exploite pleinement reste sous-employée. En libérant ces briques, DeepSeek donne à d'autres équipes les moyens de faire tourner des modèles sur Ascend sans réinventer la plomberie.

Le choix de la licence accompagne cette logique : des composants comme la bibliothèque de noyaux TileKernels sont diffusés sous licence MIT, l'un des régimes les plus permissifs.

TileLang, l'outil qui traduit les calculs pour Ascend

TileLang est la pièce de tête. Il s'agit d'un outil de compilation : vous décrivez un calcul de manière lisible, et l'outil le traduit en instructions efficaces pour la puce visée.

Pourquoi est-ce si important ? Parce que sans ce traducteur, chaque équipe devrait réécrire ses calculs à la main pour le matériel. Selon DeepSeek, TileLang sert désormais de socle pour obtenir des implémentations performantes sur Ascend. C'est le type d'outil qui manquait pour rapprocher l'écosystème Ascend de la maturité atteinte par celui des puces Nvidia, où CUDA joue ce rôle depuis des années.

DeepGEMM, DeepEP, FlashMLA : la boîte à outils complète

Les composants publiés couvrent chacun un étage de la pile. DeepGEMM traite les opérations matricielles générales, le cœur de calcul qui revient sans cesse dans les modèles. DeepEP gère la communication à grande échelle entre appareils, une brique dont dépend la répartition d'un modèle sur plusieurs puces.

Viennent ensuite TileKernels pour le calcul vectoriel et les accès mémoire, FlashMLA pour l'attention creuse sur de longs contextes, et DeepSelect pour la sélection efficace de données. Mis bout à bout, ils forment une chaîne complète, du calcul brut à la préparation des données.

Le point notable, c'est la correspondance. Cette pile répond composant par composant à celle que DeepSeek avait déjà ouverte pour les plateformes Nvidia. Autrement dit, une équipe qui connaît la version grand public retrouve la même architecture, transposée à un matériel différent.

Les performances revendiquées par DeepSeek

DeepSeek avance des chiffres élevés. DeepGEMM Ascend atteindrait 99,8 % des limites théoriques du matériel sur les opérations matricielles, et MegaMoE 98 %. Ces mesures viennent du développeur lui-même et n'ont pas fait l'objet d'une validation indépendante à notre connaissance.

Des chiffres forts. À confirmer.

Il faut donc les lire comme des objectifs tenus par la source, pas comme un résultat vérifié. Coller à un plafond théorique reste en pratique la partie la plus difficile, notamment sur des charges réelles où la mémoire et les échanges de données deviennent limitants.

Pourquoi ces briques logicielles comptent

Un modèle ne tourne jamais directement sur une puce. Il passe par une couche logicielle qui organise les calculs. Sans elle, la meilleure puce du monde reste à moitié inutilisée.

C'est exactement le rôle de ces composants pour Ascend. Ils comblent l'écart entre un matériel en progrès et un environnement de développement encore jeune. Pour les équipes qui veulent porter un modèle sur ce type de puces, la barrière technique baisse nettement.

Le contexte technique de l'open source DeepSeek pour Ascend

Le rapprochement entre DeepSeek et Huawei s'inscrit dans une dynamique plus large d'outils logiciels qui visent à rendre les puces Ascend exploitables à grande échelle. Le sujet est technique avant tout : compilateur, opérations matricielles, communication entre cartes.

Reste une zone d'incertitude. La publication en open source ne dit rien de la facilité réelle d'usage. Les gains annoncés devront être reproduits par des équipes extérieures, sur des configurations variées, avant qu'on puisse parler de maturité. Les prochains mois diront si ces briques deviennent un standard ou restent un ensemble isolé.

Partager cet article

Sources

Actualités liées à l’IA

Outils d'évaluation LLM : comment tester un modèle avant vos utilisateurs
Recherche

Outils d'évaluation LLM : comment tester un modèle avant vos utilisateurs

Changer une phrase dans un prompt peut dégrader toutes vos réponses sans que personne ne s'en aperçoive. Les outils d'évaluation des LLM existent pour attraper ces régressions à temps.

Popularité : 700
Que signifie LLM ? Le grand modèle de langage expliqué simplement
Recherche

Que signifie LLM ? Le grand modèle de langage expliqué simplement

LLM signifie large language model, ou grand modèle de langage. Derrière ce sigle que tout le monde emploie, un fonctionnement plus simple qu'il n'y paraît, et des limites qui décident de la qualité de vos réponses.

Popularité : 760
Les vrais défis du déploiement d'un modèle d'IA en production
Recherche

Les vrais défis du déploiement d'un modèle d'IA en production

Un modèle qui fonctionne dans un carnet de test peut échouer une fois exposé aux utilisateurs réels. Le passage de l'expérimentation à la production est l'étape où la plupart des projets d'IA rencontrent leurs vraies difficultés.

Popularité : 850
RAG : comprendre la génération augmentée par recherche
Recherche

RAG : comprendre la génération augmentée par recherche

Un modèle de langage qui répond avec aplomb à côté de la plaque reste un problème fréquent. Le RAG propose une solution concrète : aller chercher l'information avant de rédiger la réponse. Explication d'une méthode devenue standard.

Popularité : 880