DeepSeek ha liberado el conjunto de piezas de software con el que entrena sus modelos, esta vez adaptado a los chips Ascend de Huawei. Cada componente tiene su equivalente exacto en el ecosistema de Nvidia, y eso es justo lo relevante: la compañía china demuestra que su pila técnica puede funcionar lejos del hardware de Nvidia.
Qué ha abierto DeepSeek para los chips Ascend de Huawei
DeepSeek publicó en abierto una serie de herramientas de infraestructura pensadas para funcionar sobre la plataforma de cómputo Ascend de Huawei. No es un modelo nuevo ni una aplicación para el usuario final, sino el trabajo de fontanería que hay debajo: lo que hace que el entrenamiento y la ejecución de modelos de IA sean eficientes. Suena aburrido. Importa mucho.
Cuando entrenó su serie de modelos V4, DeepSeek construyó su propia base técnica. Hasta ahora esa base corría sobre GPU de Nvidia. Lo que ha hecho esta vez es trasladar las mismas piezas a los chips Ascend y publicarlas para que cualquiera las use o las estudie. Sin secretos.
El detalle importante es la simetría: cada componente liberado corresponde a otro que DeepSeek ya había abierto para la plataforma de Nvidia. No son versiones recortadas ni adaptaciones a medias, sino equivalentes funcionales. Para quien desarrolla sobre Ascend, eso reduce el trabajo de reescribir su software desde cero.
¿Y por qué alguien querría escribir para dos plataformas a la vez? Porque así no queda atado a un solo proveedor de chips. Simple.
Esa es toda la idea.
Los seis componentes, explicados sin jerga
El primero es TileLang, una herramienta que permite escribir operaciones para chips en un lenguaje de alto nivel en lugar de pelearse con instrucciones de bajo nivel. DeepSeek la usa para implementar la mayoría de los operadores que intervienen en el entrenamiento de sus modelos de la serie V4. Menos dolor de cabeza, más control.
Después viene DeepGEMM, dedicada a las operaciones con matrices, el cálculo básico que sostiene casi todo lo que hace un modelo de IA. Le sigue DeepEP, que gestiona la comunicación entre muchos dispositivos a la vez, algo clave cuando se reparte el entrenamiento entre cientos de chips. TileKernels aporta operadores estándar de cálculo vectorial y de acceso a memoria. Piezas de fontanería, todas.
Los dos últimos apuntan a tareas concretas de rendimiento. FlashMLA implementa operadores de atención dispersa, la técnica que agiliza el procesamiento de contextos largos, es decir, textos muy extensos. DeepSelect se encarga de elegir datos de forma eficiente, una parte que suena menor pero pesa en el coste total del entrenamiento.
Son seis en total.
Puestos en una frase: DeepSeek ha publicado el motor, la transmisión y las ruedas, no solo el coche. Es la parte del trabajo que casi nadie documenta y que, en la práctica, decide si un modelo se puede entrenar a un precio razonable.
Y ese precio, al final, es lo que decide quién puede competir.
Las cifras que DeepSeek atribuye a la versión Ascend
Junto a los componentes, DeepSeek comparte cifras de rendimiento. Según la compañía, DeepGEMM Ascend alcanza el 99,8 % del límite teórico del hardware en operaciones de matrices, y MegaMoE llega al 98 %. Son números que, de sostenerse, indicarían que el software exprime los chips Ascend casi al máximo. Casi perfectos. Casi.
Hay que leerlos con la cautela que merecen. Se trata de datos aportados por el propio desarrollador y medidos en condiciones que no se detallan del todo, así que conviene tomarlos como una referencia de su potencial, no como un resultado verificado por terceros. Aun así, el mensaje es claro: DeepSeek sostiene que su pila puede rendir a la altura del hardware en el que corre.
Lo que no dicen esas cifras es cómo se comparan de forma global los chips Ascend con las GPU de Nvidia para entrenar modelos grandes. Rendimiento de software y capacidad de hardware son dos cosas distintas, y aquí solo se habla de la primera. Ojo con confundirlas.
Por qué importa la paridad con Nvidia para la IA de código abierto
El valor real de este lanzamiento está en la palabra paridad. Cuando el software de entrenamiento está escrito para una sola plataforma, cambiar de chip obliga a reescribir grandes partes del sistema. DeepSeek demuestra que, al menos para su propia pila, existe un camino alternativo escrito desde cero para otra arquitectura.
Para el mundo del código abierto, eso amplía las opciones. Un laboratorio o una empresa que no quiera depender de un único proveedor de hardware tiene ahora un punto de partida publicado, no un manual propietario. Y al abrirlo, DeepSeek permite que otros lo revisen, lo critiquen y lo mejoren. Eso es la gracia.
Nada de cajas negras.
También hay una lección técnica que va más allá de las marcas. La eficiencia no la da solo el chip, sino la combinación de chip y software afinado para él. Que DeepSeek publique esa capa sugiere que el cuello de botella del entrenamiento de IA está tanto en el silicio como en lo que se escribe encima.
Qué vigilar después del lanzamiento abierto de DeepSeek
Para quien trabaja con IA, el siguiente paso es ver si otros equipos adoptan estos componentes y reportan resultados propios, en lugar de aceptar las cifras de DeepSeek. La prueba de fuego del código abierto es que terceros lo usen y lo midan. Sin eso, queda en promesa.
También queda por ver la evolución del propio conjunto. Si DeepSeek sigue publicando versiones para Ascend al mismo ritmo que para Nvidia, la paridad dejará de ser un anuncio y se convertirá en un hábito. Si pasa lo contrario, quedará como un gesto aislado. Todo depende de lo que venga después.
El software está disponible en los repositorios públicos de DeepSeek en GitHub, entre ellos DeepGEMM, DeepEP y FlashMLA, bajo el nombre que la compañía ha dado a cada pieza. Quien quiera entender cómo se entrena hoy un modelo grande encontrará ahí una ventana poco habitual a las tripas del proceso.






