중국 AI 기업 딥시크(DeepSeek)가 2026년 9월 30일 화웨이 '어센드(Ascend)' 칩용 핵심 소프트웨어 묶음을 오픈소스로 공개했다. 엔비디아 플랫폼용으로 냈던 부품들을 화웨이 환경에 맞춰 1대 1로 옮긴 점이 눈에 띈다. 국산 AI 연산 생태계를 겨냥한 움직임을 기술 관점에서 짚어봤다.
딥시크가 9월 30일 공식 위챗 계정을 통해 화웨이 어센드 컴퓨팅 플랫폼용 핵심 인프라 소프트웨어를 오픈소스로 공개했다. 이번에 풀린 부품은 컴파일러, 행렬 연산 라이브러리, 분산 통신 라이브러리, 어텐션 연산자 등이다. 하나같이 AI 칩을 실제로 굴리는 데 필요한 '연장통'에 해당한다.
중요한 건 이 부품들이 새로운 발명품이 아니라는 점이다. 딥시크가 그동안 엔비디아 플랫폼 전용으로 내놨던 소프트웨어를 화웨이 환경에 맞게 다시 다듬은 것이다. 즉 한쪽 생태계에서 검증한 도구를 다른 쪽 생태계로 옮기는 작업이다. 이 글에서는 무엇이 공개됐고, 그게 어떤 의미인지를 중립적으로 살펴본다.
딥시크가 공개한 여섯 가지 구성 요소
이번 묶음의 핵심은 여섯 가지다. 각각이 무슨 역할을 하는지 알면 사안의 성격이 잡힌다.
타일랭(TileLang)은 고수준 프로그래밍 언어 컴파일러다. 쉽게 말해, 개발자가 쓴 코드를 화웨이 칩이 알아듣는 저수준 명령으로 번역해 주는 통역사 역할이다. 복잡한 코드를 비교적 간단하게 쓸 수 있게 해준다는 게 딥시크의 설명이다.
딥GEMM(DeepGEMM)은 행렬 연산 라이브러리다. AI 모델의 계산 대부분은 행렬 곱셈으로 이뤄지는데, 이걸 빠르게 처리하는 게 성능의 핵심이다. 딥EP(DeepEP)는 여러 장치가 데이터를 주고받는 대규모 분산 통신을 맡는다. 타일커널(TileKernels)은 벡터 연산과 메모리 접근을 다루는 저수준 연산자 모음이다.
여기에 플래시MLA(FlashMLA)가 있다. 긴 문서를 한 번에 읽는 초장문 컨텍스트 처리를 위한 희소 어텐션 연산자다. 딥셀렉트(DeepSelect)는 데이터를 효율적으로 골라내는 역할을 한다. 이 여섯 부품이 맞물려 AI 모델을 화웨이 칩 위에서 돌리는 기반이 된다.
엔비디아용 부품과 1대 1로 맞춘 구조
이번 공개에서 눈여겨볼 대목은 '대응'이라는 단어다. 딥시크가 이전에 엔비디아 플랫폼용으로 선보였던 주요 소프트웨어를 화웨이 환경에 맞춰 1대 1로 최적화한 모듈이라고 밝혔기 때문이다.
이 구조가 왜 중요할까? 소프트웨어 생태계를 옮기는 데 가장 큰 걸림돌은 개발자다. 개발자가 익숙한 도구와 똑같은 짝을 새 플랫폼에 만들어 주면, 코드를 크게 고치지 않고도 갈아탈 수 있다. 딥시크가 노리는 게 바로 이 지점이다.
타일랭의 설계 방식을 보면 의도가 더 분명하다. 기존 엔비디아 쿠다(CUDA) 환경과 비교해 코드 로직이 단순하다는 평가를 받는다. 화웨이의 저수준 명령어 집합인 '어센드 C'를 추상화해 감싸는 방식으로, 개발자가 세부 하드웨어를 몰라도 성능을 끌어올릴 수 있게 설계됐다.
성능 수치는 누구 주장인가
이번 발표에는 눈길을 끄는 성능 수치도 함께 나왔다. 딥GEMM 어센드 버전이 행렬 연산에서 하드웨어 한계의 99.8%에 도달했고, MegaMoE가 98%를 기록했다는 내용이다.
여기서 반드시 짚어야 할 점이 있다. 이 수치는 딥시크 측이 제시한 주장이며, 독립 기관이 검증한 값이 아니다. 벤치마크를 보고할 때는 '누가 쟀는가'가 늘 중요하다. 같은 하드웨어라도 측정 조건에 따라 결과가 달라지기 때문이다. 관심 있는 개발자라면 저장소의 실제 코드와 재현 가능한 수치를 직접 확인하는 편이 안전하다.
배경: 왜 지금 화웨이인가
이번 움직임은 수출 규제라는 배경과 떼어놓고 보기 어렵다. 엔비디아의 첨단 반도체 수급이 막히면서, 중국 기술 생태계가 자체 소프트웨어 인프라를 강화하는 방향으로 움직여 왔다. 하드웨어를 못 사면, 있는 하드웨어를 최대한 끌어올리는 소프트웨어로 승부를 걸 수밖에 없다.
협력은 이미 진행 중이었다. 딥시크의 타일랭은 지난 4월 공개된 '딥시크-V4'의 주요 연산자 구현에 쓰였고, 최근에는 내몽골 지역에 화웨이 어센드 950DT 칩 16만 대를 투입해 대규모 추론 클러스터를 함께 구축하는 방안도 구체화하고 있다. 화웨이도 초장문 컨텍스트 연산을 지원하려고 어센드 950 기반 슈퍼노드 솔루션을 내놓는 등 소프트웨어와 하드웨어 연결 작업을 해 왔다.
딥시크는 이번 공개의 목적을 "독자적이고 자율 제어가 가능한 차세대 GPU 소프트웨어 생태계" 조성이라고 밝혔다. 하드웨어 잠재력을 한계까지 끌어올리면서도 누구나 다루기 쉬운 고수준 언어가 필요하다는 논리다.
개발자에게 무엇을 바꾸나
실질적인 변화는 개발자의 선택지에 있다. 지금 AI 연산 소프트웨어는 대부분 엔비디아 환경에 맞춰져 있다. 화웨이 어센드용 도구가 갖춰지면, 특정 해외 반도체 제조사 생태계에 묶이지 않고 다른 하드웨어에서도 AI 연산 노드를 운영할 여지가 생긴다.
공개된 것
- 타일랭 컴파일러, 딥GEMM, 딥EP
- 타일커널, 플래시MLA, 딥셀렉트
- 엔비디아용 부품과 1대 1 대응 구조
아직 확인이 필요한 것
- 딥GEMM 99.8%, MegaMoE 98% 성능의 독립 검증
- 실제 서비스 환경에서의 안정성
- 다른 모델로의 확장성
물론 갈 길은 멀다. 엔비디아의 쿠다 생태계는 수년간 쌓인 라이브러리와 개발자 기반을 갖고 있다. 오픈소스 몇 개를 풀었다고 판도가 바로 바뀌진 않는다. 이번 공개는 그 격차를 좁히는 첫 단추에 가깝다.
지켜볼 지점
관전 포인트는 세 가지다. 첫째, 제3자 개발자가 이 도구들을 실제로 채택하는지다. 오픈소스는 코드를 공개하는 것보다 쓰이게 하는 게 어렵다. 둘째, 성능 수치가 독립적으로 재현되는지다. 셋째, 이 인프라가 딥시크 외 다른 모델에도 열려 있는지다.
개발자라면 저장소를 직접 열어 코드 품질과 문서를 확인해 볼 만하다. 일반 사용자에게는 당장 체감할 변화가 없지만, AI 서비스 가격과 공급이 어디에 기대는지에 관심 있다면 이 흐름이 나중에 요금표로 이어질 수 있다.






