연구인기

딥시크, 화웨이 어센드용 AI 소프트웨어 전격 공개

딥시크가 2026년 9월 30일 화웨이 어센드 칩용 핵심 소프트웨어 묶음을 오픈소스로 공개했다. 엔비디아 플랫폼용 부품을 화웨이 환경에 1대 1로 맞춘 구성이 핵심이다.

김민준김민준
인기 지수: 1,450
화웨이 어센드 칩과 소프트웨어 스택을 상징하는 이미지

중국 AI 기업 딥시크(DeepSeek)가 2026년 9월 30일 화웨이 '어센드(Ascend)' 칩용 핵심 소프트웨어 묶음을 오픈소스로 공개했다. 엔비디아 플랫폼용으로 냈던 부품들을 화웨이 환경에 맞춰 1대 1로 옮긴 점이 눈에 띈다. 국산 AI 연산 생태계를 겨냥한 움직임을 기술 관점에서 짚어봤다.

딥시크가 9월 30일 공식 위챗 계정을 통해 화웨이 어센드 컴퓨팅 플랫폼용 핵심 인프라 소프트웨어를 오픈소스로 공개했다. 이번에 풀린 부품은 컴파일러, 행렬 연산 라이브러리, 분산 통신 라이브러리, 어텐션 연산자 등이다. 하나같이 AI 칩을 실제로 굴리는 데 필요한 '연장통'에 해당한다.

중요한 건 이 부품들이 새로운 발명품이 아니라는 점이다. 딥시크가 그동안 엔비디아 플랫폼 전용으로 내놨던 소프트웨어를 화웨이 환경에 맞게 다시 다듬은 것이다. 즉 한쪽 생태계에서 검증한 도구를 다른 쪽 생태계로 옮기는 작업이다. 이 글에서는 무엇이 공개됐고, 그게 어떤 의미인지를 중립적으로 살펴본다.

딥시크가 공개한 여섯 가지 구성 요소

이번 묶음의 핵심은 여섯 가지다. 각각이 무슨 역할을 하는지 알면 사안의 성격이 잡힌다.

타일랭(TileLang)은 고수준 프로그래밍 언어 컴파일러다. 쉽게 말해, 개발자가 쓴 코드를 화웨이 칩이 알아듣는 저수준 명령으로 번역해 주는 통역사 역할이다. 복잡한 코드를 비교적 간단하게 쓸 수 있게 해준다는 게 딥시크의 설명이다.

딥GEMM(DeepGEMM)은 행렬 연산 라이브러리다. AI 모델의 계산 대부분은 행렬 곱셈으로 이뤄지는데, 이걸 빠르게 처리하는 게 성능의 핵심이다. 딥EP(DeepEP)는 여러 장치가 데이터를 주고받는 대규모 분산 통신을 맡는다. 타일커널(TileKernels)은 벡터 연산과 메모리 접근을 다루는 저수준 연산자 모음이다.

여기에 플래시MLA(FlashMLA)가 있다. 긴 문서를 한 번에 읽는 초장문 컨텍스트 처리를 위한 희소 어텐션 연산자다. 딥셀렉트(DeepSelect)는 데이터를 효율적으로 골라내는 역할을 한다. 이 여섯 부품이 맞물려 AI 모델을 화웨이 칩 위에서 돌리는 기반이 된다.

엔비디아용 부품과 1대 1로 맞춘 구조

이번 공개에서 눈여겨볼 대목은 '대응'이라는 단어다. 딥시크가 이전에 엔비디아 플랫폼용으로 선보였던 주요 소프트웨어를 화웨이 환경에 맞춰 1대 1로 최적화한 모듈이라고 밝혔기 때문이다.

이 구조가 왜 중요할까? 소프트웨어 생태계를 옮기는 데 가장 큰 걸림돌은 개발자다. 개발자가 익숙한 도구와 똑같은 짝을 새 플랫폼에 만들어 주면, 코드를 크게 고치지 않고도 갈아탈 수 있다. 딥시크가 노리는 게 바로 이 지점이다.

타일랭의 설계 방식을 보면 의도가 더 분명하다. 기존 엔비디아 쿠다(CUDA) 환경과 비교해 코드 로직이 단순하다는 평가를 받는다. 화웨이의 저수준 명령어 집합인 '어센드 C'를 추상화해 감싸는 방식으로, 개발자가 세부 하드웨어를 몰라도 성능을 끌어올릴 수 있게 설계됐다.

성능 수치는 누구 주장인가

이번 발표에는 눈길을 끄는 성능 수치도 함께 나왔다. 딥GEMM 어센드 버전이 행렬 연산에서 하드웨어 한계의 99.8%에 도달했고, MegaMoE가 98%를 기록했다는 내용이다.

여기서 반드시 짚어야 할 점이 있다. 이 수치는 딥시크 측이 제시한 주장이며, 독립 기관이 검증한 값이 아니다. 벤치마크를 보고할 때는 '누가 쟀는가'가 늘 중요하다. 같은 하드웨어라도 측정 조건에 따라 결과가 달라지기 때문이다. 관심 있는 개발자라면 저장소의 실제 코드와 재현 가능한 수치를 직접 확인하는 편이 안전하다.

배경: 왜 지금 화웨이인가

이번 움직임은 수출 규제라는 배경과 떼어놓고 보기 어렵다. 엔비디아의 첨단 반도체 수급이 막히면서, 중국 기술 생태계가 자체 소프트웨어 인프라를 강화하는 방향으로 움직여 왔다. 하드웨어를 못 사면, 있는 하드웨어를 최대한 끌어올리는 소프트웨어로 승부를 걸 수밖에 없다.

협력은 이미 진행 중이었다. 딥시크의 타일랭은 지난 4월 공개된 '딥시크-V4'의 주요 연산자 구현에 쓰였고, 최근에는 내몽골 지역에 화웨이 어센드 950DT 칩 16만 대를 투입해 대규모 추론 클러스터를 함께 구축하는 방안도 구체화하고 있다. 화웨이도 초장문 컨텍스트 연산을 지원하려고 어센드 950 기반 슈퍼노드 솔루션을 내놓는 등 소프트웨어와 하드웨어 연결 작업을 해 왔다.

딥시크는 이번 공개의 목적을 "독자적이고 자율 제어가 가능한 차세대 GPU 소프트웨어 생태계" 조성이라고 밝혔다. 하드웨어 잠재력을 한계까지 끌어올리면서도 누구나 다루기 쉬운 고수준 언어가 필요하다는 논리다.

개발자에게 무엇을 바꾸나

실질적인 변화는 개발자의 선택지에 있다. 지금 AI 연산 소프트웨어는 대부분 엔비디아 환경에 맞춰져 있다. 화웨이 어센드용 도구가 갖춰지면, 특정 해외 반도체 제조사 생태계에 묶이지 않고 다른 하드웨어에서도 AI 연산 노드를 운영할 여지가 생긴다.

공개된 것

  • 타일랭 컴파일러, 딥GEMM, 딥EP
  • 타일커널, 플래시MLA, 딥셀렉트
  • 엔비디아용 부품과 1대 1 대응 구조

아직 확인이 필요한 것

  • 딥GEMM 99.8%, MegaMoE 98% 성능의 독립 검증
  • 실제 서비스 환경에서의 안정성
  • 다른 모델로의 확장성

물론 갈 길은 멀다. 엔비디아의 쿠다 생태계는 수년간 쌓인 라이브러리와 개발자 기반을 갖고 있다. 오픈소스 몇 개를 풀었다고 판도가 바로 바뀌진 않는다. 이번 공개는 그 격차를 좁히는 첫 단추에 가깝다.

지켜볼 지점

관전 포인트는 세 가지다. 첫째, 제3자 개발자가 이 도구들을 실제로 채택하는지다. 오픈소스는 코드를 공개하는 것보다 쓰이게 하는 게 어렵다. 둘째, 성능 수치가 독립적으로 재현되는지다. 셋째, 이 인프라가 딥시크 외 다른 모델에도 열려 있는지다.

개발자라면 저장소를 직접 열어 코드 품질과 문서를 확인해 볼 만하다. 일반 사용자에게는 당장 체감할 변화가 없지만, AI 서비스 가격과 공급이 어디에 기대는지에 관심 있다면 이 흐름이 나중에 요금표로 이어질 수 있다.

이 소식 공유하기

출처

관련 AI 뉴스

LLM 평가 도구 비교: 무엇으로 성능을 재야 할까
연구

LLM 평가 도구 비교: 무엇으로 성능을 재야 할까

LLM 평가 도구는 오프라인 평가와 운영 추적으로 나뉜다. 딥이밸·프롬프트푸·라가스 같은 코드 우선 도구와 랭퓨즈·랭스미스·브레인트러스트의 차이, 자체 평가 세트 만드는 절차를 정리했다.

인기 지수: 1,080
LLM은 무엇의 약자일까? 초보자를 위한 대규모 언어 모델 기초
연구

LLM은 무엇의 약자일까? 초보자를 위한 대규모 언어 모델 기초

LLM은 대규모 언어 모델(Large Language Model)의 약자다. 다음 단어를 고르는 원리, 트랜스포머와 어텐션, 토큰과 컨텍스트 창, 학습 3단계, 환각이 생기는 이유까지 처음 접하는 사람 눈높이로 정리했다.

인기 지수: 1,180
AI 모델 배포, 데모와 운영 사이에서 무너지는 지점
연구

AI 모델 배포, 데모와 운영 사이에서 무너지는 지점

AI 모델 배포는 지연 시간, 추론 비용, 품질 유지, 환각 위험, 규제 대응이 한꺼번에 몰리는 작업이다. 데모가 운영에서 무너지는 이유와 각 과제를 다루는 방법을 정리했다.

인기 지수: 1,010
RAG 모델이란? 검색 증강 생성의 원리와 한계
연구

RAG 모델이란? 검색 증강 생성의 원리와 한계

RAG는 모델이 답을 만들기 전에 외부 문서를 먼저 검색하는 구조다. 파인튜닝과의 차이, 검색과 생성의 흐름, 색인과 청킹이 품질을 좌우하는 이유, 그리고 RAG가 맞는 상황과 한계를 정리했다.

인기 지수: 1,120