2026년 9월 기준으로 가장 강한 모델은 무엇일까. 한 모델이 모든 항목을 독식하는 그림은 아니다. 코딩, 추론, 가격, 창의성에서 1위가 각각 다르다.
AI 모델 순위를 한 장으로 보면
먼저 큰 그림부터 잡자. 오픈AI의 GPT-6 아스트라가 최상위 구간에 올랐고, 앤스로픽의 클로드 계열이 코딩에서 앞선다. 구글 제미나이 3 계열은 가격 대비 성능으로 상위권을 지킨다. xAI 그록과 중국 진영의 딥시크, 지엘엠(GLM)도 특정 영역에서 이름을 올린다.
이 순위는 고정이 아니다. 등급 이름과 점수가 몇 달 단위로 바뀐다. 그래서 순위 자체보다 "어떤 축에서 앞서는가"를 보는 편이 오래 쓸모 있다.
최상위 구간: GPT-6 아스트라
GPT-6 아스트라는 2026년 9월 3일 제한 공개, 다음 날 일반 공개로 나왔다. 오픈AI는 이 모델을 자사 최고 성능이자 가장 정렬된 모델로 소개한다.
숫자 몇 개만 짚어 보자. 오픈AI 발표에 따르면 아스트라는 ARC-AGI-3에서 99.9%, 수학 벤치마크인 FrontierMath 4단계에서 98%를 기록했다. 컴퓨터 조작과 브라우저 사용 능력을 재는 평가에서도 최상단에 올랐다. 다만 이 수치들은 대부분 오픈AI 자체 발표이며, 독립 검증은 일부 항목에 한정된다.
가격은 최상위 등급답게 높다. 백만 토큰당 입력 10달러, 출력 50달러로 책정됐다. 컨텍스트 창은 약 105만 토큰이다.
코딩에서 앞서는 클로드
코딩만 놓고 보면 앤스로픽의 클로드 계열이 강하다. 실제 버그 수정 능력을 재는 SWE-bench 계열 평가에서 클로드 오퍼스가 상위권을 차지한다.
다만 여기서도 점수는 출처마다 갈린다. 제조사가 공개한 점수와 제3자 평가 기관의 점수가 다르게 나오는 경우가 흔하다. 같은 모델인데 평가에 쓰인 설정, 추론 강도, 문항 수에 따라 결과가 달라지기 때문이다.
코딩 모델을 고를 때는 점수 하나보다 "내가 쓰는 환경에서 어떤 도구로 붙는가"를 보는 편이 낫다. 통합 개발 환경에 붙는지, 명령줄 도구로 쓰는지에 따라 체감이 크게 갈린다.
가격 대비 성능: 제미나이와 오픈소스 진영
가성비 축에서는 구글이 앞선다. 제미나이 3 계열은 최상위 구간에 비해 낮은 토큰 단가를 유지한다. 백만 토큰당 2달러대에서 상위 모델급 성능을 내는 항목이 있다.
오픈소스 진영도 만만치 않다. 가중치를 공개한 모델 중에서는 지엘엠(GLM)과 키미(Kimi), 딥시크 계열이 독립 평가 기관 지표에서 상위에 오른다. 이들은 직접 서버에 올려 돌릴 수 있어 비용 구조가 다르다.
축 | 앞서는 쪽 | 대략적인 특징 |
|---|---|---|
컴퓨터 조작·추론 | GPT-6 아스트라 | 최상위 성능, 높은 가격 |
코딩 | 클로드 오퍼스 계열 | 버그 수정 평가에서 강세 |
가성비 | 제미나이 3 계열 | 낮은 토큰 단가 |
자체 호스팅 | 지엘엠·키미·딥시크 | 가중치 공개, 비용 통제 가능 |
이 표는 절대 순위가 아니라 축별 강점 정리다. 어느 모델도 모든 축을 동시에 이기지 않는다.
순위표를 곧이곧대로 믿으면 안 되는 이유
벤치마크 점수는 조건이 붙는다. 이 조건을 모르면 순위가 오해를 부른다.
첫째는 출처다. 제조사 발표 점수는 자사 모델에 유리한 설정으로 측정되는 경우가 있다. 독립 기관이 같은 모델을 재측정하면 몇 점 차이가 나기도 한다.
둘째는 오염 문제다. 학습 데이터에 평가 문항이 섞이면, 모델은 이해해서 맞힌 게 아니라 외워서 맞힌 것일 수 있다. 새 벤치마크일수록 시간이 지나며 점수가 부풀려지는 경향이 있다.
셋째는 설정 차이다. 같은 모델도 추론을 얼마나 쓰느냐에 따라 점수가 달라진다. 최고 점수를 낸 설정이 내가 쓰는 기본 설정과 다를 수 있다.
내게 맞는 모델을 고르는 법
순위표에서 답을 찾으려 하면 헤맨다. 대신 내 작업을 기준으로 추리는 편이 빠르다.
무엇을 가장 많이 시킬지 먼저 정한다. 코딩이면 클로드 계열, 컴퓨터를 대신 조작하는 자동화면 최상위 모델, 일상 대화와 요약이면 가성비 모델이면 충분하다.
비용을 따진다. API로 쓰면 토큰 단가가 곧 지출이다. 무료 한도로 충분한지, 유료 구독이 필요한지, 자체 호스팅이 가능한지를 순서대로 본다.
마지막으로 직접 시험한다. 순위 1위 모델이 내 업무에서 1위라는 보장은 없다. 내 자료로 몇 가지 작업을 시켜 보고 판단하는 것이 가장 정확하다.
정리: 1위는 하나가 아니다
2026년 최고의 LLM은 한 모델로 정해지지 않는다. 최상위 성능은 GPT-6 아스트라, 코딩은 클로드, 가성비는 제미나이와 오픈소스 진영으로 축이 나뉜다.
고르는 순서는 단순하다. 내 작업이 무엇인지 정하고, 그 축에서 앞서는 모델 몇 개를 추린 뒤, 내 자료로 직접 비교한다. 순위표는 후보를 좁히는 데까지만 쓰면 된다.






