코딩에 가장 좋은 LLM을 하나만 꼽으라는 질문은 함정이다. 어려운 버그 수정, 빠른 프로토타이핑, 비용 절감은 서로 다른 모델을 원한다. 작업별로 갈라서 보자.
코딩 평가는 벤치마크만으로 부족하다
먼저 코딩용 LLM의 성능을 무엇으로 재는지부터 정리하자. 코딩 AI 모델을 고를 때 흔히 코드 어시스턴트의 점수표를 먼저 본다. 하지만 그 점수만으로는 판단이 어렵다.
가장 널리 쓰이는 지표는 SWE-bench다. 실제 오픈소스 프로젝트의 버그 보고서를 주고, 모델이 코드를 고쳐 테스트를 통과하는지 본다. 통과율이 높다는 건 실제 저장소에서 문제를 해결할 능력이 있다는 뜻이다. 여기에 코드를 짜서 실행하는 라이브코드벤치(LiveCodeBench)와, 명령줄을 조작하는 터미널 벤치가 함께 쓰인다.
문제는 점수 출처가 갈린다는 점이다. 제조사 발표 점수와 독립 평가 기관 점수가 다르게 나온다. 같은 모델인데 추론 강도와 설정에 따라 결과가 달라지기 때문이다. 그래서 점수 하나만 보고 고르면 실망할 수 있다.
어려운 작업: 클로드 오퍼스 계열
깊은 버그 수정과 대규모 리팩터링에서는 앤스로픽의 클로드 오퍼스 계열이 앞선다.
SWE-bench 계열 평가에서 오퍼스는 최상위권 점수를 낸다. 어려운 코딩 아레나 대결에서도 강하다는 평가가 이어진다. 여러 파일에 걸친 수정이나 낯선 코드베이스 이해처럼, 맥락을 오래 붙들고 있어야 하는 작업에서 강점이 나온다.
가격은 백만 토큰당 입력 5달러, 출력 25달러 수준으로 알려졌다. 최상위 모델 중에서는 비교적 합리적인 편이다. 다만 점수는 계속 바뀌므로 최신 공식 자료를 확인하는 편이 좋다.
속도와 자동화: 오픈AI 코드 모델
빠른 반복과 자동화에서는 오픈AI의 코딩 특화 모델이 강하다.
명령줄이나 개발 환경에 붙어 스스로 명령을 실행하고 결과를 해석하는 흐름에서 앞선다는 평가가 있다. "명령 실행 → 출력 해석 → 다음 행동"이라는 고리를 잘 돈다는 뜻이다.
GPT-6 아스트라도 이 영역에 들어간다. 오픈AI는 아스트라가 소프트웨어 엔지니어링에서 최고 수준이라고 밝혔다. 다만 가격이 높아, 모든 코딩 작업에 쓰기에는 부담이 크다.
가성비와 오픈웨이트
비용을 낮추려면 선택지가 넓다.
구글 제미나이 3 계열은 낮은 토큰 단가로 상위권 성능을 낸다. 대량의 코드를 처리해야 하는 작업에서 유리하다. 딥시크와 지엘엠 같은 오픈웨이트 모델도 코딩 평가에서 상위권에 오른다. 가중치를 공개해 직접 돌릴 수 있어, 호출량이 많으면 비용을 크게 줄일 수 있다.
작업 유형 | 잘 맞는 쪽 | 이유 |
|---|---|---|
어려운 버그 수정 | 클로드 오퍼스 계열 | 긴 맥락 유지에 강함 |
자동화·명령줄 작업 | 오픈AI 코드·아스트라 | 실행 고리를 잘 돎 |
대량 처리 | 제미나이 3 계열 | 낮은 토큰 단가 |
비용 최소화 | 딥시크·지엘엠 | 자체 호스팅 가능 |
정답은 작업마다 다르다. 한 모델로 전부 해결하려 하면 어딘가에서 손해를 본다.
실제로 고를 때 보는 기준
점수표보다 실무에서 중요한 건 세 가지다.
첫째는 통합 환경이다. 내가 쓰는 편집기나 명령줄 도구에 붙는 모델인지 확인한다. 아무리 점수가 높아도 내 작업 흐름에 안 붙으면 쓰기 어렵다.
둘째는 비용 구조다. 토큰 단가와 자체 호스팅 비용을 함께 본다. 호출량이 적으면 API, 많으면 자체 호스팅이 유리해지는 지점이 있다.
셋째는 맥락 길이다. 큰 저장소를 통째로 넣어야 하는 작업이면 컨텍스트 창이 큰 모델을 골라야 한다. 창이 작으면 코드를 잘라 넣다가 맥락을 놓친다.
벤치마크가 놓치는 것
점수만 보면 실제 개발 경험을 놓친다.
같은 모델이라도 도구가 어떻게 감싸느냐에 따라 체감이 크게 갈린다. 실행 환경, 프롬프트 구성, 재시도 전략이 성능의 상당 부분을 좌우한다. 최신 연구에서도 모델 자체보다 이를 감싸는 구조가 결과에 큰 영향을 준다고 본다.
또 평가 문항이 실무와 닮지 않으면 점수는 의미가 없다. 사내 코드베이스와 오픈소스 저장소는 생김새가 다르다. 결국 내 저장소에서 몇 가지 실제 작업을 시켜 보는 것이 가장 정확한 판단 근거다.
정리: 하나가 아니라 조합이다
코딩에 가장 좋은 LLM은 작업마다 다르다. 어려운 수정에는 클로드 오퍼스, 자동화와 속도에는 오픈AI 코드 모델, 대량 처리와 비용에는 제미나이와 오픈웨이트 모델이 어울린다.
실무에서는 한 모델만 고집하기보다 두세 개를 용도별로 나눠 쓰는 편이 낫다. 지금 쓰는 모델로 가장 어려운 작업 하나를 시켜 보고, 실패하면 그 지점에 맞는 모델을 하나 더 추가하는 식으로 시작하면 된다.






