비교인기

그록 4.7 vs 4.6, 같은 가격표에서 갈리는 성능과 지출

그록 4.7과 4.6은 API 단가가 같다. 하지만 코딩 에이전트 지수와 환각률에서 차이가 나고, 토큰 소비량도 달라 실제 지출은 벌어진다. 두 모델을 항목별로 비교했다.

Evan BrooksEvan Brooks
인기 지수: 980
Grok 4.7과 Grok 4.6 비교 이미지

그록 4.7과 그록 4.6은 API 단가가 같다. 그런데 실제 작업 비용은 같지 않다. 무엇이 달라졌고 어디서 갈리는지 짚었다.

한눈에 보는 두 모델

가격표만 놓고 보면 두 모델은 구분이 안 된다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 같다. 차이는 그 가격으로 무엇을 얼마나 해내는가에 있다.

항목

그록 4.6

그록 4.7

입력 / 출력 가격 (100만 토큰)

$2 / $6

$2 / $6

컨텍스트 창

50만 토큰

50만 토큰

지능 지수 (AAII)

44

46

코딩 에이전트 지수

47

56

AA 브리프케이스

1546

1657

환각률 (AA-Omniscience)

34%

29%

지식 정확도

48%

47%

같은 값, 다른 결과

지능 지수에서 그록 4.7은 46점으로 전작보다 2점 올랐다. 큰 폭은 아니다. 하지만 항목별로 뜯어보면 개선이 몰린 곳과 그렇지 않은 곳이 뚜렷하게 갈린다.

가장 크게 움직인 건 장시간 에이전트 작업이다. AA 브리프케이스에서 그록 4.7은 1657점으로 전작보다 111점 상승했다. 코딩 에이전트 지수는 47점에서 56점으로 9점 올랐다. 지능 지수가 2점 오르는 동안 이 두 항목이 크게 뛴 셈이다. 회사가 "더 큰 기반 모델과 더 긴 강화학습"이라고 설명한 방향이 숫자로 드러난 지점이다.

터미널-벤치의 엇갈린 수치

터미널 환경에서 여러 단계를 거쳐 문제를 푸는 터미널-벤치 4.0에서는 수치가 갈린다. 스페이스XAI가 공개한 자료에서는 그록 4.6이 20.3%에서 그록 4.7이 38.0%로 거의 두 배가 됐다. 반면 아티피셜 애널리시스의 독립 측정에서는 그록 4.7이 26%로 나왔다. 전작 대비 개선 폭은 4.5%포인트 수준이다.

전작 대비 개선이 뚜렷한 항목

  • 코딩 에이전트 지수: 47 → 56
  • AA 브리프케이스: 1546 → 1657
  • GDPval-AA: 1605 → 1695
  • 환각률: 34% → 29%

사실상 제자리인 항목

  • 지식 정확도: 48% → 47%
  • AA-LCR: 3.7%포인트 하락
  • 오토메이션벤치-AA: 1.1%포인트 하락

환각은 줄고 정확도는 그대로

아티피셜 애널리시스의 AA-Omniscience 평가에서 그록 4.7의 환각률은 최고 노력(high) 기준 29%로, 그록 4.6의 34%보다 낮아졌다. 반면 지식 정확도는 48%에서 47%로 사실상 변화가 없다. 종합 지수는 30에서 32로 올랐다.

환각률이 낮아졌는데 정확도가 그대로라는 조합은 해석할 여지가 있다. 모르는 것을 더 자주 인정하고 답을 내놓지 않는 쪽으로 움직였을 수 있다는 뜻이다. 확실하지 않은 질문에 답을 거부하는 비중이 늘면 정확도는 그대로여도 환각은 줄어든다.

실제 지출은 단가가 아니다

API 단가가 같아도 작업당 비용은 같지 않다. 아티피셜 애널리시스에 따르면 그록 4.7은 xhigh 설정에서 지능 지수 과제당 평균 약 8만1000개의 출력 토큰을 썼다. 그록 4.6은 high 설정에서 3만6000개였다. 같은 작업을 돌려도 토큰 소비가 두 배 이상 늘 수 있다는 뜻이다.

여기서 설정 차이를 감안해야 한다. 공개된 비교는 그록 4.7을 xhigh로, 그록 4.6을 high로 측정한 결과다. 추론 강도를 어느 쪽에 맞추느냐에 따라 두 모델의 값과 성능이 모두 달라진다. 단가표가 같다는 사실만으로 두 모델의 지출이 같다고 보기는 어렵다.

무엇을 기준으로 바꿀까

그록 4.6을 쓰고 있다면 전환 여부는 작업 성격이 정한다. 장시간 에이전트 작업, 코딩 자동화, 전문 지식 업무 비중이 높다면 4.7의 개선이 체감될 여지가 있다. 반대로 지식 정확도가 중요한 용도라면 두 모델의 차이가 거의 없으니 굳이 옮길 이유가 약하다.

비용은 따로 계산해야 한다. 단가가 같아도 토큰 소비가 늘면 실제 지출은 커질 수 있다. 전환 전에 같은 작업을 두 모델로 돌려 작업당 비용을 직접 비교해 보는 편이 안전하다. 그럼 두 모델을 어떻게 나눠 쓸까? 어떤 모델이 낫다기보다, 어떤 작업에 어느 쪽을 배치하느냐가 실제 결과와 비용을 가른다.

이 소식 공유하기

언급된 제품

출처

관련 AI 뉴스

xAI의 새 모델 Grok 4.7 이미지
AI 모델

그록 4.7 출시, 가격은 그대로 두고 기반 모델과 강화학습 키웠다

스페이스XAI가 2026년 9월 21일 그록 4.7을 출시했다. 가격은 그록 4.6과 같은 입력 2달러·출력 6달러이며, 더 큰 기반 모델과 긴 강화학습으로 장시간 작업을 겨냥했다.

인기 지수: 1,120
GPT-6 Sol과 GPT-6 Luna 비교 이미지
비교

GPT-6 솔과 루나, 20배 단가 차이가 만드는 실제 비용 격차

GPT-6 솔과 루나는 토큰 단가가 20배 차이다. 오토메이션벤치와 딥SWE 성적, 작업당 비용을 나란히 놓고 두 모델이 어디서 갈리는지 비교했다.

인기 지수: 1,050