그록 4.7과 그록 4.6은 API 단가가 같다. 그런데 실제 작업 비용은 같지 않다. 무엇이 달라졌고 어디서 갈리는지 짚었다.
한눈에 보는 두 모델
가격표만 놓고 보면 두 모델은 구분이 안 된다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 같다. 차이는 그 가격으로 무엇을 얼마나 해내는가에 있다.
항목 | 그록 4.6 | 그록 4.7 |
|---|---|---|
입력 / 출력 가격 (100만 토큰) | $2 / $6 | $2 / $6 |
컨텍스트 창 | 50만 토큰 | 50만 토큰 |
지능 지수 (AAII) | 44 | 46 |
코딩 에이전트 지수 | 47 | 56 |
AA 브리프케이스 | 1546 | 1657 |
환각률 (AA-Omniscience) | 34% | 29% |
지식 정확도 | 48% | 47% |
같은 값, 다른 결과
지능 지수에서 그록 4.7은 46점으로 전작보다 2점 올랐다. 큰 폭은 아니다. 하지만 항목별로 뜯어보면 개선이 몰린 곳과 그렇지 않은 곳이 뚜렷하게 갈린다.
가장 크게 움직인 건 장시간 에이전트 작업이다. AA 브리프케이스에서 그록 4.7은 1657점으로 전작보다 111점 상승했다. 코딩 에이전트 지수는 47점에서 56점으로 9점 올랐다. 지능 지수가 2점 오르는 동안 이 두 항목이 크게 뛴 셈이다. 회사가 "더 큰 기반 모델과 더 긴 강화학습"이라고 설명한 방향이 숫자로 드러난 지점이다.
터미널-벤치의 엇갈린 수치
터미널 환경에서 여러 단계를 거쳐 문제를 푸는 터미널-벤치 4.0에서는 수치가 갈린다. 스페이스XAI가 공개한 자료에서는 그록 4.6이 20.3%에서 그록 4.7이 38.0%로 거의 두 배가 됐다. 반면 아티피셜 애널리시스의 독립 측정에서는 그록 4.7이 26%로 나왔다. 전작 대비 개선 폭은 4.5%포인트 수준이다.
전작 대비 개선이 뚜렷한 항목
- 코딩 에이전트 지수: 47 → 56
- AA 브리프케이스: 1546 → 1657
- GDPval-AA: 1605 → 1695
- 환각률: 34% → 29%
사실상 제자리인 항목
- 지식 정확도: 48% → 47%
- AA-LCR: 3.7%포인트 하락
- 오토메이션벤치-AA: 1.1%포인트 하락
환각은 줄고 정확도는 그대로
아티피셜 애널리시스의 AA-Omniscience 평가에서 그록 4.7의 환각률은 최고 노력(high) 기준 29%로, 그록 4.6의 34%보다 낮아졌다. 반면 지식 정확도는 48%에서 47%로 사실상 변화가 없다. 종합 지수는 30에서 32로 올랐다.
환각률이 낮아졌는데 정확도가 그대로라는 조합은 해석할 여지가 있다. 모르는 것을 더 자주 인정하고 답을 내놓지 않는 쪽으로 움직였을 수 있다는 뜻이다. 확실하지 않은 질문에 답을 거부하는 비중이 늘면 정확도는 그대로여도 환각은 줄어든다.
실제 지출은 단가가 아니다
API 단가가 같아도 작업당 비용은 같지 않다. 아티피셜 애널리시스에 따르면 그록 4.7은 xhigh 설정에서 지능 지수 과제당 평균 약 8만1000개의 출력 토큰을 썼다. 그록 4.6은 high 설정에서 3만6000개였다. 같은 작업을 돌려도 토큰 소비가 두 배 이상 늘 수 있다는 뜻이다.
여기서 설정 차이를 감안해야 한다. 공개된 비교는 그록 4.7을 xhigh로, 그록 4.6을 high로 측정한 결과다. 추론 강도를 어느 쪽에 맞추느냐에 따라 두 모델의 값과 성능이 모두 달라진다. 단가표가 같다는 사실만으로 두 모델의 지출이 같다고 보기는 어렵다.
무엇을 기준으로 바꿀까
그록 4.6을 쓰고 있다면 전환 여부는 작업 성격이 정한다. 장시간 에이전트 작업, 코딩 자동화, 전문 지식 업무 비중이 높다면 4.7의 개선이 체감될 여지가 있다. 반대로 지식 정확도가 중요한 용도라면 두 모델의 차이가 거의 없으니 굳이 옮길 이유가 약하다.
비용은 따로 계산해야 한다. 단가가 같아도 토큰 소비가 늘면 실제 지출은 커질 수 있다. 전환 전에 같은 작업을 두 모델로 돌려 작업당 비용을 직접 비교해 보는 편이 안전하다. 그럼 두 모델을 어떻게 나눠 쓸까? 어떤 모델이 낫다기보다, 어떤 작업에 어느 쪽을 배치하느냐가 실제 결과와 비용을 가른다.





