구글의 새 플래그십 모델이 정말 나왔다. 서류상으로는 큰 도약이다. 그런데 아직 대부분은 쓸 수 없고, 독립 평가 점수는 발표 자료보다 훨씬 엇갈린다.
구글이 공개한 제미나이 4 아르곤의 실체
9월 30일, 구글이 제미나이 4 아르곤을 세상에 내놨다. 제미나이 4 시리즈의 첫 모델이자, 지난 2월 제미나이 3.1 프로 이후 구글이 처음 선보인 진정한 플래그십이기도 하다. 구글 블로그는 이 모델을 "프런티어 지능의 다음 시대"라고 소개했고, 겨냥한 작업은 길고 복잡한 업무다. 소프트웨어 엔지니어링, 법률·금융 리서치, 창의적 글쓰기, 그리고 사이버 보안 방어가 그 목록에 들어간다.
아르곤은 추론 모델이다. 답을 내기 전에 문제를 단계별로 따져가며 푸는 방식이다. 구글에 따르면 한 번에 최대 100만 토큰의 문맥을 기억하고, 한 응답에서 100만 토큰까지 써낼 수 있다. 앞선 제미나이 모델들의 출력이 대략 6만 4000토큰에서 막혔던 것과 비교하면 껑충 뛴 수치다.
이 출력 한도는 생각보다 실용적이다. AI에게 긴 문서를 쓰게 했을 때 중간에 멈춰버린 경험이 있다면 아는 얘기다. 모델이 큰 결과물을 만들 때 이런 일이 의외로 자주 벌어진다. 100만 토큰이라는 천장은 벽이라기보다 아주 긴 활주로에 가깝다.
이름도 새롭다. 예전 제미나이 모델은 프로와 플래시로 나뉘었다. 아르곤은 오픈AI가 자사 모델에 붙이는 방식에 더 가까운 코드네임형 이름이다. 나머지 제미나이 4 패밀리는 뭐라고 불리고 언제 나올까? 구글은 이 질문에 답하지 않았다.
지금 제미나이 4 아르곤을 쓸 수 있는 사람과 없는 사람
대부분에게 답답한 부분은 여기다. 당장은 못 쓴다.
아르곤은 구글이 '페어윈드 프로그램'이라 부르는, 검증된 사이버 보안 방어자 그룹에만 우선 풀렸다. 소프트웨어 결함을 찾아내는 능력이 유난히 뛰어난 모델을, 나머지 세상보다 먼저 그 결함을 고치는 사람들에게 쥐여주겠다는 발상이다. 구글은 미국 정부와 출시 전 안전성 평가도 진행 중이라고 밝혔다.
다음 차례는 유료 API 고객과 구글 AI 울트라 구독자다. 구글은 두 쪽 모두 날짜를 제시하지 않았다. 공개 API 모델 ID조차 없어서, 자기 코드로 이 모델을 호출할 수도 없다.
일반 제미나이 사용자라면 결론은 간단하다. 오늘 달라지는 건 없다. 아르곤은 보안이라는 좁은 영역을 겨냥한 프리뷰다.
구글 내부에서는 아르곤이 이미 일하고 있다
구글은 모델 성능만 측정한 게 아니다. 자사 업무에 실제로 투입했고, 그 사례가 발표 자료에서 가장 구체적인 대목이다.
구글 데이터센터에서 아르곤은 메모리를 확보할 방법을 찾는 작업을 맡았다. 구글은 이 모델이 새 하드웨어를 사들이지 않고도 수백 테라바이트의 메모리를 확보할 최적화를 찾아냈다고 밝혔다. 양자 컴퓨팅 연구진도 자기네 문제에 아르곤을 돌려봤다.
메모리를 비우는 일은 화려하지 않다. 하지만 모델이 도움이 되거나, 아니면 모두의 시간을 낭비하게 만드는 종류의 작업이다. 수백 테라바이트 확보는 데모가 아니라 측정 가능한 결과다.
구글이 고른 제미나이 4 아르곤 벤치마크
구글 자체 수치는 강하다. 회사는 아르곤이 실제 소프트웨어 엔지니어링 벤치마크에서 신기록을 세웠고, 사이버 보안 부문에서 공동 1위에 올랐으며, 금융·법률 등 전문 업무 성능을 재는 테스트에서도 선두에 섰다고 밝혔다.
구글이 돌린 18개 벤치마크 가운데 아르곤은 12개에서 앞섰고 1개에서 공동 1위였다. 실제 결과임에는 틀림없고, 이게 임시방편이 아니라 진지한 프런티어 모델이라는 주장과도 맞아떨어진다.
다만 출처를 기억하자. 구글이 고르고 구글이 돌린 벤치마크다. 회사 자체 성적표에서의 선두와 공동 1위는 출발점이지, 최종 결론이 아니다.
독립 평가가 다른 이야기를 하는 이유
그럼 독립 평가는 왜 다른 말을 할까. 잠깐 속도를 늦춰 볼 만한 대목이다.
모델을 직접 맞붙여 시험하는 독립 기관 인공지능 분석(Artificial Analysis)은 제미나이 4 아르곤의 지능 지수(Intelligence Index)를 53점으로 매겼다. 일부 초기 측정에서는 52.6점이 나왔다. 제미나이 3.1 프로의 30점에서 크게 오른 점수다. 하지만 클로드 오푸스 5.5의 57.6점에는 못 미치고, GPT-6 아스트라·클로드 페이블 5.1과는 비슷한 수준이다.
세부 테스트에서도 갈린다. 아르곤은 까다로운 코딩 벤치마크인 딥SWE v1.1에서 77.9%를 기록했고 발스 지수에서 1위에 올랐다. 반면 터미널벤치 4.0에서는 클로드 오푸스 5.5에 66.4% 대 57.4%로 밀렸고, 프런티어SWE v2에서는 GPT-6 아스트라에 65.5% 대 55.0%로 뒤졌다.
아르곤에 유리한 독립 결과도 하나 있다. 인공지능 분석은 아르곤이 주요 모델 가운데 가장 낮은 환각률을 기록했다고 측정했다. 자신 있게 틀린 답에 데인 적이 있는 사람이라면, 이게 여기서 가장 쓸모 있는 숫자일지도 모른다.
제미나이 4 아르곤이 앞서는 지점
- 어려운 코딩 벤치마크 딥SWE v1.1에서 77.9%
- 발스 지수와 LMArena 텍스트 아레나 1위
- 인공지능 분석이 측정한 주요 모델 중 최저 환각률
- 구글 자체 성적표 18개 중 12개 선두
제미나이 4 아르곤이 뒤지는 지점
- 인공지능 분석 지능 지수 53 대 클로드 오푸스 5.5의 57.6
- 터미널벤치 4.0: 57.4% 대 오푸스 5.5의 66.4%
- 프런티어SWE v2: 55.0% 대 GPT-6 아스트라의 65.5%
- 블룸버그, 실제 코딩 성능에 대한 구글 내부 회의론 보도
블룸버그는 벤치마크 점수와 달리 아르곤이 실제 코딩 작업에서 어려움을 겪는다고 보는 구글 직원들이 있다고 보도했다. 확인되지 않은 내부 시각이지만, 승리만 인용한 발표 자료를 견제하는 데는 유용하다. 벤더의 칭찬과 외부 결과가 반드시 일치할 필요는 없고, 여기서는 실제로 어긋난다.
제미나이 4 아르곤의 가격
구글은 아르곤을 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러의 도입가로 내놨다. 캐시된 입력은 100만 토큰당 0.10달러다.
50% 할인이다. 정가는 4달러와 20달러로, 클로드 오푸스 5.5와 비슷한 수준이다. 구글은 할인 종료 시점을 밝히지 않았다. 저렴한 요금제는 출시 기간 한정이지 영구적이지 않다.
API 위에서 개발하는 사람에게 이건 중요하다. 오늘 싸게 프로토타입을 만든 모델이 어느 날 갑자기 두 배가 될 수 있고, 사전 경고는 거의 없을 것이다. 정가를 기준으로 예산을 잡고, 할인은 지속되는 동안 누리는 보너스로 보는 게 낫다.
제미나이 4 아르곤과 더 큰 경쟁
이번 출시는 순다르 피차이 CEO가 백악관에서 다른 기술 리더들과 함께 자발적 AI 안전 협약에 서명한 다음 날 나왔다. 구글은 공개 출시 전에 오용과 프롬프트 인젝션 등 네 가지 사이버 보안 영역의 안전장치를 확대하고 싶다고 밝혔다.
아르곤이 등장하는 방식에는 실제로 긴장이 깔려 있다. 좁은 보안 그룹에 먼저 풀리고, 공개 날짜도 없는 구글의 프런티어 탈환 시도다. 한때 모든 사람에게 모델을 한꺼번에 내놨던 회사치고는 조심스러운 행보다.
그래서 실제로 뭘 기억해야 할까. 개발자라면 아르곤은 주목할 가치가 있다. 가격과 문맥 창이 실제로 경쟁력이 있고, 접근도 다가오고 있기 때문이다. 가볍게 쓰는 사용자라면 이번 주에 달라지는 건 없다. 벤치마크 경쟁을 따라가는 사람이라면 두 성적표를 분리해서 봐야 한다. 구글 자체의 '18개 중 12개 선두'와, 여전히 오푸스 5.5를 앞세우는 독립 지수가 그것이다. 둘 다 동시에 사실이다.






