AI 모델인기

제미나이 4 아르곤 완전 정리: 구글의 새 프런티어 모델

구글의 새 플래그십 모델이 정말 나왔다. 서류상으로는 큰 도약이다. 그런데 아직 대부분은 쓸 수 없고, 독립 평가 점수는 발표 자료보다 훨씬 엇갈린다.

김민준김민준
인기 지수: 1,250
제미나이 4 아르곤을 상징하는 추상적인 프런티어 AI 모델 이미지

구글의 새 플래그십 모델이 정말 나왔다. 서류상으로는 큰 도약이다. 그런데 아직 대부분은 쓸 수 없고, 독립 평가 점수는 발표 자료보다 훨씬 엇갈린다.

구글이 공개한 제미나이 4 아르곤의 실체

9월 30일, 구글이 제미나이 4 아르곤을 세상에 내놨다. 제미나이 4 시리즈의 첫 모델이자, 지난 2월 제미나이 3.1 프로 이후 구글이 처음 선보인 진정한 플래그십이기도 하다. 구글 블로그는 이 모델을 "프런티어 지능의 다음 시대"라고 소개했고, 겨냥한 작업은 길고 복잡한 업무다. 소프트웨어 엔지니어링, 법률·금융 리서치, 창의적 글쓰기, 그리고 사이버 보안 방어가 그 목록에 들어간다.

아르곤은 추론 모델이다. 답을 내기 전에 문제를 단계별로 따져가며 푸는 방식이다. 구글에 따르면 한 번에 최대 100만 토큰의 문맥을 기억하고, 한 응답에서 100만 토큰까지 써낼 수 있다. 앞선 제미나이 모델들의 출력이 대략 6만 4000토큰에서 막혔던 것과 비교하면 껑충 뛴 수치다.

이 출력 한도는 생각보다 실용적이다. AI에게 긴 문서를 쓰게 했을 때 중간에 멈춰버린 경험이 있다면 아는 얘기다. 모델이 큰 결과물을 만들 때 이런 일이 의외로 자주 벌어진다. 100만 토큰이라는 천장은 벽이라기보다 아주 긴 활주로에 가깝다.

이름도 새롭다. 예전 제미나이 모델은 프로와 플래시로 나뉘었다. 아르곤은 오픈AI가 자사 모델에 붙이는 방식에 더 가까운 코드네임형 이름이다. 나머지 제미나이 4 패밀리는 뭐라고 불리고 언제 나올까? 구글은 이 질문에 답하지 않았다.

지금 제미나이 4 아르곤을 쓸 수 있는 사람과 없는 사람

대부분에게 답답한 부분은 여기다. 당장은 못 쓴다.

아르곤은 구글이 '페어윈드 프로그램'이라 부르는, 검증된 사이버 보안 방어자 그룹에만 우선 풀렸다. 소프트웨어 결함을 찾아내는 능력이 유난히 뛰어난 모델을, 나머지 세상보다 먼저 그 결함을 고치는 사람들에게 쥐여주겠다는 발상이다. 구글은 미국 정부와 출시 전 안전성 평가도 진행 중이라고 밝혔다.

다음 차례는 유료 API 고객과 구글 AI 울트라 구독자다. 구글은 두 쪽 모두 날짜를 제시하지 않았다. 공개 API 모델 ID조차 없어서, 자기 코드로 이 모델을 호출할 수도 없다.

일반 제미나이 사용자라면 결론은 간단하다. 오늘 달라지는 건 없다. 아르곤은 보안이라는 좁은 영역을 겨냥한 프리뷰다.

구글 내부에서는 아르곤이 이미 일하고 있다

구글은 모델 성능만 측정한 게 아니다. 자사 업무에 실제로 투입했고, 그 사례가 발표 자료에서 가장 구체적인 대목이다.

구글 데이터센터에서 아르곤은 메모리를 확보할 방법을 찾는 작업을 맡았다. 구글은 이 모델이 새 하드웨어를 사들이지 않고도 수백 테라바이트의 메모리를 확보할 최적화를 찾아냈다고 밝혔다. 양자 컴퓨팅 연구진도 자기네 문제에 아르곤을 돌려봤다.

메모리를 비우는 일은 화려하지 않다. 하지만 모델이 도움이 되거나, 아니면 모두의 시간을 낭비하게 만드는 종류의 작업이다. 수백 테라바이트 확보는 데모가 아니라 측정 가능한 결과다.

구글이 고른 제미나이 4 아르곤 벤치마크

구글 자체 수치는 강하다. 회사는 아르곤이 실제 소프트웨어 엔지니어링 벤치마크에서 신기록을 세웠고, 사이버 보안 부문에서 공동 1위에 올랐으며, 금융·법률 등 전문 업무 성능을 재는 테스트에서도 선두에 섰다고 밝혔다.

구글이 돌린 18개 벤치마크 가운데 아르곤은 12개에서 앞섰고 1개에서 공동 1위였다. 실제 결과임에는 틀림없고, 이게 임시방편이 아니라 진지한 프런티어 모델이라는 주장과도 맞아떨어진다.

다만 출처를 기억하자. 구글이 고르고 구글이 돌린 벤치마크다. 회사 자체 성적표에서의 선두와 공동 1위는 출발점이지, 최종 결론이 아니다.

독립 평가가 다른 이야기를 하는 이유

그럼 독립 평가는 왜 다른 말을 할까. 잠깐 속도를 늦춰 볼 만한 대목이다.

모델을 직접 맞붙여 시험하는 독립 기관 인공지능 분석(Artificial Analysis)은 제미나이 4 아르곤의 지능 지수(Intelligence Index)를 53점으로 매겼다. 일부 초기 측정에서는 52.6점이 나왔다. 제미나이 3.1 프로의 30점에서 크게 오른 점수다. 하지만 클로드 오푸스 5.5의 57.6점에는 못 미치고, GPT-6 아스트라·클로드 페이블 5.1과는 비슷한 수준이다.

세부 테스트에서도 갈린다. 아르곤은 까다로운 코딩 벤치마크인 딥SWE v1.1에서 77.9%를 기록했고 발스 지수에서 1위에 올랐다. 반면 터미널벤치 4.0에서는 클로드 오푸스 5.5에 66.4% 대 57.4%로 밀렸고, 프런티어SWE v2에서는 GPT-6 아스트라에 65.5% 대 55.0%로 뒤졌다.

아르곤에 유리한 독립 결과도 하나 있다. 인공지능 분석은 아르곤이 주요 모델 가운데 가장 낮은 환각률을 기록했다고 측정했다. 자신 있게 틀린 답에 데인 적이 있는 사람이라면, 이게 여기서 가장 쓸모 있는 숫자일지도 모른다.

제미나이 4 아르곤이 앞서는 지점

  • 어려운 코딩 벤치마크 딥SWE v1.1에서 77.9%
  • 발스 지수와 LMArena 텍스트 아레나 1위
  • 인공지능 분석이 측정한 주요 모델 중 최저 환각률
  • 구글 자체 성적표 18개 중 12개 선두

제미나이 4 아르곤이 뒤지는 지점

  • 인공지능 분석 지능 지수 53 대 클로드 오푸스 5.5의 57.6
  • 터미널벤치 4.0: 57.4% 대 오푸스 5.5의 66.4%
  • 프런티어SWE v2: 55.0% 대 GPT-6 아스트라의 65.5%
  • 블룸버그, 실제 코딩 성능에 대한 구글 내부 회의론 보도

블룸버그는 벤치마크 점수와 달리 아르곤이 실제 코딩 작업에서 어려움을 겪는다고 보는 구글 직원들이 있다고 보도했다. 확인되지 않은 내부 시각이지만, 승리만 인용한 발표 자료를 견제하는 데는 유용하다. 벤더의 칭찬과 외부 결과가 반드시 일치할 필요는 없고, 여기서는 실제로 어긋난다.

제미나이 4 아르곤의 가격

구글은 아르곤을 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러의 도입가로 내놨다. 캐시된 입력은 100만 토큰당 0.10달러다.

50% 할인이다. 정가는 4달러와 20달러로, 클로드 오푸스 5.5와 비슷한 수준이다. 구글은 할인 종료 시점을 밝히지 않았다. 저렴한 요금제는 출시 기간 한정이지 영구적이지 않다.

API 위에서 개발하는 사람에게 이건 중요하다. 오늘 싸게 프로토타입을 만든 모델이 어느 날 갑자기 두 배가 될 수 있고, 사전 경고는 거의 없을 것이다. 정가를 기준으로 예산을 잡고, 할인은 지속되는 동안 누리는 보너스로 보는 게 낫다.

제미나이 4 아르곤과 더 큰 경쟁

이번 출시는 순다르 피차이 CEO가 백악관에서 다른 기술 리더들과 함께 자발적 AI 안전 협약에 서명한 다음 날 나왔다. 구글은 공개 출시 전에 오용과 프롬프트 인젝션 등 네 가지 사이버 보안 영역의 안전장치를 확대하고 싶다고 밝혔다.

아르곤이 등장하는 방식에는 실제로 긴장이 깔려 있다. 좁은 보안 그룹에 먼저 풀리고, 공개 날짜도 없는 구글의 프런티어 탈환 시도다. 한때 모든 사람에게 모델을 한꺼번에 내놨던 회사치고는 조심스러운 행보다.

그래서 실제로 뭘 기억해야 할까. 개발자라면 아르곤은 주목할 가치가 있다. 가격과 문맥 창이 실제로 경쟁력이 있고, 접근도 다가오고 있기 때문이다. 가볍게 쓰는 사용자라면 이번 주에 달라지는 건 없다. 벤치마크 경쟁을 따라가는 사람이라면 두 성적표를 분리해서 봐야 한다. 구글 자체의 '18개 중 12개 선두'와, 여전히 오푸스 5.5를 앞세우는 독립 지수가 그것이다. 둘 다 동시에 사실이다.

이 소식 공유하기

출처

관련 AI 뉴스

스마트폰 제미나이 앱 화면에서 모델 이름이 플래시에서 플래시 라이트로 바뀌는 모습, 차가운 파란색에서 밝은 회색으로 이어지는 그라데이션 이미지
비즈니스 및 산업

구글 제미나이 무료 요금제, 10월 9일부터 플래시 라이트만 쓴다

구글이 제미나이 요금제별 모델 접근 권한을 손본다. 10월 9일부터 무료 사용자는 가장 가벼운 플래시 라이트만 쓰게 되고, 월 4.99달러 AI 플러스 가입자도 프로 모델을 잃는다. 대신 최상위 요금제에는 고급 추론 기능이 들어온다.

인기 지수: 1,300
코딩에 가장 좋은 LLM은? 작업별로 갈리는 선택
리뷰

코딩에 가장 좋은 LLM은? 작업별로 갈리는 선택

코딩용 LLM은 작업마다 답이 다르다. 어려운 버그 수정에는 클로드 오퍼스, 자동화와 속도에는 오픈AI 코드 모델, 대량 처리에는 제미나이와 오픈웨이트 모델이 어울린다. 벤치마크 읽는 법과 선택 기준을 정리했다.

인기 지수: 1,390
2026년 가장 강한 LLM 순위: GPT-6부터 클로드, 제미나이까지
AI 모델

2026년 가장 강한 LLM 순위: GPT-6부터 클로드, 제미나이까지

2026년 최고의 LLM은 한 모델로 정해지지 않는다. 최상위 성능은 GPT-6 아스트라, 코딩은 클로드 오퍼스, 가성비는 제미나이와 오픈소스 진영으로 축이 나뉜다. 축별 강점과 순위표를 읽는 법을 정리했다.

인기 지수: 1,520
클로드 vs 그록 vs 제미나이, 대학생에게 무엇이 맞을까
비교

클로드 vs 그록 vs 제미나이, 대학생에게 무엇이 맞을까

클로드, 그록, 제미나이는 각자 다른 과제에 강하다. 텍스트와 파일 분석, 실시간 정보, 구글 연동이라는 차이와 요금, 그리고 대학생이 어떤 기준으로 고르면 좋은지 정리했다.

인기 지수: 1,050