
Google Gemma 4
Google DeepMind · 기타
Google Gemma 4는 고급 추론과 에이전트 워크플로를 위해 만들어진 Google DeepMind의 오픈 웨이트 AI 모델 제품군이다. 휴대폰에서 돌아가는 소형 모델부터 워크스테이션 GPU 한 장에 들어가는 31B 덴스 모델까지 네 가지 크기로 나온다. 가중치는 Apache 2.0 라이선스 아래 무료로 내려받고, 직접 고치고, 어디서든 실행할 수 있다. 그래서 데이터를 온전히 통제하고 싶을 때, 클라우드 전용 API 대신 Gemma 4가 실용적인 선택이 된다. 업로드가 필요 없다. 월말에 뜻밖의 청구서도 없다.

Google Gemma 4 소개
Google Gemma 4란
Google Gemma 4는 Google 오픈 모델 라인의 네 번째 세대다. 회사의 폐쇄형 Gemini 3 모델과 같은 연구 스택을 쓰며, 누구나 검사하고 미세 조정할 수 있는 다운로드 가능한 가중치로 공개된다. 제품군은 네 가지 크기를 아우른다. 기기용 소형 모델 두 개(Effective 2B와 Effective 4B), 26B 전문가 혼합 모델, 그리고 31B 덴스 모델이다. Arena AI의 텍스트 리더보드에서 31B 버전은 오픈 모델 중 3위, 26B 버전은 6위에 오른다. 온전히 내 것이 되는 로컬 LLM이라고 보면 된다.
이 모델이 푸는 핵심 문제는 통제다. 가중치가 내 하드웨어에 있으면 아무것도 내 기기를 떠나지 않고, 토큰당 요금도 없다. 민감한 기록을 다루거나, 오프라인으로 작업하거나, 대규모에서 예측 가능한 비용이 필요할 때 이 점이 중요하다. 정말 그렇게 단순하다.
가장 큰 걸림돌은 하드웨어와 설정이다. 작은 모델은 일상 기기에서 돌지만, 26B와 31B 버전은 제대로 된 GPU가 필요하고, 모든 크기에서 서빙과 양자화, 업데이트를 직접 처리해야 한다. 미세 조정은 정말로 열려 있다. 그러나 그 자유에는 수고가 따른다. 인내심을 챙겨라.
시작하기
- 내 하드웨어에 맞는 크기를 고른다. 휴대폰이나 노트북이라면 E2B나 E4B부터 시작한다.
- Hugging Face나 Google의 Gemma 페이지에서 가중치를 내려받거나, Google AI Studio에서 연다.
- 모델을 실행 환경에 올리고, 필요하면 4비트 양자화를 적용해 메모리 사용을 줄인다.
- 작업에 따라 텍스트, 이미지, 오디오를 넣고, 에이전트를 만든다면 함수 호출이나 JSON 출력을 연결한다.
- 선택적으로 내 데이터로 미세 조정해 특정 어조나 작업을 고정한 뒤, 로컬에 배포한다.
제품 정보
Google Gemma 4의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- Apache 2.0 라이선스가 상업적 사용과 재배포를 허용하므로, 내 데이터로 기기 내 AI 모델을 미세 조정하고 가중치를 직접 보유하려는 개발자.
- 데이터를 클라우드 서비스로 보내는 대신 로컬 하드웨어에서 오프라인 추론을 돌려야 하는 연구자와 프라이버시를 중시하는 팀.
- 토큰당 요금 없이 최전선급 추론을 쓰고 싶은 중급 GPU 보유 취미 사용자.
작업
- 다단계 추론과 논리 퍼즐
- 로컬 에이전트 구축
- 이미지 설명이나 짧은 영상 및 오디오 클립 처리 같은 멀티모달 작업. 제품군 전체가 각기 다른 깊이로 지원한다.
활용 상황
- 클라우드 인프라에 투자하기 전에 노트북에서 어시스턴트를 시제작하는 스타트업.
- 관리형 API 대신 데이터를 완전히 통제하려는 팀이 적합한 Gemma 4 사용 사례를 고르는 상황.
- 규제 대상 데이터를 안고 모든 것을 자체 인프라에 두어야 하는 기업.
- 네트워크 왕복 없이 기기 내 이해가 필요한 Android 앱.
주요 기능
하드웨어별 네 가지 크기
Gemma 4는 E2B, E4B, 26B MoE, 31B 덴스 변형으로 나온다. 그래서 기기에 모델을 맞추는 것이지 그 반대가 아니다. 기기용 모델 두 개는 휴대폰과 노트북을 겨냥하고, 26B와 31B 버전은 소비자용 또는 워크스테이션 GPU 한 장에서 돈다. 이 폭이 핵심이다. 하나의 제품군, 주머니에서 데스크톱까지. 기준은 기기이지 유행이 아니다.
고급 추론과 에이전트 워크플로
Google은 Gemma 4를 단순한 채팅이 아니라 다단계 논리를 위해 만들었다. 함수 호출, 구조화된 JSON 출력, 시스템 지침을 네이티브로 처리한다. 결과에 따라 행동하는 에이전트를 조립하려면 바로 이것이 필요하다. 말만 하지 않게 하려는 것이다. 31B 모델은 현재 Arena AI 리더보드에서 오픈 모델 중 3위다. 이전 세대에서 큰 도약이다.
멀티모달 입력
이 제품군은 텍스트와 이미지를 읽고, 기기용 모델은 음성 이해를 위한 네이티브 오디오 입력을 더한다. 이미지와 짧은 영상 지원은 가변 해상도 입력과 함께 전 라인에 걸친다. 한 가지 형식에 묶이지 않는다. 간단한 캡션이나 이미지 질의응답이라면 소형 모델이 더 큰 서버 모델 없이 해내는 경우가 많다. 한 제품군으로는 넓은 범위다.
Apache 2.0 오픈 라이선스
이전 Gemma 릴리스는 사용 제한이 붙은 자체 라이선스로 나왔다. Gemma 4는 Apache 2.0으로 바꾼다. 별도 계약 없이 상업적 사용, 수정, 재배포가 허용된다는 뜻이다. 그 위에 제품을 올릴 수 있는지 판단하는 사람에게 가장 큰 변화다. 법무팀이 필요 없다.
Gemini 3 연구를 토대로
모델은 Gemini 3와 같은 연구와 기술을 토대로 한다. 그래서 Google의 폐쇄형 플래그십에 가까운 능력을 오픈 패키지로 얻는다. Google은 두 라인을 경쟁이 아니라 보완으로 위치시킨다. 통제는 Gemma, 관리형 편의는 Gemini다. 클라우드 의존을 처음부터 원치 않던 팀에게 이 공유 기반이 매력이다. 같은 DNA, 다른 규칙.
로컬 실행과 나란한 API 접근
직접 호스팅하기 싫다면 Google의 Gemini API와 AI Studio를 통해 Gemma 4를 가져올 수 있고, Vertex AI와 Hugging Face에서도 이용할 수 있다. 직접 호스팅은 선택이지 의무가 아니다. 클라우드에서 시제작하고 나중에 로컬 하드웨어로 옮기려는 팀에 이 유연함이 맞는다. 싸게 테스트하고 로컬에 배포한다.
장단점
장점
- 내려받고 실행하는 데 무료이며, 내 하드웨어에 올리면 토큰당 비용이 없다.
- Apache 2.0 라이선스가 상업적 사용, 미세 조정, 재배포를 허용한다.
- 네 가지 크기가 휴대폰부터 워크스테이션까지 아우르므로 기기에 맞춰 고를 수 있다.
- 네이티브 함수 호출과 JSON 출력 덕분에 에이전트형 자동화에 쓸 수 있다.
- 기기용 모델의 오디오를 포함한 멀티모달 입력이 텍스트 전용 작업보다 넓게 대응한다.
단점
- 26B와 31B 모델은 성능 좋은 GPU와 실제 설정 작업이 필요해 꽂으면 바로 되는 방식이 아니다.
- 서빙, 양자화, 업데이트를 직접 처리하므로 유지보수 부담이 내 쪽으로 넘어온다.
- 가장 어려운 벤치마크에서는 컨텍스트 길이와 최고 추론 성능이 아직 Google의 폐쇄형 Gemini 모델에 뒤진다.
- 작은 기기에서는 소형 모델이 속도를 위해 정확도를 맞바꾸므로 복잡한 작업은 기대에 못 미칠 수 있다.
자주 묻는 질문
직접 실행하는 추론, 코딩, 에이전트 작업을 위한 오픈 웨이트 AI 모델이다. 사람들은 로컬 어시스턴트를 만들고, 민감한 데이터로 미세 조정하고, 클라우드 API에 의존하지 않고 앱에 멀티모달 이해를 더하는 데 쓴다. 데이터를 제자리에 두고 싶다면 이게 하나의 답이다.
관련 콘텐츠
Google Gemma 4와 관련된 도구, 스킬, 아티클을 살펴보세요.
Google Gemma 4 대안
BinkBink
BinkBink · 기타BinkBink는 무료 온라인 게임 플랫폼이자 AI 게임 메이커로, 누구나 짧은 텍스트 설명을 플레이 가능한 브라우저 게임으로 바꿀 수 있다. 커뮤니티가 만든 수백 개의 게임에 바로 뛰어들 수 있다. 아니면 자기 아이디어를 설명하고 몇 초 만에 플레이한 뒤 친구와 공유하면 된다. 내 게임을 만들고 싶은가? 코딩은 필요 없다. 엔진 설정도, 다운로드도, 번거로움도 없다.

Audiogen
Audiogen Inc. · 기타Audiogen은 Audiogen Inc.가 만든 AI 음악 생성기다. 작은 연구팀이 약 2년 반 동안 자체 생성형 음악 모델을 학습시키고 그 주위에 웹 인터페이스를 설계했다. 이 AI 음악 도구는 단순한 텍스트 상자 대신 타임라인을 초보자 친화적인 생성형 오디오 워크스테이션(Generative Audio Workstation, 줄여서 GAW)으로 바꾼다. 그 안에서는 인페인팅, 확장, 리믹스, 스템 편집이 캔버스에 그림을 그리듯 작동한다. 제품은 아직 베타라 접근은 대기 명단이나 초대를 거친다. 유료 요금제는 아직 공개되지 않았다.
Aiml API
AIMLAPI OÜ · 기타Aiml API는 OpenAI, Google, Anthropic 등 1000개 이상의 모델을 하나의 엔드포인트와 하나의 청구서 뒤에 모은 통합 AI 모델 API다. 단일 OpenAI 호환 스키마에 맞춰 코드를 작성한 뒤 모델 문자열 하나만 바꾸면 채팅, 이미지, 비디오, 오디오 모델 사이를 전환할 수 있다. 열두 개가 넘는 공급자 계정을 저글링하고 싶지 않은 개발자와 소규모 팀에 맞고, 여러 벤더를 시험할 때 따르는 청구 골칫거리도 없앤다. 키 하나면 모두 해결된다.
