Gemini 3.8 & 3.8 Live Extended Thinking

Gemini 3.8 & 3.8 Live Extended Thinking

Google DeepMind · 음성 및 언어 · 챗봇

Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 Google DeepMind의 실시간 음성 AI 모델 두 종이며, 둘 다 2026년 9월 15일에 공개됐다. 표준 3.8 Live는 빠르고 저렴한 음성 인터페이스에 맞춰 조정한 음성 대 음성 모델이고, 3.8 Live Extended Thinking은 백그라운드 다단계 추론을 더해 어려운 문제를 처리하는 동안에도 계속 말할 수 있다. 개발자는 Gemini API, Google AI Studio, Gemini Live API를 통해 둘 다 쓸 수 있다. 별도 설정은 필요 없다. 일반 사용자는 이미 Gemini Live와 Search Live 안에서 두 모델을 만나고 있으며, Google은 두 모델이 Gemini 앱과 Google Workspace에서도 배포되기 시작했다고 밝혔다.

Gemini 3.8 & 3.8 Live Extended Thinking 미리보기

Gemini 3.8 & 3.8 Live Extended Thinking 소개

Gemini 3.8과 3.8 Live Extended Thinking이란

Google에 따르면 지금까지 나온 자사 모델 중 가장 앞선 실시간 대화 모델이다. 둘 다 네이티브 음성 대 음성으로 동작한다. 즉 음성을 듣고 음성으로 답한다. 당신의 말을 별도 전사 모델, 그다음 텍스트 모델, 그다음 음성 생성기로 넘기는 옛 경로를 쓰지 않는다. 그 오래된 경로가 지연과 어조 손실의 큰 원인이었다.

둘의 차이는 어려운 질문을 다루는 방식으로 모인다. 그 하나의 설계 선택이 무엇을 기반으로 만들지를 정한다. Gemini 3.8 Live는 빠르게 답하고 백그라운드에서 도구를 호출한다. 고객 지원 라우팅, 음성 검색, 언어 연습에 맞는다. Gemini 3.8 Live Extended Thinking은 말하는 동안 "사고" 과정을 계속 돌린다. 그래서 여행 계획이나 코드 디버깅 같은 다단계 작업의 진행 상황을, 입을 다물지 않고 설명할 수 있다.

주요 한계는 실무적이다. Extended Thinking은 논블로킹 비동기 도구 호출만 지원한다. 또 세션을 끝내기 전에 명시적인 유휴 신호를 기다려야 한다. 그리고 가장 높은 사고 단계는 오디오 분당 비용이 더 든다. 과금은 토큰이 아니라 오디오 분 기준이므로, 항상 켜져 있는 음성 앱은 예산을 미리 계산해야 한다.

시작하기

  1. Google AI Studio나 Gemini API 콘솔을 열고 gemini-3.8-live 또는 gemini-3.8-live-extended-thinking을 고른다.
  2. 실시간 음성 앱이라면 단일 요청이 아니라 상태를 가진 WebSocket을 통해 Gemini Live API에 연결한다.
  3. 입력 오디오는 16비트 PCM, 16 kHz, little-endian으로 보내고, 출력 오디오는 16비트 PCM, 24 kHz로 예상한다.
  4. Extended Thinking을 쓴다면 사고 단계(low, medium, high)를 설정하고 논블로킹 도구 호출만 사용한다.
  5. 모델에서 유휴 상태가 온 것을 확인한 뒤에만 세션을 끝낸다.

제품 정보

Gemini 3.8 & 3.8 Live Extended Thinking의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.

무료 플랜예
유료 플랜$0.005 - $0.018/min audio
플랫폼Gemini API, Google AI Studio, Gemini Live API, Gemini Live, Search Live, Google Workspace
개발사Google DeepMind
카테고리음성 및 언어 · 챗봇
출시일Sep 2026
최근 업데이트Sep 2026
웹사이트 방문 수8.8M
웹사이트 글로벌 순위8.7K
API 제공 여부예

추천 대상

이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.

사용자

  • 음성 에이전트를 만드는 개발자
  • 고객 지원 팀
  • Gemini 앱 일반 사용자

작업

  • 실시간 문제 해결
  • 실시간 언어 연습
  • 예약과 일정 잡기

활용 상황

  • 운전이나 요리 중에 핸즈프리 비서를 쓰는 상황. 답을 조용히 기다리는 건 고장 난 것처럼 느껴진다.
  • 화이트보드 스케치를 보며 누군가를 지도하는 상황. 3.8 Live는 시각 입력을 거의 실시간으로 읽는다.
  • 재고를 확인하고, 그다음 가격, 그다음 배송 시간을 확인하는 식으로 한 번의 음성 세션에서 여러 비동기 함수를 조율하는 상황.

주요 기능

음성 대 음성 대화

두 모델은 옛 "전사 후 생성" 흐름을 건너뛴다. 음성이 들어간다. 음성이 돌아온다. 얻는 것은 잃는 어조 신호의 감소와, 말한 내용과 돌아오는 내용 사이 지연의 축소다. 음성 앱에서 그 간격이 곧 전체 경험이다.

입을 다물지 않고 소리 내어 생각하기

Extended Thinking은 추론을 발화와 병행해 돌린다. 어려운 질문에 정적이 흐르는 대신 "확인해 볼게요" 같은 짧은 말로 시작해, 작업하면서 진행 상황을 이야기한다. Google의 데모에는 실시간 체스 안내와, 화이트보드 스케치와 음성 피드백을 동작하는 React 컴포넌트로 바꾸는 예가 있다.

백그라운드 도구 및 API 호출

모델이 웹 검색을 하거나 도구를 호출하는 동안에도 계속 말할 수 있다. Extended Thinking에서는 논블로킹 비동기 도구만 지원한다. 이 마지막 세부 사항이 중요하다. 블로킹 호출은 모델이 지키려는 바로 그 흐름을 멈춰 세운다.

한 번의 호출로 97개 언어 전환

Gemini 3.8 Live는 세션을 다시 시작하지 않고도 지원하는 97개 언어를 감지해 전환한다. 다국어 가정과 여러 언어가 섞인 통화를 받는 상담 창구가 가장 이득을 본다. 아무도 언어를 미리 고를 필요가 없다.

거의 실시간인 시각 입력

표준 모델은 들어오는 이미지와 동영상 프레임을 이해한다. 대략 초당 한 프레임이다. 그래서 카메라가 보는 것을 두고 언급할 수 있다.

SynthID 오디오 워터마크

이 모델들이 만드는 모든 오디오 클립에는 눈에 보이지 않는 SynthID 워터마크가 들어간다. 끄는 스위치는 없다. 들리는 소리는 바뀌지 않지만, 플랫폼이 AI 생성 음성을 표시할 방법을 갖게 된다.

장단점

장점

  • 음성 대 음성 설계가 옛 음성 비서를 기계처럼 느껴지게 하던 지연을 줄인다.
  • Extended Thinking은 작업하는 동안 대화를 살려 두므로, 복잡한 요청이 무음의 정적을 부르지 않는다.
  • 오디오 분당 가격은 입력 $0.005, 출력 $0.018로, 대량 사용 앱에서도 예측 가능하게 유지된다.
  • 97개 언어의 네이티브 전환은 별도 설정 없이 다국어 제품에 맞는다.
  • 눈에 보이지 않는 SynthID 워터마크가 기본으로 들어 있어, 생성 오디오를 공개하는 쪽에 적합하다.

단점

  • Extended Thinking은 논블로킹 비동기 도구 호출만 허용하므로, 동기 도구는 다른 아키텍처를 강제한다.
  • 세션을 끝내려면 명시적인 유휴 상태를 기다려야 해서, 코드가 추적해야 할 상태가 하나 늘어난다.
  • 상시 가동 비서에서는 오디오 분 과금이 빠르게 치솟을 수 있다. 정액 상한이 없기 때문이다.
  • 가장 강한 사고 단계는 분당 비용을 끌어올리므로, 가장 깊은 추론이 공짜는 아니다.

자주 묻는 질문

Gemini 3.8 Live는 빠르고 저렴한 실시간 대화에 맞춰 조정됐고, 3.8 Live Extended Thinking은 백그라운드 다단계 추론을 더해 말과 사고를 동시에 할 수 있다. 둘은 같은 음성 대 음성 기반을 공유하므로, 지연이냐 깊이냐로 고르면 된다.

관련 콘텐츠

Gemini 3.8 & 3.8 Live Extended Thinking와 관련된 도구, 스킬, 아티클을 살펴보세요.

Gemini 3.8 & 3.8 Live Extended Thinking 대안

Prosp

Prosp

Prosp · 글쓰기 · 음성 및 언어 · 마케팅

Prosp는 에이전시와 영업팀을 위해 만들어진 AI LinkedIn 아웃리치 도구다. 잠재 고객마다 자신의 목소리로 메시지와 음성 메시지를 작성해, 상대가 실제로 답장하도록 만든다. 계정을 연결하고 리드를 찾고, AI가 개인화된 메시지를 대량으로 작성해 보내도록 맡긴다. 전부 하나의 받은편지함에서 처리한다. 대량으로 아웃바운드를 돌리는 사람을 위해 만들어졌다. 그게 이 제품의 전부다. 그래도 모든 접점은 인간처럼 느껴져야 한다.

유료 / $30.99 - $79.99 per account/mo자세히 보기
Wordly AI Translation

Wordly AI Translation

Wordly · 음성 및 언어 · 생산성

Wordly AI Translation은 회의, 콘퍼런스, 행사를 위해 만들어진 실시간 AI 번역 및 자막 플랫폼이다. 60개 이상 언어로 실시간 번역, 자막, 스크립트, 요약을 제공하며, 참가자는 전용 헤드셋 대신 QR 코드를 스캔하거나 링크를 열어 참여한다. Zoom, Microsoft Teams, Google Meet, Webex와 함께 작동하고, 세션마다 사람 통역사를 고용하지 않고도 다국어 접근을 원하는 조직을 겨냥한다. 그게 전부다.

유료 / $0 - $150/mo자세히 보기
Musicful

Musicful

Musicful AI · 음성 및 언어 · 동영상

Musicful은 텍스트를 몇 분 만에 음악으로 바꾸는 AI 음악 생성기이자 AI 뮤직비디오 제작 도구다. 텍스트 프롬프트, 가사 한 묶음, 또는 흥얼거린 멜로디를 주면 보컬과 악기가 들어간 완성 트랙을 돌려준다. AI 곡 생성기로도 쓰이고, 직접 만든 곡으로 뮤직비디오를 만들며, AI 커버 도구와 개발자용 API도 제공한다. 웹 브라우저와 Android 앱에서 실행되므로 데스크톱에서 곡을 시작하고 휴대폰에서 이어서 할 수 있다.

무료 / $0 - $20/mo자세히 보기