
Mercury
Inception Labs · 음성 및 언어 · 코딩
Mercury는 단어를 하나씩이 아니라 병렬로 텍스트를 생성하는 Inception Labs의 확산형 대규모 언어 모델 시리즈다. 현행 버전인 Mercury 2.5는 초당 1,107개 토큰으로 동작하며 260K의 컨텍스트 창을 갖춘다. 가격은 입력 토큰 100만 개당 0.20달러, 출력 토큰 100만 개당 0.75달러다. 텍스트 생성 모델로서 검색, 음성, 코딩 작업에 빠르고 저렴한 출력을 원하는 개발자를 겨냥한다. 이 저지연 AI 모델은 자체 머신에서 돌리는 대신 API로 임대하므로, AI 모델 가격은 사용한 만큼 지불한다.

Mercury 소개
Mercury란
Mercury는 Inception Labs의 주력 모델 라인이다. 이 회사는 스탠퍼드, UCLA, 코넬, Google DeepMind, Meta AI, Microsoft AI, OpenAI 출신 연구자들이 세웠다. 가장 두드러지는 특징은 그 밑에 깔린 아키텍처다. 상용 LLM은 거의 모두 왼쪽에서 오른쪽으로 한 번에 토큰 하나를 생성한다. Mercury는 확산을 쓴다. 이미지 생성기 뒤에 있는 것과 같은 넓은 개념으로, 여러 토큰을 한꺼번에 만들고 다듬는다. 속도는 여기서 나온다. 회사에 따르면 이 방식은 비슷한 품질의 표준 모델보다 5~7배 높은 처리량과 최대 70% 낮은 비용을 낸다.
미리 이해해야 할 절충점이 있다. Mercury는 API로 제공되는 텍스트 및 추론 모델이고, 설치하는 다운로드형 앱이 아니다. ChatGPT처럼 웹사이트에서 대화하는 대상이 아니다. 자신의 소프트웨어에서 호출하고 토큰 단위로 지불한다. Inception은 이미 제품이 있고 모델 계층이 즉각적으로 느껴지길 원하는 팀을 대상으로 판다.
속도가 대표적인 셀링 포인트지만, 더 조용한 강점은 제어다. 확산은 토큰을 한 묶음으로 조정하게 해주므로, Inception은 자기회귀 모델보다 엄격한 JSON 스키마와 의미 규칙을 더 안정적으로 따를 수 있다고 말하며, 조정 가능한 추론과 병렬 도구 호출도 지원한다. 사용자 요청 하나에 모델 호출 수십 번을 연결하는 파이프라인이라면, 그 조합이 원시 벤치마크 점수보다 더 중요하다. 생각해보자. 검색 에이전트는 답하기 전에 계획하고, 다시 쓰고, 순서를 바꾸고, 요약할 수 있다.
시작하기
- Inception Labs 플랫폼에서 계정을 만들고 콘솔에서 API 키를 받는다.
- 대시보드에서 Mercury 모델을 고르고, 개발 전에 현재 토큰당 요금을 확인한다.
- chat completions 엔드포인트로 첫 요청을 보낸다. 모델 이름은 계정에서 안내한 것을 쓴다.
- 앱에 구조화된 출력이 필요하면 스키마 정렬 JSON 모드를 시험하고, 조정 가능한 추론은 도움이 되는 곳에서만 켠다.
- 키를 프로덕션 환경에 연결하고 트래픽이 늘수록 지연과 지출을 모니터링한다.
제품 정보
Mercury의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- 백엔드 및 ML 엔지니어
- 예산이 빠듯한 스타트업 팀
- 음성 및 지원 개발자
작업
- 검색 및 RAG 파이프라인
- 코드 완성과 리팩터링
- 구조화된 데이터 추출
활용 상황
- 지연을 기준으로 인프라를 다시 짓지 않고 기존 앱에 반응 좋은 어시스턴트를 추가한다.
- 적은 예산으로 AI 기능을 시제품화하고 사용량이 늘면 확장한다.
- 품질의 마지막 한 조각을 짜내는 것보다 작업당 비용이 더 중요한 대량 배치 작업을 돌린다.
주요 기능
병렬 토큰 생성
Mercury는 토큰을 하나씩이 아니라 병렬로 쓴다. 기존 모델보다 몇 배 빠른 핵심 이유다. Inception은 널리 구할 수 있는 NVIDIA GPU에서 첫 토큰까지 300밀리초 미만, 초당 1,107개 토큰을 보고한다. 이 차이는 써보기 전까지는 기술적으로 들린다. 사용자에게는 즉각적으로 느껴지는 어시스턴트와, 로딩 표시가 도는 동안 계속 기다리게 하는 어시스턴트의 차이다. 사람을 조용히 제품에서 멀어지게 만드는 바로 그런 작은 지연이다.
260K의 긴 컨텍스트 창
Mercury 2.5 모델은 한 번의 요청에서 최대 260,000개 토큰의 컨텍스트를 받는다. 긴 문서, 큰 코드 파일, 긴 대화 이력을 잘게 쪼개지 않고 담을 수 있다. 긴 컨텍스트와 높은 속도의 조합은 드물다. 대부분의 빠른 모델은 창을 소박하게 유지하므로, 대규모 코드베이스나 긴 보고서를 다루는 팀은 이 부족함을 곧바로 느낀다. 큰 파일에는 큰 무기다.
조정 가능한 추론
요청마다 모델이 얼마나 내부 추론을 할지 조절할 수 있다. 단계적 사고가 필요한 어려운 문제에는 올리고, 추가 추론이 지연과 비용만 늘리는 단순 조회에는 내린다. 이 제어는 추론이 보통 켜짐 아니면 꺼짐인 호스팅 모델에서는 드물다. 좋다.
스키마 정렬 JSON 출력
Mercury는 자신이 정의한 JSON 스키마에 맞도록 출력을 제한할 수 있다. 확산은 토큰을 한 묶음으로 고치게 해주므로, Inception은 구조화된 출력이 더 믿을 만해진다고 말한다. 깨진 응답이 줄어든다. 개발자는 결과를 파이프라인의 다음 단계로 넘길 때 고쳐야 할 잘못된 출력이 줄어든다. 워크플로가 프로덕션에서 하루에 수천 번 돌면 빠르게 쌓이는 종류의 작은 상처다.
병렬 도구 호출
모델은 각 호출이 끝나기를 기다리는 대신 여러 도구나 함수 호출을 한꺼번에 보낼 수 있다. 캘린더를 확인하고, 데이터베이스에 질의하고, 웹을 검색하는 에이전트에서 이 병렬성은 응답에서 실제 몇 초를 깎는다. Mercury가 내세우는 다단계 워크플로에 맞고, 에이전트가 다섯 번의 순차 호출을 힘겹게 지나가는 것을 본 사람이라면 그 대기가 한 번의 대화에서 얼마나 쌓이는지 안다. 에이전트에게 큰 승리다.
확산 아키텍처
Mercury는 확산 LLM, 즉 dLLM이다. Inception은 지금까지 훈련된 확산 언어 모델 가운데 가장 큰 축에 든다고 설명한다. 이 아키텍처는 텍스트와 오디오, 이미지, 비디오를 하나의 틀에서 섞는 길도 연다. 오늘 출시된 제품은 텍스트 우선이다.
장단점
장점
- 초당 1,107개 토큰의 처리량과 300밀리초 미만의 첫 토큰 지연. 프런티어 모델 기준으로도 빠르다.
- 입력 토큰 100만 개당 0.20달러, 출력 100만 개당 0.75달러의 가격. 대부분의 동급 모델보다 훨씬 낮다.
- 260K 컨텍스트 창이 긴 문서와 코드베이스를 나누지 않고 처리한다.
- 스키마 정렬 JSON과 조정 가능한 추론이 출력에 대한 더 세밀한 제어를 개발자에게 준다.
단점
- API 전용: 데스크톱 앱도 모바일 앱도 없어서, 일반 사용자가 Mercury를 열어 바로 대화할 수는 없다.
- 품질은 비용 최적화된 프런티어 모델에 준하는 수준으로 제시되고 절대적 최상위는 아니라서, 가장 어려운 추론 작업은 여전히 더 큰 모델이 유리할 수 있다.
- 도입이 아직 초기라, 주류 LLM 생태계보다 커뮤니티 예제와 서드파티 통합이 적다.
- 요금과 모델 이름이 빠르게 바뀌므로, 확정하기 전에 현재 가격을 확인하는 게 좋다.
자주 묻는 질문
Inception Labs 플랫폼에서 시험해 볼 무료 등급이 있지만, 모델 자체는 프로덕션에서 토큰 단위로 과금된다. 출시 당시 Mercury 2.5는 80% 할인으로 제공되어 입력 토큰 100만 개당 0.04달러, 출력 100만 개당 0.15달러였다.
관련 콘텐츠
Mercury와 관련된 도구, 스킬, 아티클을 살펴보세요.
Mercury 대안
Prosp
Prosp · 글쓰기 · 음성 및 언어 · 마케팅Prosp는 에이전시와 영업팀을 위해 만들어진 AI LinkedIn 아웃리치 도구다. 잠재 고객마다 자신의 목소리로 메시지와 음성 메시지를 작성해, 상대가 실제로 답장하도록 만든다. 계정을 연결하고 리드를 찾고, AI가 개인화된 메시지를 대량으로 작성해 보내도록 맡긴다. 전부 하나의 받은편지함에서 처리한다. 대량으로 아웃바운드를 돌리는 사람을 위해 만들어졌다. 그게 이 제품의 전부다. 그래도 모든 접점은 인간처럼 느껴져야 한다.
Wordly AI Translation
Wordly · 음성 및 언어 · 생산성Wordly AI Translation은 회의, 콘퍼런스, 행사를 위해 만들어진 실시간 AI 번역 및 자막 플랫폼이다. 60개 이상 언어로 실시간 번역, 자막, 스크립트, 요약을 제공하며, 참가자는 전용 헤드셋 대신 QR 코드를 스캔하거나 링크를 열어 참여한다. Zoom, Microsoft Teams, Google Meet, Webex와 함께 작동하고, 세션마다 사람 통역사를 고용하지 않고도 다국어 접근을 원하는 조직을 겨냥한다. 그게 전부다.
Musicful
Musicful AI · 음성 및 언어 · 동영상Musicful은 텍스트를 몇 분 만에 음악으로 바꾸는 AI 음악 생성기이자 AI 뮤직비디오 제작 도구다. 텍스트 프롬프트, 가사 한 묶음, 또는 흥얼거린 멜로디를 주면 보컬과 악기가 들어간 완성 트랙을 돌려준다. AI 곡 생성기로도 쓰이고, 직접 만든 곡으로 뮤직비디오를 만들며, AI 커버 도구와 개발자용 API도 제공한다. 웹 브라우저와 Android 앱에서 실행되므로 데스크톱에서 곡을 시작하고 휴대폰에서 이어서 할 수 있다.
