
Mercury
Inception Labs · Stimme & Sprache · Coding
Mercury ist eine Familie großer Diffusions-Sprachmodelle von Inception Labs, die Text parallel statt Wort für Wort erzeugt. Die aktuelle Version, Mercury 2.5, läuft mit 1.107 Tokens pro Sekunde und einem Kontextfenster von 260K. Der Preis liegt bei 0,20 Dollar pro Million Eingabe-Tokens und 0,75 Dollar pro Million Ausgabe-Tokens. Als Textgenerierungsmodell richtet es sich an Entwickler, die schnelle, günstige Ergebnisse für Suche, Sprache und Programmierung brauchen. Dieses KI-Modell mit niedriger Latenz wird über eine API gemietet, statt auf dem eigenen Rechner zu laufen, sodass die Preise für KI-Modelle nach Nutzung abgerechnet werden.

Über Mercury
Was ist Mercury
Mercury ist die Flaggschiff-Modellreihe von Inception Labs, einem Unternehmen, das von Forschern von Stanford, UCLA, Cornell, Google DeepMind, Meta AI, Microsoft AI und OpenAI gegründet wurde. Sein entscheidendes Merkmal liegt in der Architektur darunter. Fast jedes kommerzielle LLM erzeugt ein Token nach dem anderen, von links nach rechts. Mercury nutzt Diffusion, dieselbe Grundidee hinter Bildgeneratoren, um viele Tokens auf einmal zu erzeugen und sie dann zu verfeinern. Daher kommt die Geschwindigkeit. Das Unternehmen sagt, der Ansatz liefere 5- bis 7-mal höheren Durchsatz und bis zu 70 % niedrigere Kosten als Standardmodelle ähnlicher Qualität.
Der Kompromiss, den man von Anfang an verstehen sollte: Mercury ist ein Text- und Reasoning-Modell, das über eine API bereitgestellt wird, keine herunterladbare App, die man installiert. Sie chatten nicht auf einer Website mit ihm wie mit ChatGPT. Sie rufen es aus Ihrer eigenen Software auf und zahlen pro Token. Inception vermarktet es an Teams, die bereits ein Produkt haben und wollen, dass sich die Modellschicht sofort anfühlt.
Die Geschwindigkeit ist die Schlagzeile, aber die Kontrolle ist das leisere Verkaufsargument. Weil Diffusion das Modell Tokens als Gruppe anpassen lässt, kann es laut Inception strengen JSON-Schemata und semantischen Regeln zuverlässiger folgen als autoregressive Modelle, und es unterstützt anpassbares Reasoning sowie parallele Tool-Aufrufe. Wenn Ihre Pipeline Dutzende Modellaufrufe pro Nutzeranfrage verkettet, zählt diese Kombination mehr als reine Benchmark-Werte. Denken Sie daran. Ein Suchagent kann planen, umschreiben, neu ordnen und zusammenfassen, bevor er überhaupt antwortet.
Erste Schritte
- Legen Sie ein Konto auf der Inception Labs Platform an und holen Sie sich einen API-Schlüssel aus der Konsole.
- Wählen Sie im Dashboard ein Mercury-Modell und prüfen Sie die aktuellen Preise pro Token, bevor Sie bauen.
- Senden Sie eine erste Anfrage über den chat-completions-Endpunkt und nutzen Sie den Modellnamen aus Ihrem Konto.
- Testen Sie den schema-konformen JSON-Modus, wenn Ihre App strukturierte Ausgabe braucht, und aktivieren Sie anpassbares Reasoning nur dort, wo es hilft.
- Binden Sie den Schlüssel in Ihre Produktionsumgebung ein und beobachten Sie Latenz und Ausgaben, während der Verkehr wächst.
Produktinformationen
Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Mercury.
Am besten für
Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.
Nutzer
- Backend- und ML-Engineers
- Startup-Teams mit knappem Budget
- Entwickler von Sprach- und Supportlösungen
Aufgaben
- Such- und RAG-Pipelines
- Code-Vervollständigung und Refactoring
- Extraktion strukturierter Daten
Szenarien
- Einem bestehenden App einen reaktionsschnellen Assistenten hinzufügen, ohne die Infrastruktur um die Latenz herum neu zu bauen.
- Eine KI-Funktion mit kleinem Budget prototypen und dann mit wachsender Nutzung skalieren.
- Batch-Jobs mit hohem Volumen fahren, bei denen die Kosten pro Aufgabe mehr zählen als das letzte Quäntchen Qualität.
Wichtigste Funktionen
Parallele Token-Erzeugung
Mercury schreibt Tokens parallel statt nacheinander, der Kern grund, warum es mehrere Male schneller ist als herkömmliche Modelle. Inception berichtet eine Zeit bis zum ersten Token unter 300 ms und 1.107 Tokens pro Sekunde auf breit verfügbaren NVIDIA-GPUs. Dieser Unterschied klingt technisch, bis man ihn nutzt. Für einen Nutzer ist das der Unterschied zwischen einem Assistenten, der sofort wirkt, und einem, der ihn warten lässt, während ein Kringel dreht, genau die Art kleiner Verzögerung, die Menschen still von einem Produkt wegtreibt.
Langes 260K-Kontextfenster
Das Modell Mercury 2.5 nimmt bis zu 260.000 Tokens Kontext in einer einzigen Anfrage. Das reicht für lange Dokumente, große Codedateien oder eine lange Gesprächshistorie, ohne sie zu zerstückeln. Langes Kontextfenster plus hohe Geschwindigkeit ist eine ungewöhnliche Kombination, da die meisten schnellen Modelle ihre Fenster bescheiden halten, und Teams, die mit großen Codebasen oder langen Berichten arbeiten, spüren diese Lücke sofort. Riesiger Vorteil für große Dateien.
Anpassbares Reasoning
Sie können einstellen, wie viel internes Reasoning das Modell pro Anfrage leistet. Drehen Sie es hoch für schwere Probleme, die schrittweises Denken brauchen; drehen Sie es runter für einfache Abfragen, bei denen zusätzliches Reasoning nur Latenz und Kosten bringt. Diese Kontrolle ist bei gehosteten Modellen selten, wo Reasoning meist an oder aus ist. Schön.
Schema-konforme JSON-Ausgabe
Mercury kann seine Ausgabe darauf beschränken, einem von Ihnen definierten JSON-Schema zu entsprechen. Diffusion lässt es Tokens als Gruppe korrigieren, was laut Inception strukturierte Ausgabe verlässlicher macht. Weniger kaputte Antworten. Entwickler haben weniger fehlerhafte Ausgabe zum Aufräumen, wenn sie Ergebnisse in den nächsten Schritt einer Pipeline einspeisen, die Art kleiner Schnittwunde, die sich schnell summiert, sobald ein Workflow tausendfach am Tag in Produktion läuft.
Parallele Tool-Aufrufe
Das Modell kann mehrere Tool- oder Funktionsaufrufe auf einmal abfeuern, statt auf jeden einzelnen zu warten. In einem Agenten, der einen Kalender prüft, eine Datenbank abfragt und das Web durchsucht, spart diese Parallelität echte Sekunden in der Antwort. Es passt zu den mehrstufigen Workflows, für die Mercury beworben wird, und wer einen Agenten schon durch fünf aufeinanderfolgende Aufrufe hat quälen sehen, weiß, wie sehr sich diese Wartezeit über ein Gespräch summiert. Großer Gewinn für Agenten.
Diffusionsarchitektur
Mercury ist ein Diffusions-LLM, oder dLLM. Inception beschreibt es als eines der größten bisher trainierten Diffusions-Sprachmodelle. Die Architektur öffnet zudem einen Weg, Text mit Audio, Bildern und Video in einem Rahmen zu mischen. Das heute ausgelieferte Produkt ist zuerst Text.
Vor- und Nachteile
Vorteile
- Durchsatz von 1.107 Tokens pro Sekunde und Latenz bis zum ersten Token unter 300 ms, schnell selbst nach Frontier-Modell-Maßstäben.
- Preis von 0,20 Dollar pro Million Eingabe-Tokens und 0,75 pro Million Ausgabe-Tokens, deutlich unter den meisten vergleichbaren Modellen.
- 260K-Kontextfenster bewältigt lange Dokumente und Codebasen ohne Aufteilung.
- Schema-konformes JSON und anpassbares Reasoning geben Entwicklern feinere Kontrolle über die Ausgabe.
Nachteile
- Nur API: es gibt keine Desktop-App und keine mobile App, also können Gelegenheitsnutzer nicht einfach Mercury öffnen und chatten.
- Die Qualität wird als vergleichbar mit kostenoptimierten Frontier-Modellen beschrieben, nicht als absolute Spitzenklasse, sodass die schwierigsten Reasoning-Aufgaben weiterhin größere Modelle begünstigen können.
- Die Verbreitung ist noch früh, was weniger Community-Beispiele und Integrationen von Drittanbietern bedeutet als in den etablierten LLM-Ökosystemen.
- Preise und Modellnamen ändern sich schnell, prüfen Sie also den aktuellen Preis, bevor Sie sich festlegen.
Häufige Fragen
Es gibt eine kostenlose Stufe zum Ausprobieren über die Inception Labs Platform, aber das Modell selbst wird in Produktion pro Token abgerechnet. Zum Start wurde Mercury 2.5 mit 80 % Rabatt angeboten, was 0,04 Dollar pro Million Eingabe-Tokens und 0,15 pro Million Ausgabe-Tokens ergab.
Ähnliche Inhalte
Entdecke passende Tools, Skills und Artikel zu Mercury.
Alternativen zu Mercury
Prosp
Prosp · Schreiben · Stimme & Sprache · MarketingProsp ist ein KI-Tool für LinkedIn-Ansprache, gebaut für Agenturen und Vertriebsteams, und es schreibt die Nachricht und die Sprachnachricht mit Ihrer eigenen Stimme für jeden Interessenten, damit sie wirklich antworten. Sie verbinden Ihre Konten, finden Leads und lassen die KI personalisierte Nachrichten in großem Umfang entwerfen und versenden, alles aus einem Posteingang. Es ist für Menschen gemacht, die Outbound in großem Stil betreiben. Das ist das ganze Versprechen. Jeder Kontaktpunkt muss trotzdem menschlich wirken.
Wordly AI Translation
Wordly · Stimme & Sprache · ProduktivitätWordly AI Translation ist eine KI-Echtzeitübersetzungs- und Untertitelungsplattform für Besprechungen, Konferenzen und Veranstaltungen. Sie liefert Live-Übersetzung, Untertitel, Transkripte und Zusammenfassungen in mehr als 60 Sprachen, und Teilnehmer treten per QR-Code-Scan oder über einen Link bei, statt eigene Kopfhörer zu nutzen. Die Plattform arbeitet mit Zoom, Microsoft Teams, Google Meet und Webex zusammen und richtet sich an Organisationen, die mehrsprachigen Zugang wollen, ohne für jede Sitzung menschliche Dolmetscher zu engagieren. So einfach ist das.
Musicful
Musicful AI · Stimme & Sprache · VideoMusicful ist ein KI-Musikgenerator und KI-Musikvideo-Ersteller, der Text in Minuten in Musik verwandelt. Du gibst einen Text, einen Songtext oder eine gesummte Melodie ein und erhältst einen fertigen Track mit Gesang und Instrumenten. Er dient außerdem als KI-Songgenerator, erstellt Musikvideos aus den Songs, die du machst, und bietet ein KI-Cover-Werkzeug plus eine Entwickler-API. Die Plattform läuft im Webbrowser und über eine Android-App, sodass du einen Song am Desktop beginnen und am Handy fortsetzen kannst.
