
MAI
Microsoft · Coding
MAI ist die hauseigene Familie von KI-Modellen bei Microsoft, aufgebaut von der Division Microsoft AI unter CEO Mustafa Suleyman. Die Reihe deckt Bildgenerierung, Sprachsynthese und Transkription ab, 2026 kamen Modelle für Reasoning und Code dazu. Entwickler erreichen die Modelle über Microsoft Foundry, normale Nutzer begegnen ihnen in Copilot, Bing, Teams und PowerPoint, ohne je einen API-Schlüssel anzufassen.

Über MAI
Was ist MAI
MAI entstand als Microsofts Antwort auf ein einfaches Problem: Das Unternehmen stützte sich zu stark auf OpenAI und baute deshalb eigene Grundlagenmodelle. Die ersten beiden, MAI-1-preview und MAI-Voice-1, kamen am 29. August 2025. Die Bildgenerierung folgte im Oktober mit MAI-Image-1. Zur Build-Konferenz 2026 umfasste die Familie mehr als sieben Modelle für Bild, Stimme, Transkription, Reasoning und Code.
Der eigentliche Reiz liegt bei Kosten und Tempo. Microsoft bepreist diese Modelle aggressiv: Die Transkription startet bei 0,10 Dollar pro Stunde Audio, und die Flash-Bildmodelle kosten einen Bruchteil der Flaggschiff-Versionen. Wer Audio- oder Bildfunktionen in großem Umfang baut, merkt diesen Unterschied schnell.
Der Haken ist der Zugang. MAI ist keine Consumer-App zum Herunterladen. Die meisten Modelle liegen hinter Microsoft Foundry und Azure, man braucht also ein Entwicklerkonto und eine API-Integration, um sie direkt zu nutzen. Normale Nutzer sehen nur die Ergebnisse in Copilot und Bing, wo sie das Modell nicht selbst wählen. Für einen unabhängigen Blick darauf, was die einzelnen Versionen leisten, ist die offizielle Microsoft-AI-Seite die einzige Quelle mit aktuellen Details.
Erste Schritte
- Erstellen Sie ein Konto bei Microsoft Foundry oder Azure und wählen Sie ein Abo.
- Öffnen Sie den Modellkatalog und setzen Sie ein MAI-Modell ein, etwa MAI-Image-2.5 oder MAI-Voice-2.
- Holen Sie sich Endpunkt und Schlüssel von der Bereitstellungsseite.
- Senden Sie eine Testanfrage mit einem Prompt, einem Bild oder einer Audiodatei, je nach Modell.
- Prüfen Sie die Ausgabe und binden Sie den Endpunkt dann in Ihre App oder Ihren Workflow ein.
Produktinformationen
Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von MAI.
Am besten für
Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.
Nutzer
- Entwickler, die Bild-, Sprach- oder Transkriptions-APIs brauchen, ohne Flaggschiff-Preise zu zahlen
- Produktteams, die Sprachfunktionen in eine App einbauen
- Nutzer von Copilot und Microsoft 365
Aufgaben
- Produktfotos und UI-Mockups erzeugen
- Aufnahmen in Text verwandeln
- Sprachagenten bauen
Szenarien
- Medien-Workflows mit hohem Volumen, die günstige, schnelle Stapelverarbeitung statt punktueller Qualität brauchen.
- Unternehmensanalyse von Dokumenten und Meetings, wo langer Kontext und Datenkonformität zählen.
- Prototyping einer multimodalen Funktion, bevor Sie sich auf einen größeren Cloud-Vertrag festlegen.
Wichtigste Funktionen
Bildgenerierung und -bearbeitung
Die MAI-Image-Reihe macht aus Text-Prompts Bilder. Sie bearbeitet auch vorhandene, von Objektentfernung über Inpainting bis zur Textänderung. Microsoft teilt die Reihe in ein Flaggschiff für hochwertige Arbeit und Flash- oder Efficient-Varianten für Massenaufträge, bei denen Tempo und Kosten vor Höchstqualität gehen. Mehrere Versionen landeten laut Microsoft in den Top 3 öffentlicher Ranglisten zur Bildgenerierung.
Ausdrucksstarke Sprachsynthese
MAI-Voice erzeugt natürliche Sprache und hält den Ton eines Sprechers über lange Passagen stabil, was für Hörbücher und Narration zählt. Als Text-to-Speech-API läuft es effizient auf einer einzigen GPU, erzeugt bis zu einer Minute Audio in etwa einer Sekunde und unterstützt Stimmklonen aus wenigen Sekunden Beispielaudio. Die Abdeckung reicht über 15 Sprachen, mit Emotionssteuerung über SSML.
Transkription in großem Umfang
MAI-Transcribe-1 übernimmt die Stapelumwandlung von Sprache in Text in mehr als 40 Sprachen, mit Sprechertrennung, Zeitstempeln pro Wort und automatischer Spracherkennung. Als Speech-to-Text-API unterstützt es gemischte Sprache wie Hinglish und Spanglish und verarbeitet eine Stunde Audio in rund zehn Sekunden. Microsoft berechnet es ab 0,10 Dollar pro Audio-Stunde.
Reasoning- und Code-Modelle
MAI-Thinking-1 ist das erste reine Reasoning-Modell der Familie, gebaut für Langkontext-Analyse und mehrstufige Aufgaben, während MAI-Code-1 auf Codegenerierung in GitHub Copilot zielt. Beide richten sich an Unternehmenslasten, bei denen Datenlizenzierung und Zuverlässigkeit mehr zählen als reine Benchmark-Werte.
Läuft in Microsofts eigenen Produkten
Das sind keine Laborexperimente. Dieselben Modelle treiben Copilot, die Bildgestaltung in Bing, die Transkription in Teams und die Bildfunktionen in PowerPoint an, was ihnen eine reale Nutzungsskala gibt, die kaum ein Forschungsmodell erreicht.
Vor- und Nachteile
Vorteile
- Wettbewerbsfähige Preise, besonders bei Transkription und den Flash-Bildvarianten.
- Breite Modellpalette, die Bild, Stimme, Transkription, Reasoning und Code an einem Ort vereint.
- Tiefe Integration in Microsoft-Produkte, die Sie vielleicht schon täglich nutzen.
- Starke Mehrsprachigkeit bei Stimme und Transkription.
Nachteile
- Keine eigenständige Consumer-App, Gelegenheitsnutzer können also kein Modell direkt wählen.
- Direkter Zugang erfordert ein Foundry- oder Azure-Konto und API-Arbeit, was die Hürde für Solo-Ersteller erhöht.
- Manche Funktionen, etwa Echtzeittranskription und Sprechertrennung in frühen Versionen, kamen später oder blieben in der Vorschau, Sie warten also womöglich auf einer Roadmap auf genau die Fähigkeit, die Sie brauchen.
- Flaggschiff-Modelle kosten weiter deutlich mehr als die Flash-Optionen, Qualität und Budget ziehen also oft in gegensätzliche Richtungen.
Häufige Fragen
MAI ist Microsofts Familie selbst entwickelter KI-Modelle, gebaut von der Division Microsoft AI. Sie umfasst Bild-, Sprach-, Transkriptions-, Reasoning- und Code-Modelle statt eines einzelnen Produkts.
Ähnliche Inhalte
Entdecke passende Tools, Skills und Artikel zu MAI.
Alternativen zu MAI
Forefront
Forefront · CodingForefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.
Startkit
StartKit.AI · CodingStartkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.
Testim
Tricentis · CodingTestim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.
