
MAI
Microsoft · Programación
MAI es la familia de modelos de inteligencia artificial desarrollados en casa por Microsoft, creada por su división Microsoft AI bajo el mando del consejero delegado Mustafa Suleyman. La línea cubre generación de imágenes, síntesis de voz y transcripción de audio, y a lo largo de 2026 se le sumaron modelos de razonamiento y de código. Los desarrolladores llegan a los modelos a través de Microsoft Foundry, mientras que el usuario de a pie los encuentra dentro de Copilot, Bing, Teams y PowerPoint sin tocar jamás una clave de API.

Acerca de MAI
Qué es MAI
MAI nació como respuesta de Microsoft a un problema simple: dependía demasiado de OpenAI, así que construyó sus propios modelos fundacionales. La compañía lanzó los dos primeros, MAI-1-preview y MAI-Voice-1, el 29 de agosto de 2025. La generación de imágenes llegó en octubre con MAI-Image-1. Para la conferencia Build de 2026, la familia ya cubría más de siete modelos entre imagen, voz, transcripción, razonamiento y código.
El atractivo real está en el coste y la velocidad. Microsoft pone precios agresivos a estos modelos: la transcripción arranca en 0,10 dólares por hora de audio, y los modelos Flash de imagen cuestan una fracción de las versiones insignia. Si construyes funciones de audio o visuales a escala, esa diferencia se nota enseguida.
El problema es el acceso. MAI no es una app de consumo que descargas. Casi todos los modelos viven detrás de Microsoft Foundry y Azure, así que necesitas una cuenta de desarrollador y una integración de API para usarlos directamente. El usuario común solo ve los resultados incrustados en Copilot y Bing, donde no eliges tú el modelo. Para una mirada independiente a lo que hace cada versión, el sitio oficial de Microsoft AI es el único lugar con detalles actualizados.
Cómo empezar
- Crea una cuenta de Microsoft Foundry o Azure y elige una suscripción.
- Abre el catálogo de modelos y despliega un modelo MAI, como MAI-Image-2.5 o MAI-Voice-2.
- Copia tu endpoint y tu clave de API desde la página del despliegue.
- Envía una petición de prueba con un prompt, una imagen o un archivo de audio según el modelo.
- Revisa la salida y luego conecta el endpoint a tu app o a tu flujo de trabajo.
Información del producto
Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de MAI.
Ideal para
Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.
Usuarios
- Desarrolladores que necesitan API de imagen, voz o transcripción sin pagar precios de gama alta
- Equipos de producto que añaden funciones de voz a una app
- Usuarios de Copilot y Microsoft 365
Tareas
- Generar fotos de producto y maquetas de interfaz
- Convertir grabaciones en texto
- Crear agentes de voz
Casos de uso
- Flujos de medios con gran volumen que necesitan procesamiento por lotes barato y rápido más que calidad puntual.
- Análisis empresarial de documentos y reuniones donde importan el contexto largo y el cumplimiento de datos.
- Prototipar una función multimodal antes de comprometerse con un contrato cloud mayor.
Funciones clave
Generación y edición de imágenes
La línea MAI-Image convierte prompts de texto en imágenes. También edita las existentes, desde quitar objetos hasta rellenar zonas o actualizar texto. Microsoft divide la gama en una insignia para trabajo de alta fidelidad y variantes Flash o Efficient para trabajos masivos donde la velocidad y el coste pesan más que la calidad máxima. Varias versiones se colaron en el top 3 de las clasificaciones públicas de generación de imágenes, según Microsoft.
Síntesis de voz expresiva
MAI-Voice genera habla natural y mantiene el tono del hablante estable a lo largo de pasajes largos, algo clave para audiolibros y narración. Como API de texto a voz funciona con eficiencia en una sola GPU, produce hasta un minuto de audio en aproximadamente un segundo y admite clonación de voz a partir de unos segundos de muestra. La cobertura abarca más de 15 idiomas con controles de emoción mediante SSML.
Transcripción de voz a escala
MAI-Transcribe-1 se ocupa de la conversión de voz a texto por lotes en más de 40 idiomas, con separación de hablantes, marcas de tiempo por palabra y detector automático de idioma. Como API de voz a texto admite habla mezclada como el hinglish o el spanglish, y procesa una hora de audio en unos diez segundos. Microsoft lo cobra desde 0,10 dólares por hora de audio.
Modelos de razonamiento y código
MAI-Thinking-1 es el primer modelo de razonamiento dedicado de la familia, pensado para análisis de contexto largo y tareas de varios pasos, mientras que MAI-Code-1 apunta a la generación de código dentro de GitHub Copilot. Ambos buscan cargas empresariales donde la licencia de datos y la fiabilidad importan más que las puntuaciones brutas de los benchmarks.
Funciona dentro de los propios productos de Microsoft
No son experimentos de laboratorio. Estos mismos modelos alimentan Copilot, la creación de imágenes de Bing, la transcripción de Teams y las funciones de imagen de PowerPoint, lo que les da una escala de uso real que casi ningún modelo de investigación alcanza.
Ventajas y desventajas
Ventajas
- Precios competitivos, sobre todo en transcripción y en las variantes Flash de imagen.
- Una gama amplia que cubre imagen, voz, transcripción, razonamiento y código en un solo lugar.
- Integración profunda con productos de Microsoft que quizá ya uses a diario.
- Buen soporte multilingüe tanto en voz como en transcripción.
Desventajas
- No hay app de consumo independiente, así que el usuario casual no puede elegir un modelo directamente.
- El acceso directo exige una cuenta de Foundry o Azure y trabajo de API, lo que sube la barrera para creadores individuales.
- Algunas funciones, como la transcripción en tiempo real y la separación de hablantes en las primeras versiones, llegaron más tarde o se quedaron en vista previa, así que puede que esperes a una hoja de ruta la capacidad exacta que necesitas.
- Los modelos insignia siguen costando bastante más que las opciones Flash, así que calidad y presupuesto tiran a menudo en direcciones opuestas.
Preguntas frecuentes
MAI es la familia de modelos de IA de desarrollo propio de Microsoft, creada por su división Microsoft AI. Incluye modelos de imagen, voz, transcripción, razonamiento y código, no un solo producto.
Contenido relacionado
Explora herramientas, habilidades y artículos relacionados con MAI.
Alternativas a MAI
Forefront
Forefront · ProgramaciónForefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.
Startkit
StartKit.AI · ProgramaciónStartkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.
Testim
Tricentis · ProgramaciónTestim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.
