Microsoft publicó el 23 de julio dos modelos nuevos en vista previa pública: MAI-Image-2.5-Pro y MAI-Voice-2-Flash; al mismo tiempo, dio a conocer datos internos: al cambiar el centro de atención al cliente por MAI-Voice-2-Flash, el coste de cómputo se reduce en un 89%. El CEO de Microsoft, Satya Nadella, afirma que, cuando el rendimiento de sus propios modelos iguala o supera a las propuestas punteras, dirige el tráfico hacia MAI.
Enfoque funcional y precios de MAI-Image-2.5-Pro y MAI-Voice-2-Flash
MAI-Image-2.5-Pro se orienta a la generación avanzada de imágenes; tiene un precio de 5 USD por cada millón de tokens de entrada de texto y 106 USD por cada millón de tokens de salida de imágenes. Bing Image Creator ya se ha sustituido por completo por MAI-Image-2.5; el director global de creatividad de WPP, Rob Reilly, lo calificó en el anuncio de Microsoft como «un gran avance para las herramientas de medios generativos».
MAI-Voice-2-Flash se orienta a escenarios de procesamiento masivo de voz (como centros de atención al cliente); es el doble de rápido que el modelo anterior y tiene un coste un 32% más bajo. Tras cambiar el centro de atención al cliente a este modelo, el coste de cómputo se reduce en un 89%. El anuncio también divulgó los resultados de despliegue de Bing Image Creator, PowerPoint (el coste de GPU es un 84% más bajo que el de GPT-Image-2), OneDrive (tasa de almacenamiento +26%, latencia -25%) y Dragon Copilot (tasa de error -50%).
Resultados concretos del ahorro de costes de GPU
Microsoft reveló los resultados por escenario en el anuncio, como sigue:
MAI-Voice-2-Flash (voz en centros de atención al cliente): el coste de cómputo se reduce en un 89%; el doble de rápido que el modelo anterior, con un coste un 32% menor
MAI-Image-2.5-Pro (PowerPoint): el coste de GPU es un 84% más bajo que el de OpenAI GPT-Image-2
OneDrive al cambiar de modelo: la tasa de almacenamiento aumenta 26% y la latencia se reduce cerca de un 25%
Dragon Copilot (MAI-Transcribe-1.5, transcripción médica): da servicio a 170.000 profesionales sanitarios; el trimestre pasado procesó 28 millones de registros de pacientes; para 58 idiomas, la tasa de error en la transcripción y en el reconocimiento del idioma se reduce en un 50% en comparación
MAI-Code-1-Flash (GitHub Copilot): la tasa de adopción del código es aproximadamente un 10% superior a la de GPT-5.4 Mini y Claude Haiku 4.5; el consumo de tokens es un 10% menor; puede ejecutarse en GPU H100 e incluso A100
Lógica de tráfico de la estrategia de “rueda volante” de Nadella y la sustitución de modelos punteros por MAI
Nadella publicó en X un post titulado «Difusión avanzada y control», en el que expone la estrategia de modelos de Microsoft: cuando el rendimiento de los modelos propios iguala o supera a las alternativas punteras, se dirige el tráfico hacia MAI para ofrecer servicios a gran escala con un coste menor. La estrategia se sustenta en la metodología «hill-climbing»: hacer que los datos, el modelo y el producto formen un «sistema acoplado» que itere continuamente en una rueda volante, en lugar de depender de una sola sesión de entrenamiento para decidir el éxito o el fracaso del modelo.
También señaló que el sistema de evaluación «debería seguir avanzando incluso si se elimina cualquier modelo»—dejando la memoria y las habilidades fuera del modelo para formar el control que Microsoft realmente domina. Tras reforzar MAI-Code-1-Flash en el entorno de aprendizaje por refuerzo de Excel, puede ejecutarse en GPU más antiguas H100 y A100; en la mayoría de las tareas de Excel, iguala a GPT-5.6, al tiempo que libera el clúster más reciente GB200 para entrenamiento en vez de solicitudes de servicio.
Preguntas frecuentes
¿Cuánto cuestan MAI-Image-2.5-Pro y MAI-Voice-2-Flash?
MAI-Image-2.5-Pro cuesta 5 USD por cada millón de tokens de entrada de texto y 106 USD por cada millón de tokens de salida de imágenes; ya está disponible en vista previa pública en Azure. MAI-Voice-2-Flash es el doble de rápido que su predecesor, con un 32% menos de coste; los detalles del precio se ajustan al anuncio oficial de Azure.
¿Según Microsoft, cuánto puede bajar el coste de GPU como máximo tras cambiar a los modelos MAI?
Con base en los datos internos publicados por Microsoft, tras cambiar el centro de atención al cliente a MAI-Voice-2-Flash, el coste de cómputo se reduce en un 89%; al cambiar PowerPoint a un modelo de imagen MAI, el coste de GPU se reduce en un 84% en comparación con GPT-Image-2; tras cambiar Dragon Copilot por MAI-Transcribe-1.5, la tasa de error relativa en la transcripción y en el reconocimiento del idioma se reduce en un 50%. Sin embargo, todas las cifras anteriores provienen de evaluaciones internas de Microsoft, y no de pruebas independientes de referencia de terceros.
¿Cómo pueden los clientes empresariales usar el método de entrenamiento de Microsoft MAI mediante Azure?
Microsoft, a través de los productos Foundry y Frontier Tuning de Azure, permite que los clientes empresariales entrenen modelos personalizados con sus propios datos. Microsoft subraya que estos modelos se entrenan con «datos empresariales limpios y rastreables de grado empresarial, sin destilación de modelos de terceros», para abordar problemas de cumplimiento relacionados con el origen de los datos de entrenamiento.