Microsoft lanzó su primer modelo dedicado a ciberseguridad, MAI-Cyber-1-Flash, el 27 de julio, e lo integró en MDASH, un sistema de caza de vulnerabilidades que obtuvo un 95,95% en el benchmark CyberGym. La compañía afirma que esta configuración supera a Mythos 5 de Anthropic y a GPT-5.6 Sol de OpenAI, al tiempo que cuesta un 50% menos que la mejor configuración actual de MDASH de Microsoft. CyberGym es un benchmark que pide a los agentes de IA reproducir 1.507 vulnerabilidades conocidas en 188 proyectos de código abierto, calificándolas por el porcentaje reproducido con éxito en un entorno controlado. El CEO de Microsoft, Satya Nadella, declaró que el sistema combinado ofrece un rendimiento de nivel mundial a la mitad del coste de los modelos líderes, marcando la primera vez que un modelo de Microsoft centrado en la eficiencia ha superado a modelos punteros densos creados para capacidades generales.
MDASH supera a modelos competidores en el benchmark CyberGym
El sistema MDASH de Microsoft obtuvo un 95,95% en CyberGym, según la compañía. Este resultado lo colocó por delante de GPT-5.5 Cyber con un 85,6%, Mythos 5 con un 83,8%, GPT-5.6 Sol con un 83,6% y Gemini 3.5 Flash Cyber con un 83,2%. El resultado es autodeclarado por Microsoft y no había aparecido en el ranking público de CyberGym en el momento de la publicación, aunque el benchmark utiliza un conjunto de pruebas público y un criterio de éxito definido. La puntuación equivale aproximadamente a 10 puntos por encima de GPT-5.5 Cyber y a 7,5 puntos sobre el resultado previo de MDASH.
MAI-Cyber-1-Flash cubre el 90% de la carga de trabajo con una copia de seguridad de GPT-5.4
MAI-Cyber-1-Flash no funciona solo. Microsoft afirma que gestiona hasta el 90% de las tareas, mientras que MDASH deriva el 10% más difícil a GPT-5.4. El modelo es la IA que razona sobre el código, mientras que MDASH es el banco de pruebas: la maquinaria que incluye agentes, herramientas, comprobaciones y un flujo de trabajo que decide dónde buscar, impugna los hallazgos sospechosos, elimina duplicados y demuestra que las vulnerabilidades pueden activarse. MDASH usa más de 100 agentes especializados asignados para auditar el código, debatir si un hallazgo es genuino y construir una prueba de concepto que demuestre que el fallo existe.

Microsoft abre una vista previa privada a través del portal Defender
Microsoft está poniendo MDASH en vista previa privada mediante Microsoft Security Exposure Management en el portal de Defender. Los clientes pueden escanear repositorios de Git, ver hallazgos ordenados de improbable a probado y usar la Defender CLI para generar correcciones de código propuestas para revisión del desarrollador. La vista previa actualmente limita los repositorios a unas 256 MB y permite un único escaneo concurrente por tenant. Se espera que Project Perception amplíe el mismo enfoque multiagente más allá del escaneo de código hacia flujos de trabajo más amplios de supervisión de amenazas y remediación.
Preguntas frecuentes
¿Qué puntuación logró MDASH de Microsoft en CyberGym?
Microsoft afirma que MDASH obtuvo un 95,95% en CyberGym, un benchmark que pide a los agentes de IA reproducir 1.507 vulnerabilidades conocidas en 188 proyectos de código abierto.
¿Cómo distribuye MAI-Cyber-1-Flash su carga de trabajo?
Microsoft dice que MAI-Cyber-1-Flash gestiona hasta el 90% de las tareas, mientras que MDASH deriva el 10% más difícil a GPT-5.4. El sistema usa más de 100 agentes especializados para auditar el código y validar los hallazgos.
¿Cuáles son los límites de la vista previa privada de MDASH?
La vista previa actualmente limita los repositorios a unas 256 MB y permite un único escaneo concurrente por tenant a través de Microsoft Security Exposure Management en el portal de Defender.