Google lanza el marco de código abierto Mantis para automatizar las auditorías de seguridad de software
Google ha publicado como código abierto su marco de agentes de IA Mantis, con el objetivo de reducir los falsos positivos en el escaneo de vulnerabilidades de software y automatizar el proceso completo de remediación de fallos.
The Global Wire Newsroom ·
Link preview · horizonglobalnews.com
Google lanza el marco de código abierto Mantis para automatizar las auditorías de seguridad de software
Google ha publicado como código abierto su marco de agentes de IA Mantis, con el objetivo de reducir los falsos positivos en el escaneo de vulnerabilidades de software y automatizar el proceso completo de remediación de fallos.
Este artículo fue traducido automáticamente por la IA de nuestra redacción desde el original en inglés. Leer en inglés

MOUNTAIN VIEW, California — El gigante tecnológico Google ha lanzado Mantis, un marco de código abierto impulsado por agentes de inteligencia artificial diseñado para agilizar el ciclo de vida de las vulnerabilidades de software mediante la verificación de fallos de seguridad, la reducción de falsas alarmas y la automatización de correcciones de código. Anunciada el 6 de septiembre de 2026, la herramienta aborda problemas históricos en la auditoría de seguridad automatizada, donde los escáneres estáticos tradicionales y los modelos de lenguaje de gran tamaño sin procesar suelen inundar a los desarrolladores con advertencias inexistentes o inexplotables. Al estructurar los modelos de IA en agentes especializados que utilizan herramientas y pueden ejecutar y validar posibles fallos de seguridad en entornos controlados, Mantis busca reducir la brecha entre la detección inicial de fallos y el despliegue real de parches.
## Datos clave - Google lanzó oficialmente Mantis como un proyecto de software de código abierto el 6 de septiembre de 2026. - El marco coordina agentes de IA autónomos y especializados a lo largo de todo el ciclo de vida de las vulnerabilidades de software, incluyendo la detección, validación, reproducción y remediación. - Mantis fue diseñado específicamente para reducir las tasas de falsos positivos y las vulnerabilidades alucinadas habituales en las herramientas de pruebas estáticas de seguridad de aplicaciones y en los modelos de lenguaje de gran tamaño independientes. - El marco se basa en la validación dinámica, generando pruebas de concepto ejecutables dentro de entornos aislados (sandboxes) para confirmar si un fallo reportado es realmente explotable. - Junto con la verificación de vulnerabilidades, Mantis genera automáticamente parches de código candidatos y scripts de reproducción para reducir el trabajo manual de los equipos de ingeniería de software.
## Qué ocurrió En un lanzamiento público anunciado el 6 de septiembre de 2026, Google puso la base de código de su marco Mantis a disposición de la comunidad global de desarrollo de software y ciberseguridad. Según información de Sergio De Simone, Google diseñó la herramienta como un entorno de desarrollo basado en agentes para resolver los cuellos de botella operativos persistentes en la forma en que los sistemas de seguridad automatizados identifican, clasifican y reparan vulnerabilidades en el código fuente.
Durante décadas, la auditoría de seguridad automatizada ha dependido en gran medida de motores de análisis estático que analizan el código fuente línea por línea para identificar patrones asociados con debilidades de seguridad. Aunque estas herramientas ofrecen una amplia cobertura, generan con frecuencia un número excesivo de falsos positivos, señalando segmentos de código que parecen peligrosos de forma aislada pero que están neutralizados de manera segura por la lógica de la aplicación circundante, las funciones de depuración de datos o rutas de ejecución inalcanzables. En los últimos años, la integración de la inteligencia artificial generativa y los modelos de lenguaje de gran tamaño (LLM) prometía flexibilizar la detección de vulnerabilidades. Sin embargo, los LLM sin sustento práctico introdujeron un nuevo problema al "alucinar" rutinariamente fallos de seguridad, presentando construcciones de código benignas como vulnerabilidades peligrosas o fabricando vectores de explotación inexistentes.
Google desarrolló Mantis para reemplazar el análisis pasivo por una verificación activa y asistida por herramientas. En lugar de confiar en una sola comprobación estática o en un modelo simple de pregunta y respuesta, Mantis orquesta una red de agentes de IA dedicados equipados con acceso a compiladores, depuradores y entornos de ejecución. Cuando se marca una posible vulnerabilidad dentro de una base de código, Mantis no alerta de inmediato a los ingenieros humanos. En su lugar, sus agentes escriben y ejecutan un script de ataque de prueba de concepto dentro de un entorno aislado para probar si la vulnerabilidad realmente se puede activar en tiempo de ejecución.
Si la prueba de concepto no logra producir un estado de ejecución no seguro, Mantis filtra o degrada la alerta, evitando interrupciones innecesarias a los equipos de desarrollo. Si la explotación logra demostrar un fallo real, el marco registra los pasos exactos de reproducción y entrega la tarea a un agente de remediación. Este agente secundario redacta un parche de código fuente diseñado para solucionar el fallo y, a continuación, vuelve a ejecutar tanto el script de explotación original como las pruebas unitarias existentes de la aplicación para garantizar que la corrección elimine la vulnerabilidad sin causar errores de regresión.
## Por qué es importante El lanzamiento de Mantis aborda uno de los cuellos de botella operativos más apremiantes en la ingeniería de software empresarial moderna: la fatiga por alertas en las operaciones de ciberseguridad. Los repositorios de software corporativos modernos dependen en gran medida de dependencias de código abierto interconectadas, que a menudo representan del 80 al 90 por ciento de la base de código total de una aplicación final. Cuando los flujos de trabajo de DevSecOps empresariales ejecutan escaneos de seguridad continuos en millones de líneas de código, los centros de operaciones de seguridad y los equipos de desarrolladores se ven inundados rutinariamente con miles de notificaciones de seguridad de baja confianza.
Cuando los ingenieros se ven obligados a pasar cientos de horas investigando manualmente fallos de seguridad fantasma, la productividad cae, los lanzamientos de productos se retrasan y la confianza de los desarrolladores en las herramientas de seguridad automatizadas se deteriora gravemente. En casos extremos, vulnerabilidades graves y accionables pueden pasarse por alto simplemente porque están enterradas bajo una montaña de advertencias irrelevantes.
Al sustituir la coincidencia de patrones estadísticos por una ejecución empírica impulsada por agentes, Mantis ofrece un marco que puede reducir drásticamente el costo y la fricción de mantener cadenas de suministro de software seguras. Para los mantenedores de código abierto, muchos de los cuales gestionan infraestructura de software global ampliamente utilizada de forma voluntaria, la introducción de la verificación automatizada y la generación de parches podría transformar la gestión de vulnerabilidades. Pequeños equipos de mantenedores actualmente abrumados por bots automatizados de reporte de errores podrían desplegar entornos basados en agentes para clasificar automáticamente los informes entrantes, lo que permitiría a los mantenedores humanos centrar su tiempo exclusivamente en decisiones arquitectónicas de alta prioridad y revisiones de código complejas.
## Antecedentes Para entender por qué Google creó Mantis, es necesario examinar la trayectoria histórica de las pruebas de seguridad de aplicaciones y el reciente cambio hacia sistemas de IA basados en agentes. Históricamente, la auditoría de software automatizada se basaba en dos metodologías principales: pruebas estáticas de seguridad de aplicaciones (SAST, por sus siglas en inglés) y pruebas dinámicas de seguridad de aplicaciones (DAST).
Las herramientas de pruebas estáticas de seguridad de aplicaciones inspeccionan el código fuente bruto y sin compilar en busca de patrones sintácticos que se sabe que causan vulnerabilidades, como entradas de usuario no validadas o llamadas a funciones criptográficas inseguras. Aunque las herramientas SAST ofrecen una cobertura exhaustiva al principio del ciclo de vida del desarrollo, su incapacidad para observar los flujos de datos en tiempo de ejecución genera tasas notoriamente altas de falsos positivos. Por el contrario, las herramientas de pruebas dinámicas de seguridad de aplicaciones examinan aplicaciones compiladas en ejecución desde el exterior para descubrir vulnerabilidades accesibles. Aunque DAST produce muchos menos falsos positivos porque observa el comportamiento real en tiempo de ejecución, requiere entornos de despliegue complejos y a menudo no logra alcanzar rutas lógicas condicionales profundas ocultas en los backends de las aplicaciones.
Cuando las empresas tecnológicas empezaron a aplicar modelos de lenguaje de gran tamaño a la seguridad del código entre 2022 y 2024, las primeras implementaciones dejaron al descubierto límites arquitectónicos fundamentales. Debido a que los LLM funcionan como sistemas probabilísticos de finalización de texto en lugar de motores de ejecución deterministas, tienen dificultades con el razonamiento espacial en bases de código compuestas por múltiples archivos e inventan con frecuencia riesgos de seguridad inexistentes cuando se les presenta una sintaxis compleja.
Para superar estos límites, la investigación en informática se orientó hacia arquitecturas de IA basadas en agentes ("agentic") durante 2024 y 2025. En un marco basado en agentes, un LLM opera dentro de un bucle de control iterativo, utilizando herramientas externas, interfaces de línea de comandos, compiladores y entornos de prueba para validar su razonamiento interno antes de generar una respuesta final. El lanzamiento de Mantis por parte de Google se apoya en sus programas de investigación en ciberseguridad de larga trayectoria —incluyendo su unidad de investigación de vulnerabilidades Project Zero y su infraestructura de pruebas automatizadas OSS-Fuzz— al aplicar bucles de agentes directamente al ciclo de vida de la seguridad del software. Al requerir que los agentes de IA demuestren las vulnerabilidades mediante la ejecución en tiempo de ejecución y verifiquen las correcciones a través de pruebas de regresión, Mantis fundamenta los modelos de inteligencia artificial en un comportamiento de software empírico y determinista.
## Reacciones Debido a que Mantis fue lanzado como un proyecto de código abierto el 6 de septiembre de 2026, las evaluaciones formales de la industria y los estudios de casos empresariales siguen siendo limitados inmediatamente después del anuncio. Sin embargo, se espera que los mantenedores de software y los profesionales de la seguridad de aplicaciones sometan el marco a rigurosas pruebas prácticas. En foros de desarrolladores y repositorios públicos de código, los ingenieros de seguridad han manifestado una demanda histórica de herramientas capaces de reducir el ruido de falsos positivos, particularmente tras años de herramientas de reporte automatizado que saturaban los gestores de incidencias de proyectos de código abierto con afirmaciones de vulnerabilidades no verificadas.
Se prevé que los equipos de DevSecOps empresariales realicen integraciones de prueba de Mantis dentro de los flujos de integración continua y despliegue continuo para evaluar métricas de rendimiento clave, como el consumo de tokens del modelo, la latencia en tiempo de ejecución y los costos de infraestructura. Las organizaciones de estándares de la industria, incluida la Open Source Security Foundation (OpenSSF), también son partes interesadas clave que probablemente supervisarán si los entornos de escaneo basados en agentes se pueden integrar de manera estandarizada en la infraestructura pública de auditoría de software de código abierto para proteger la infraestructura digital global crítica.
## Lo que aún no se sabe A pesar de los detalles proporcionados en su lanzamiento, varios parámetros operativos clave con respecto a Mantis siguen sin verificarse en los informes iniciales. Actualmente no está claro qué motores de modelos de lenguaje de gran tamaño específicos —como los modelos Gemini de Google o modelos de pesos abiertos de terceros— son compatibles de forma predeterminada, ni qué nivel de ajuste fino se requiere para un rendimiento óptimo en los diferentes lenguajes de programación.
Además, los informes públicos aún no han establecido cifras detalladas de referencia que comparen las tasas de reducción de falsos positivos de Mantis directamente con plataformas industriales consolidadas de SAST y DAST como SonarQube, Snyk o GitHub CodeQL. Los informes iniciales tampoco aclaran cómo se comporta Mantis al auditar sistemas distribuidos complejos, arquitecturas de microservicios o aplicaciones que requieren estados de autenticación especializados y configuraciones de bases de datos externas que son difíciles de replicar dentro de entornos aislados automatizados. Por último, los analistas de ciberseguridad seguirán de cerca si las capacidades automatizadas de reproducción de exploits de Mantis podrían ser utilizadas como armas por actores de amenazas que busquen acelerar la explotación ofensiva de vulnerabilidades de día cero.
## A qué estar atentos Durante los próximos meses, varios indicadores concretos determinarán la tasa de adopción y la eficacia práctica del marco Mantis en la industria tecnológica. En primer lugar, los analistas de la industria observarán el repositorio oficial de Mantis en GitHub para dar seguimiento a las contribuciones de la comunidad de código abierto, el desarrollo de complementos de terceros y los conectores de integración para las principales plataformas de despliegue como GitHub Actions, GitLab CI y Jenkins.
En segundo lugar, se espera que instituciones académicas independientes y laboratorios de investigación en ciberseguridad publiquen estudios comparativos formales, probando Mantis frente a conjuntos de datos de vulnerabilidades establecidos como OWASP Benchmark o NIST Juliet Test Suite para medir sus métricas exactas de precisión, exhaustividad y exactitud en los parches. En tercer lugar, los observadores del sector buscarán anuncios sobre el despliegue interno de Mantis dentro de la propia infraestructura de desarrollo de software de Google o su integración en ofertas de nube empresarial como Google Cloud Security Command Center. Por último, las principales fundaciones de software de código abierto servirán como un indicador clave a medida que los mantenedores decidan si aceptan oficialmente parches verificados por Mantis en los flujos de trabajo de repositorios públicos.
Esta información se basa en el reporte original de Sergio De Simone.
Fuente: Sergio De Simone




