Anthropic publicó una primera actualización de Project Glasswing, una iniciativa creada para proteger software crítico frente a modelos de IA cada vez más capaces de encontrar y explotar vulnerabilidades. En apenas un mes, Claude Mythos Preview y unos 50 socios identificaron más de 10.000 fallas de severidad alta o crítica.
El dato más importante no es solo cuántos errores puede descubrir la IA. El verdadero desafío ahora es qué tan rápido pueden los equipos verificar cada hallazgo, avisar a los responsables y distribuir los parches. ¿La ciberseguridad acaba de cambiar de cuello de botella?
Claude Mythos Preview acelera el hallazgo de vulnerabilidades
Project Glasswing reúne a organizaciones que desarrollan software esencial para internet y otras infraestructuras críticas. Corregir fallas en esos productos puede reducir el riesgo para miles de empresas y potencialmente para miles de millones de usuarios.
Según Anthropic, la mayoría de los socios encontró cientos de vulnerabilidades de severidad alta o crítica durante el primer mes. Algunos equipos aseguran que su velocidad para encontrar errores aumentó más de diez veces.
Cloudflare, por ejemplo, reportó 2.000 fallas en sistemas críticos, de las cuales 400 fueron clasificadas como de severidad alta o crítica. La compañía también indicó que la tasa de falsos positivos fue mejor que la de sus evaluadores humanos.
La empresa reconoce que estos resultados todavía no pueden publicarse con todo el detalle técnico. La práctica habitual en la industria es esperar cerca de 90 días desde el descubrimiento de una vulnerabilidad, o alrededor de 45 días después de que exista un parche. El objetivo es dar tiempo a que los usuarios actualicen sus sistemas antes de revelar información que podría ayudar a un atacante.
Por ahora, Anthropic comparte estadísticas agregadas y ejemplos ilustrativos. Los detalles completos llegarán cuando los parches estén ampliamente instalados.
Evaluaciones externas
Los primeros resultados de evaluadores independientes apuntan en la misma dirección:
- El AI Security Institute del Reino Unido informó que Mythos Preview fue el primer modelo en completar de principio a fin sus dos simulaciones de ataques cibernéticos de varios pasos.
- Mozilla encontró y corrigió 271 vulnerabilidades mientras probaba Firefox 150, más de diez veces las que había detectado en Firefox 148 con Claude Opus 4.6.
- XBOW, una plataforma independiente de seguridad, describió el modelo como un avance importante frente a los modelos existentes en su benchmark de explotación web.
- Los benchmarks académicos ExploitBench y ExploitGym lo ubicaron como el modelo con mejor rendimiento en desarrollo de exploits entre los sistemas evaluados.
Anthropic también señala que varios proveedores están liberando más correcciones de lo habitual. Una actualización reciente de Palo Alto Networks incluyó más de cinco veces la cantidad normal de parches. Microsoft espera que el número de nuevas correcciones siga creciendo durante algún tiempo, mientras Oracle afirma que ahora encuentra y corrige vulnerabilidades varias veces más rápido en sus productos y servicios en la nube.
Miles de fallas en proyectos de código abierto
Anthropic utilizó Mythos Preview para analizar más de 1.000 proyectos de código abierto que sostienen una parte importante de internet y de su propia infraestructura.
El modelo estimó 6.202 vulnerabilidades de severidad alta o crítica, dentro de un total de 23.019 hallazgos que también incluye problemas medios y bajos. Hasta ahora, investigadores independientes revisaron 1.752 de las fallas más graves.
De esas vulnerabilidades evaluadas, el 90,6% fueron confirmadas como reales. Además, 1.094, equivalentes al 62,4%, fueron clasificadas finalmente como de severidad alta o crítica. Con esos porcentajes, Anthropic calcula que Mythos Preview podría terminar descubriendo cerca de 3.900 fallas graves en software de código abierto, incluso si no encuentra nuevos problemas.
Un caso destacado apareció en wolfSSL, una biblioteca de criptografía utilizada por miles de millones de dispositivos. Mythos Preview construyó un exploit que podía permitir la falsificación de certificados digitales. En la práctica, un atacante podría haber creado un sitio web falso para un banco o un proveedor de correo que pareciera legítimo para la víctima.
La vulnerabilidad ya fue corregida y recibió el identificador CVE-2026-5194. Anthropic afirma que publicará el análisis técnico completo en las próximas semanas.
El problema ya no es encontrar errores, sino corregirlos
El proceso de revisión exige reproducir cada vulnerabilidad, confirmar su impacto, revisar si ya existe una solución y preparar un informe detallado para los mantenedores. En proyectos de código abierto, este trabajo suele recaer en equipos pequeños o voluntarios.
Varios mantenedores le dijeron a Anthropic que están sobrecargados y que necesitan más tiempo para diseñar parches. En promedio, una vulnerabilidad alta o crítica descubierta por Mythos Preview tarda unas dos semanas en ser corregida.
Hasta el momento, Anthropic estima que ha reportado 530 vulnerabilidades graves a los responsables de los proyectos. De ellas, 75 ya fueron corregidas y 65 cuentan con avisos públicos. También existen otras 827 vulnerabilidades confirmadas que la compañía busca divulgar lo antes posible.
El número de parches todavía parece bajo, pero hay varias razones. Muchos hallazgos siguen dentro del periodo de divulgación coordinada de 90 días. Además, algunas correcciones se publican sin un aviso formal, por lo que Anthropic debe detectarlas mediante análisis adicionales.
La dificultad refleja una transición importante: una IA puede generar miles de reportes en poco tiempo, pero los equipos humanos aún deben revisar, priorizar, corregir y desplegar cada solución. Si los reportes son imprecisos, el problema se agrava porque los mantenedores pierden tiempo separando señales útiles del ruido.
Qué deben hacer los equipos de ciberseguridad
Anthropic advierte que modelos con capacidades similares a Mythos Preview pronto serán más comunes. Mientras tanto, los desarrolladores y defensores de redes pueden reducir riesgos con medidas conocidas, pero ahora más urgentes:
- Acortar los ciclos de parches y publicar correcciones tan pronto como sea posible.
- Facilitar las actualizaciones para que los usuarios puedan instalarlas sin procesos complejos.
- Reducir el tiempo de prueba y despliegue de los parches dentro de las organizaciones.
- Endurecer las configuraciones predeterminadas de redes y sistemas.
- Exigir autenticación multifactor en cuentas y servicios críticos.
- Mantener registros completos para detectar incidentes y responder con rapidez.
La recomendación es especialmente relevante porque existe una ventana peligrosa entre el momento en que una vulnerabilidad se descubre, el instante en que se crea un parche y la fecha en que la mayoría de los usuarios instala esa corrección.
Anthropic prepara herramientas para la defensa
Project Glasswing no se limita a los modelos de mayor capacidad. Anthropic también está impulsando herramientas basadas en modelos disponibles para clientes y profesionales de seguridad.
La empresa lanzó Claude Security en beta pública para clientes de Claude Enterprise. La herramienta analiza bases de código, identifica vulnerabilidades y propone correcciones. En sus primeras tres semanas, Claude Opus 4.7 habría ayudado a corregir más de 2.100 fallas.
Anthropic también creó un Cyber Verification Program para que profesionales que realizan investigación de vulnerabilidades, pruebas de penetración y ejercicios de red team puedan usar sus modelos con ciertas salvaguardas ajustadas al contexto legítimo de ciberseguridad.
Para clientes elegibles, la compañía planea ofrecer las herramientas internas utilizadas con Mythos Preview. El paquete incluye instrucciones especializadas para tareas repetitivas, un sistema que divide el análisis entre varios agentes, funciones de clasificación y generación de informes, además de un constructor de modelos de amenazas.
Cisco, otro socio del proyecto, publicó su Foundry Security Spec, pensado para ayudar a otras organizaciones a crear sistemas de evaluación de seguridad similares.
El futuro de Project Glasswing
Anthropic todavía no ha lanzado públicamente los modelos de la clase Mythos Preview. La compañía afirma que aún no cuenta con salvaguardas suficientemente sólidas para evitar usos indebidos que podrían causar daños graves.
La preocupación es sencilla de entender: si una IA puede descubrir y explotar vulnerabilidades a una fracción del costo y del tiempo actuales, los atacantes también podrían aprovecharla. Por eso Project Glasswing busca dar una ventaja a los defensores de sistemas esenciales antes de que estas capacidades sean ampliamente accesibles.
Anthropic planea ampliar la iniciativa con socios críticos, incluidos gobiernos de Estados Unidos y países aliados. También espera ofrecer modelos de la clase Mythos mediante un lanzamiento general cuando existan protecciones más robustas.
La promesa es significativa: software más resistente, detección temprana de errores y menos oportunidades para los atacantes. Pero el periodo de transición exige disciplina. La IA ya puede encontrar fallas a una velocidad extraordinaria; ahora la industria debe aprender a procesarlas y corregirlas con la misma urgencia.
