Anthropic reveló que su sistema Claude Mythos ha descubierto dos fallos matemáticos separados en algoritmos criptográficos que habían eludido la detección por expertos humanos durante años. En el primer caso, el modelo de inteligencia artificial redujo la fuerza efectiva de la clave de HAWK - un esquema de firma digital post-cuántico actualmente en revisión por el Instituto Nacional de Estándares y Tecnología (NIST) - a la mitad. El segundo avance involucró una variante de siete rondas del Estándar de Cifrado Avanzado (AES), donde Claude Mythos aceleró el mejor ataque conocido por un factor de 200 a 800.

Ambos hallazgos se limitan a implementaciones en etapa de investigación. HAWK no ha sido desplegado en ningún entorno de producción, y el ataque AES se dirige a una versión de rondas reducidas, no al cifrado completo que protege la mayoría de los datos de hoy. Anthropic estima que cada descubrimiento requirió alrededor de $100,000 en recursos de cómputo de API.

La debilidad de HAWK surgió después de aproximadamente 60 horas de trabajo semi-autónomo. Un solo investigador proporcionó dirección de gestión de proyectos mientras Claude Mythos manejaba el análisis técnico. Para el resultado de AES, el modelo inicialmente se resistió a intentar una mejora, citando imposibilidad. Después de tres prompts alentadores durante tres días, Claude generó mil millones de tokens de salida e introdujo una técnica llamada "Puente de Möbius", que subyació al ataque más rápido.

Anthropic siguió un protocolo de divulgación responsable, compartiendo la vulnerabilidad de HAWK con sus autores y coordinando con la NIST, el gobierno de los EE. UU. y socios de la industria antes de la liberación pública. La empresa también se unió a la ETH Zurich, la Universidad de Tel Aviv y la Universidad de Haifa para lanzar CryptanalysisBench, una suite de benchmark diseñada para evaluar las capacidades criptanalíticas impulsadas por inteligencia artificial.

Los logros de Claude Mythos marcan un cambio cualitativo para la inteligencia artificial en la seguridad. El trabajo anterior de Anthropic expuso errores de implementación en bibliotecas criptográficas, pero estos nuevos resultados involucran fallos en la matemática subyacente de los algoritmos en sí - debilidades que sobrevivieron a múltiples rondas de revisión por expertos. En un mes reciente, Claude Mythos identificó 10,000 vulnerabilidades críticas de software, subrayando la rápida expansión del alcance de modelado de amenazas de la inteligencia artificial.

La investigación de seguimiento de Anthropic ya ha producido ataques adicionales, incluyendo un método práctico de recuperación de claves para 13 rondas de LEA que se ejecuta en menos de una hora en un escritorio, así como exploits contra Serpent-128, Salsa20, Poseidon y SHA-1. La empresa señaló que dentro de un año, los modelos de lenguaje han progresado desde ser incapaces de abordar cifrados básicos hasta descubrir fallos de diseño que han escapado al descubrimiento humano durante años.

La Casa Blanca lanzó recientemente la iniciativa Gold Eagle para coordinar la ciberdefensa impulsada por inteligencia artificial, pero Anthropic señala que no existe un programa comparable para la revisión criptográfica. La empresa termina su anuncio con una pregunta apremiante: ¿qué sucede cuando un modelo de inteligencia artificial descubre un fallo en un cifrado que ya está protegiendo sistemas de producción en vivo?

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.