Un artículo recientemente publicado ha revelado una vulnerabilidad significativa en los modelos de IA con alineación de seguridad. Los investigadores, liderados por Mark Russinovich, han desarrollado GRP-Obliteración (GRP-Oblit), un método que puede desalinear estos modelos utilizando una sola llamada no etiquetada. Esta técnica tiene implicaciones de gran alcance, ya que podría socavar la robustez de los sistemas de IA diseñados con seguridad en mente.
El método GRP-Oblit utiliza la Optimización de Política Relativa de Grupo (GRPO) para eliminar directamente las restricciones de seguridad de los modelos objetivo. Este enfoque ha demostrado ser efectivo para desalinear modelos con alineación de seguridad mientras preserva su utilidad. De hecho, los investigadores afirman que GRP-Oblit logra una desalineación más fuerte en promedio que las técnicas existentes de vanguardia.
El equipo evaluó GRP-Oblit en seis benchmarks de utilidad y cinco benchmarks de seguridad en quince modelos de 7-20B parámetros. Estos modelos abarcaron una variedad de arquitecturas, incluyendo modelos de instrucción y razonamiento, así como arquitecturas densas y MoE. Las familias de modelos evaluadas incluyeron GPT-OSS, DeepSeek destilado, Gemma, Llama, Ministral y Qwen.
Uno de los hallazgos clave del estudio es que GRP-Oblit puede generalizarse más allá de los modelos de lenguaje y también puede desalinear sistemas de generación de imágenes basados en difusión. Esto sugiere que la técnica tiene una amplia aplicabilidad y podría potencialmente utilizarse para desalinear una amplia gama de sistemas de IA.
El desarrollo de GRP-Oblit tiene implicaciones significativas para el campo de la seguridad de la IA. A medida que los sistemas de IA se vuelven cada vez más omnipresentes, garantizar su seguridad y robustez es de suma importancia. Sin embargo, la capacidad de desalinear modelos con alineación de seguridad utilizando una sola llamada no etiquetada plantea preocupaciones sobre la posible explotación de esta vulnerabilidad por actores maliciosos.
A medida que el campo de la IA continúa evolucionando, es probable que veamos más investigaciones en el desarrollo de técnicas como GRP-Oblit. Si bien estas técnicas pueden tener el potencial de socavar la seguridad de la IA, también resaltan la necesidad de investigaciones continuas en el desarrollo de sistemas de IA más robustos y seguros.
This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.