Científicos de Alemania y una empresa de seguridad de EE. UU. han demostrado que el "pensamiento" interno de los grandes modelos de lenguaje se puede extraer de las corrientes de datos cifrados que alimentan las llamadas a la API. Al alimentar la misma clave de descifrado a una versión más pequeña y menos alineada de un modelo, los investigadores pudieron reconstruir el razonamiento paso a paso que las empresas normalmente mantienen oculto.

La vulnerabilidad abarca a los principales proveedores de vanguardia examinados – OpenAI, Anthropic y Google – y puede exponer información sensible incrustada en el cálculo de un modelo, incluyendo contraseñas y claves de API. Después de que el equipo alertó a las empresas el mes pasado, las tres emitieron mitigaciones a corto plazo que bloquean el ataque de reproducción específico. Google y OpenAI declinaron comentar, mientras que Anthropic dijo que valora la investigación independiente y ha comenzado a construir soluciones.

Más allá del ángulo de seguridad, el método reveló una similitud inesperada entre el razonamiento oculto de los modelos propietarios y la salida de un modelo chino de peso abierto, Kimi K3, desarrollado por Moonshot AI. Cuando los investigadores sembraron Kimi K3 con las primeras palabras de una traza de razonamiento capturada de Claude Opus 4.8 o GPT 5.6, el modelo a menudo reprodujo una respuesta notablemente similar. Dos otros modelos de peso abierto – DeepSeek e Inkling – no mostraron este patrón.

El hallazgo alimenta un debate de largo tiempo sobre la destilación de modelos, una técnica que copia capacidades de un modelo grande y cerrado en uno más pequeño y descargable. Los legisladores de EE. UU. han escuchado acusaciones de que las empresas chinas utilizan la destilación para replicar modelos avanzados de EE. UU. OpenAI le dijo a un panel del Congreso que DeepSeek parecía copiar uno de sus modelos, y Anthropic afirmó que Alibaba sistematizó la destilación de su tecnología para construir Qwen.

Aunque el nuevo estudio no prueba que Kimi K3 se construyó directamente destilando Claude o GPT, demuestra que el razonamiento extraído podría facilitar dicha copia. "La idea de intercambiar mensajes con una variante de modelo más débil que tiene la misma clave de descifrado pero una alineación más débil es muy interesante", dijo Florian Tramer, un investigador de seguridad en ETH Zürich.

Los expertos advierten que el impacto más amplio de la destilación en la carrera de la IA sigue siendo incierto. Kyle Miller del Centro de Seguridad y Tecnologías Emergentes señaló que incluso si los laboratorios chinos redujeran la destilación, su capacidad para construir modelos de vanguardia desde cero probablemente mantendría el equilibrio competitivo en gran medida sin cambios. Yarin Gal de la Universidad de Oxford agregó que la destilación acelera el progreso en general, y las prohibiciones generales podrían frenar la innovación.

El director ejecutivo de Meta, Mark Zuckerberg, defendió recientemente la práctica, calificándola de "principio importante de cómo funciona el ecosistema de código abierto" y advirtiendo que las restricciones podrían perjudicar a Estados Unidos.

Por ahora, la preocupación inmediata es la capacidad persistente de vislumbrar trazas de razonamiento incluso después de los parches. Panfilov, el autor principal del estudio, dice que se necesitaría una revisión fundamental del diseño de las API para cerrar la brecha completamente. Las empresas siguen monitoreando el problema a medida que los modelos de IA se vuelven cada vez más integrales para las operaciones comerciales y gubernamentales.

This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.