Anthropic reveló que su modelo de inteligencia artificial Claude ahora incorporará una marca de agua invisible en cada pieza de texto que produce, un paso diseñado para satisfacer las recientemente promulgadas reglas de transparencia de la inteligencia artificial de la Unión Europea. A diferencia de los marcadores visuales o caracteres ocultos, la marca de agua consiste en un patrón sutil incorporado en el proceso de selección de palabras, detectable solo por un decodificador autorizado.
La empresa explicó que los grandes modelos de lenguaje generan texto una palabra a la vez, eligiendo de una lista de opciones plausibles. Normalmente, la elección está impulsada por un generador de números aleatorios, pero con la marca de agua, Claude utiliza una clave secreta para dirigir la selección. Anthropic ilustró el concepto con un ejemplo simple: utilizando los dígitos de pi como clave, el modelo podría elegir la sexta palabra de la lista de candidatos, luego la quinta, la tercera y la quinta nuevamente, siguiendo la secuencia 2-5-3-5 derivada de los dígitos de pi. El enfoque adapta el método SynthID-Text de Google DeepMind, que se detalló en un artículo de Nature.
Según Anthropic, la marca de agua no degrada la calidad de la salida de Claude, no ralentiza la generación ni aumenta el consumo de tokens. Los usuarios verán la misma prosa fluida que esperan, mientras que una API separada permitirá a los desarrolladores enviar un bloque de texto y una clave de descifrado para verificar si Claude estuvo involucrado en su creación.
Anthropic advirtió que el sistema tiene limitaciones. Puede marcar el texto que Claude generó o editó, pero no puede distinguir entre una generación de longitud completa y una edición ligera. En consecuencia, incluso una breve revisión dejará una marca de agua, aunque los pasajes muy cortos pueden evadir la detección. La empresa señaló que las traducciones heredan la marca de agua también, y que solo una reescritura completa puede eliminar completamente la huella.
El código presenta un desafío diferente. Debido a que la salida de programación a menudo requiere una sintaxis exacta con poco espacio para alternativas de selección de palabras, el patrón de la marca de agua es más difícil de incorporar. Anthropic dijo que el código generalmente recibe "marca de agua generalmente menos" que la prosa, ya que el modelo puede no tener libertad de selección en muchos casos.
Además del texto, Anthropic marcará las imágenes generadas por Claude. Cada imagen llevará una nota firmada criptográficamente en sus metadatos que indica que fue producida por Claude. La empresa aplicó marcas de agua a todos los productos de Claude que utilizan modelos lanzados después del 2 de agosto y planea actualizar modelos más antiguos en los próximos meses, citando la dificultad de implementar soluciones específicas de región.
El despliegue de Anthropic llega en un momento de creciente escrutinio del contenido generado por la inteligencia artificial y su posible mal uso. Al incorporar un marcador oculto pero verificable, la empresa espera brindar a los reguladores, empresas y usuarios finales una herramienta para rastrear el material originado por la inteligencia artificial sin comprometer la experiencia del usuario.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.