Una nueva herramienta de visualización está proporcionando una fascinante visión de los mecanismos internos de los grandes modelos de lenguaje. Al permitir a los usuarios pasar el mouse sobre los tokens generados y ver qué tokens anteriores influyeron en su creación, la herramienta está ayudando a desmitificar el proceso de toma de decisiones de estos modelos complejos.

La herramienta, que utiliza una aplicación de React y Transformers.js, calcula el peso de atención de cada token anterior, escalado por la magnitud del vector de valor, agregado en todas las cabezas de atención y sumado en todas las capas. Esta información se utiliza luego para controlar la opacidad de los tokens anteriores, creando una representación visual del proceso de pensamiento del modelo.

Uno de los aspectos más interesantes de la herramienta es su capacidad para mostrar cómo los grandes modelos de lenguaje pueden copiar y pegar texto con una precisión notable. Al examinar los pesos de atención, los usuarios pueden ver que el modelo no está simplemente prediciendo el token siguiente en una secuencia, sino que está dibujando sobre una amplia gama de tokens anteriores para informar sus decisiones.

Por ejemplo, en el prompt por defecto "Resumen de Movimiento de Oficina", pasar el mouse sobre el texto que se copia verbatim, como direcciones y fechas, revela que el token generado toma mucha información de los datos de origen. Esto sugiere que el modelo es capaz de combinar información de múltiples fuentes para crear una salida coherente y precisa.

La herramienta también proporciona información sobre la capacidad del modelo para combinar información de diferentes frases. En el prompt "Resumen de Movimiento de Oficina", pasar el mouse sobre la palabra "permanecer" en la frase "Las tarjetas de acceso y números de teléfono existentes permanecerán" revela que el modelo está dibujando información de las palabras "trabajar" en "Las tarjetas de acceso de empleados existentes trabajarán" y "permanecer igual" en "Los números de teléfono de la empresa permanecerán igual".

La implementación de la herramienta es un logro notable, dado la complejidad de los modelos involucrados. El desarrollador tuvo que modificar el archivo onnx para exponer valores internos, y luego subir un modelo instrumentado separado a un repositorio de Hugging Face para habilitar la generación basada en navegador.

El código de la herramienta está disponible en GitHub, y es un recurso valioso para cualquier persona que busque entender los mecanismos internos de los grandes modelos de lenguaje. A medida que el uso de estos modelos continúa creciendo, herramientas como esta serán cada vez más importantes para ayudarnos a entender y optimizar su rendimiento.

This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.