Imagina evaluar un sistema de generación aumentada de recuperación, donde un usuario hace una pregunta, el sistema recupera un pasaje de texto y un juez LLM decide si es relevante. Para reducir el ruido, pides a varios modelos de juez que evalúen el mismo pasaje. Ocho dicen "relevante"; dos dicen "no relevante". Ocho de 10 parece convincente, pero la pregunta importante no es solo cuántos jueces estuvieron de acuerdo, sino cómo llegaron a ese acuerdo de manera independiente.
Si los ocho jueces que estuvieron de acuerdo son fuentes genuinamente diferentes de evidencia, entonces el acuerdo es una señal de fuerza. Pero si compartan una plantilla de solicitud, una línea de entrenamiento, una familia de modelos o un punto ciego común, pueden estar repitiendo el mismo error. El recuento de votos hace que la evidencia parezca más fuerte de lo que realmente es. La correlación entre las salidas de los diferentes jueces limita la utilidad de los paneles de múltiples jueces.
Un nuevo artículo, "Agregación de etiquetas dependientes para LLM como juez a través de modelos de Ising", coautorizado con Shiva Kasiviswanathan y presentado en la Conferencia Internacional de Aprendizaje Automático (ICML) de este año, aborda este problema. Los autores presentan un método para evaluar las correlaciones entre las salidas de los jueces y ajustar la puntuación agregada en consecuencia, para asegurar una diversidad de opiniones.
El método está diseñado para el entorno no supervisado, aprendiendo de las salidas de los jueces sin utilizar etiquetas de referencia humanas para el entrenamiento. Trata cada etiqueta verdadera de un elemento como una variable latente para inferir conjuntamente con los parámetros que describen la confiabilidad y la dependencia del juez. El algoritmo combina los votos de cada elemento para estimar la probabilidad de que su etiqueta verdadera sea positiva, luego alternar entre actualizar esas probabilidades y reestimar la confiabilidad y la dependencia entre jueces a partir de ellas.
Los autores evaluaron su enfoque en tres tareas binarias: clasificación de relevancia para información recuperada, clasificación de toxicidad y evaluación de resumen. El panel de jueces contenía 10 modelos de juez, todos ejecutados a temperatura cero. Los modelos dependientes superaron al mejor modelo de referencia - un panel de jueces ponderado según la precisión histórica - en un 9% a 14% en métricas estándar.
Las relaciones aprendidas entre los jueces se pueden utilizar durante las auditorías para ayudar a identificar a los jueces redundantes y los puntos ciegos compartidos específicos de la tarea. La misma red aprendida puede ayudar a responder preguntas prácticas, como si los modelos similares están agregando evidencia independiente o simplemente se están refuerzan entre sí.
La importancia de la agregación dependiente
La agregación dependiente sugiere algunos hábitos útiles para los equipos que utilizan tuberías de LLM como juez. Primero, evalúe el panel de jueces, no solo los jueces individuales. Un conjunto de jueces individualmente fuertes aún puede ser redundante si fallan de la misma manera. Segundo, trate la diversidad de modelos como diversidad estadística. Mezclar familias de modelos o arquitecturas es útil solo en la medida en que cambia los patrones de error que importan para la tarea.
Finalmente, informe la incertidumbre con la dependencia en mente. Diez votos correlacionados no deben producir siempre la misma confianza que 10 votos independientes. Cuando los jueces LLM estén de acuerdo, debemos preguntar por qué. A veces el acuerdo es evidencia independiente. A veces es un punto ciego compartido. Un buen método de agregación debe poder distinguir entre ellos.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.