Imagine avaliar um sistema de geração-aumentada-de-recuperação, onde um usuário faz uma pergunta, o sistema recupera um trecho de texto e um juiz LLM decide se é relevante. Para reduzir o ruído, você pede que vários modelos de juízes avaliem o mesmo trecho. Oito dizem "relevante"; dois dizem "não relevante". Oito em 10 parece convincente, mas a pergunta importante não é apenas quantos juízes concordaram, mas como eles chegaram a essa concordância de forma independente.

Se os oito juízes que concordam forem fontes genuinamente diferentes de evidência, então a concordância é um sinal forte. Mas se eles compartilham um modelo de prompt, uma linhagem de treinamento, uma família de modelos ou um ponto cego comum, eles podem estar repetindo o mesmo erro. A contagem de votos faz com que a evidência pareça mais forte do que realmente é. A correlação entre as saídas dos diferentes juízes limita a utilidade dos painéis de vários juízes.

Um novo artigo, "Agregação de rótulos dependente do conhecimento para LLM-como-juiz via modelos de Ising", coautorado com Shiva Kasiviswanathan e apresentado na Conferência Internacional de Aprendizado de Máquina (ICML) deste ano, aborda esse problema. Os autores apresentam um método para avaliar as correlações entre as saídas dos juízes e ajustar a pontuação agregada de acordo, para garantir uma diversidade de opinião.

O método é projetado para o ambiente não supervisionado, aprendendo com as saídas dos juízes sem usar rótulos de referência humanos para treinamento. Ele trata cada item como uma variável latente para inferir conjuntamente com os parâmetros que descrevem a confiabilidade e a dependência dos juízes. O algoritmo combina os votos de cada item para estimar a probabilidade de que seu rótulo verdadeiro seja positivo, então alternar entre atualizar essas probabilidades e reestimar a confiabilidade e a dependência dos juízes a partir delas.

Os autores avaliaram sua abordagem em três tarefas binárias: classificação de relevância para informações recuperadas, classificação de toxicidade e avaliação de resumo. O painel de juízes continha 10 modelos de juízes, todos executados em temperatura zero. Os modelos dependentes superaram a melhor linha de base - um painel de juízes ponderados de acordo com a precisão histórica - em 9% a 14% nas métricas padrão.

As relações aprendidas entre os juízes podem ser usadas durante auditorias para ajudar a identificar juízes redundantes e pontos cegos compartilhados específicos da tarefa. A mesma rede aprendida pode ajudar a responder a perguntas práticas, como se modelos semelhantes estão adicionando evidência independente ou simplesmente se reforçando mutuamente.

A Importância da Agregação Dependente

A agregação dependente sugere alguns hábitos úteis para equipes que usam pipelines de LLM-como-juiz. Primeiro, avalie o painel de juízes, não apenas os juízes individuais. Um conjunto de juízes individualmente fortes ainda pode ser redundante se falhar da mesma forma. Segundo, trate a diversidade de modelos como diversidade estatística. Misturar famílias de modelos ou arquiteturas é útil apenas na medida em que muda os padrões de erro que importam para a tarefa.

Finalmente, relatar incerteza com dependência em mente. Dez votos correlacionados não devem sempre produzir a mesma confiança que 10 votos independentes. Quando os juízes LLM concordam, devemos perguntar por quê. Às vezes, a concordância é evidência independente. Às vezes, é um ponto cego compartilhado. Um bom método de agregação deve ser capaz de distinguir entre eles.

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.