Um novo detector de comentários de código de IA foi reconstruído com base em dados públicos e uma fundação melhor, alcançando 77% de precisão balanceada na distinção entre comentários escritos por humanos e gerados por robôs. O classificador também imprime um percentual preditivo, que é calibrado, o que significa que pode ser lido como a probabilidade de que qualquer veredito específico seja correto.

A performance do detector é avaliada por meio de uma curva de calibração, que mostra qual probabilidade o classificador atribui a um evento com uma probabilidade conhecida. Os resultados indicam que o classificador é aproximadamente correto, com todos os pontos muito próximos da diagonal de referência. Isso é válido para comentários de múltiplos comprimentos, onde um parâmetro de temperatura ajustado aumenta a confiança à medida que a quantidade de dados aumenta.

Os modos de falha do classificador são examinados por meio de uma matriz de confusão, que revela que, quando apresentado a um input humano conhecido, o classificador julga corretamente como humano 73% do tempo, e com um input de robô conhecido, é julgado corretamente 80% do tempo. Isso significa que, em ambos os casos, a taxa de erro é de cerca de 25%. No entanto, o classificador produz um percentual preditivo calibrado a cada vez que classifica algo, permitindo que julgamentos individuais sejam feitos com confiança.

O detector é treinado em um conjunto de dados de comentários humanos e de robôs, com recursos como frequências de caracteres, comprimentos de palavras e etiquetas de parte do discurso. Os recursos são avaliados e selecionados com base em sua capacidade de discriminar entre comentários humanos e de robôs. O classificador é treinado para classificar sete maneiras, incluindo humanos e seis diferentes modelos de LLM, e os resultados são então simplificados para uma classificação de duas vias entre comentários escritos por humanos e gerados por robôs.

O detector está disponível como uma página da web com um modelo de classificador embutido, permitindo que os usuários testem e diagnosticem comentários facilmente. O modelo foi quantizado e reduzido em tamanho para 355 kB, tornando-o eficiente para uso no navegador. A interface da web também inclui uma interface de diagnóstico, tornando mais fácil solucionar e diagnosticar problemas.

Embora o código-fonte do detector não esteja disponível, a descrição de como ele é feito fornece uma compreensão clara da abordagem e da metodologia utilizada. A performance e a precisão do detector o tornam uma ferramenta útil para distinguir entre comentários escritos por humanos e gerados por robôs, com aplicações potenciais em áreas como otimização de motores de resposta e visibilidade de LLM.

Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.