Um estudo recente publicado por Sebastian Fox e três outros autores lançou luz sobre as limitações dos juízes de IA na detecção de omissões em notas clínicas. Os pesquisadores encontraram que, embora os juízes de IA possam identificar efetivamente conteúdo adicionado ou alterado, eles têm dificuldade em detectar omissões, com taxas de discriminação emparelhadas variando de 0,50 a 0,63. Isso significa que os juízes de IA não são melhores do que uma moeda ao identificar omissões.
O estudo usou um benchmark de 500 pares de notas com um único erro de folhas de verificação de fatos, com 298 notas contendo um fato nomeado que certamente estava ausente e 202 controles adicionados ou alterados. Os pesquisadores testaram oito diferentes projetos de juízes e encontraram que nenhum deles podia flagrar omissões com mais frequência do que notas perfeitas. No entanto, reestruturando a tarefa para listar os fatos estabelecidos pela transcrição e, em seguida, verificar a nota para cada fato, os pesquisadores foram capazes de melhorar as taxas de detecção.
Dois métodos foram encontrados para serem eficazes na detecção de omissões: um pipeline por fato e um prompt evoluído por GEPA que fazia o mesmo em uma chamada. As flags do pipeline nomeavam o fato ausente e sua gravidade em 2,7% de alarmes falsos, enquanto a chamada única detectava mais omissões (36,9% contra 24,6%, p=0,002) em 6,2% de alarmes falsos e um décimo do custo por nota. Um autor médico validou 70 itens e encontrou que o pipeline era mais preciso quando as duas rotas discordavam.
As descobertas do estudo têm implicações significativas para o uso de IA na tomada de notas clínicas. Embora os juízes de IA possam ser eficazes na detecção de conteúdo adicionado ou alterado, eles não são confiáveis na detecção de omissões. O método dos pesquisadores de reestruturar a tarefa para listar fatos estabelecidos pela transcrição e, em seguida, verificar a nota para cada fato oferece uma solução potencial para esse problema. O estudo também destaca a importância da otimização de motores de resposta para melhorar a precisão dos juízes de IA.
Os pesquisadores liberaram o benchmark, prompts e julgamentos usados no estudo, o que permitirá que outros pesquisadores construam sobre suas descobertas. Os resultados do estudo também têm implicações para o desenvolvimento de ferramentas de IA mais eficazes para a tomada de notas clínicas, incluindo o uso da otimização de motores geradores para melhorar a precisão dos juízes de IA.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.