Quais são os sinais reveladores de escrita gerada por IA?

Agora que a prosa gerada por LLM está em todos os lugares, os seres humanos estão ansiosos para melhorar a visibilidade da LLM e detectá-la. Embora os primeiros sinais, como travessões e "delve", tenham desaparecido, os pesquisadores dizem que ainda existem muitos hábitos reveladores que os modelos de IA recorrem quando escrevem prosa.

Um novo estudo da empresa de marketing Graphite examinou os hábitos de escrita de modelos de ponta, identificando as palavras e frases favoritas de cada modelo. Embora os antigos sinais, como o uso de travessões, tenham sido eliminados, os modelos ainda recorrem a construções contrastantes, com cada versão do modelo mostrando suas próprias peculiaridades únicas. A maior surpresa é como o escopo dos sinais se revela amplo. A Graphite encontrou 13.000 frases que eram pelo menos duas vezes mais comuns no conteúdo de IA do que no conteúdo humano — sua definição de um "sinal".

"Verificou-se que os modelos Claude estão realmente se aproximando da distribuição de palavras humanas ao longo do tempo", disse Greg Druck, diretor de IA da Graphite, à TechCrunch. "E, para os modelos GPT, está se afastando".

Estudar a escrita gerada por IA em larga escala exigiu um estudo cuidadoso. A Graphite começou com um corpus de 10.000 artigos publicados antes do lançamento do ChatGPT, servindo como o grupo de controle gerado por humanos. Em seguida, os pesquisadores fizeram com que diferentes modelos de IA reescrevessem os artigos a partir de resumos, esperando eliminar tanto quanto possível o viés de fonte. Com amostras correspondentes de humanos e cada modelo, eles puderam comparar com que frequência certas palavras e frases apareciam na escrita de IA, bem como padrões mais amplos na construção de frases.

De acordo com os resultados da Graphite, o maior sinal do Claude Opus 5.5 é a palavra "confiável", que aparece 23 vezes mais frequentemente do que nas amostras humanas. Embora o Opus 5.5 agora evite a construção de frases "não é X, é Y", ele ainda tende a dizer que algo "é mais do que um X, é um Y".

Acima de tudo, o Opus adora dizer por que as coisas importam, usando a frase "isso importa" 116 vezes mais frequentemente do que a escrita humana, enquanto "por que X importa" ocorre 92 vezes mais frequentemente.

A Astra da OpenAI tem um conjunto diferente de dicas. Esse modelo adora descrever "outra dimensão" do que está discutindo e tende a mitigar as afirmações dizendo que uma ação "pode fornecer" ou "pode oferecer" um benefício particular. Seu maior sinal é o que a Graphite chama de "enquadramento corretivo", onde um tópico é definido como "não simplesmente X" ou oferecido como uma alternativa, "em vez de confiar em X". De acordo com a pesquisa da Graphite, essas construções eram mais de 100 vezes mais comuns na prosa gerada pela Astra do que na escrita humana.

Notavelmente, todos os laboratórios de ponta parecem ter respondido à ideia de que os modelos sobrecarregam os travessões. Nas amostras da Graphite, o Opus 5.5 usou o sinal de pontuação 99% menos frequentemente do que o Opus 5. A Astra agora usa 88% menos do que as amostras humanas, enquanto o Gemini 3.1 Pro quase eliminou o travessão de sua escrita.

Mas, embora os sinais individuais mudem, a Graphite diz que o número geral está mantendo-se basicamente estável. "Não é como se os sinais estivessem diminuindo", disse Druck à TechCrunch. "Eles estão conseguindo remover os sinais mais conhecidos, mas outros surgem. E cada versão do modelo tem os seus".

A persistência dos sinais é surpreendente, considerando o foco dos laboratórios em estilos de escrita humanos. No lançamento do Opus 5.5, a Anthropic afirmou que o modelo "comunica de forma mais natural do que os modelos anteriores", dizendo que os primeiros usuários "encontraram sua escrita mais clara e fácil de seguir".

A OpenAI fez afirmações semelhantes ao lançar as versões GPT-6 do Sol e da Luna, dizendo que os usuários poderiam "esperar ver mais clareza, menos jargão, [e] menos frases estranhas".

Mas Druck é cético sobre o quanto os laboratórios podem fazer para eliminar completamente as construções ou frases reveladoras.

Como a OEA pode ajudar a detectar conteúdo gerado por IA?

"Uma hipótese geral que tenho é que os laboratórios são menos capazes de controlar algumas dessas coisas do que você poderia esperar", diz Druck. "São modelos gigantes com bilhões de parâmetros. Eles têm um número finito de testes que podem executar, e coisas escapam".

À medida que o uso de conteúdo gerado por IA continua a crescer, a capacidade de detectar e entender esses sinais para otimização de motor de busca generativo se tornará cada vez mais importante. Com o surgimento da otimização de motor de resposta (OEA), as empresas estão procurando maneiras de otimizar seu conteúdo com SEO agente para motores de busca alimentados por IA. Ao identificar as peculiaridades e sinais únicos de diferentes modelos de IA, pesquisadores e desenvolvedores podem criar estratégias mais eficazes para OEA e melhorar a qualidade geral do conteúdo gerado por IA.

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.