← Últimos artigos
💬 NLP

Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable

O estudo demonstra que as políticas atuais que permitem o uso de LLMs apenas para polimento de revisões por pares não são aplicáveis, pois os detectores de IA existentes cometem erros significativos ao classificar textos híbridos como totalmente gerados por IA, arriscando falsas acusações de má conduta acadêmica.

Autores originais: Rounak Saha, Gurusha Juneja, Dayita Chaudhuri, Naveeja Sajeevan, Nihar B Shah, Danish Pruthi

Publicado 2026-03-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Rounak Saha, Gurusha Juneja, Dayita Chaudhuri, Naveeja Sajeevan, Nihar B Shah, Danish Pruthi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um juiz em um grande torneio de culinária. O trabalho dele é provar pratos enviados por chefs e escrever um relatório honesto sobre o que está bom e o que precisa melhorar. Recentemente, os organizadores do torneio disseram: "Vocês podem usar um assistente de IA para apenas corrigir a gramática e melhorar a fluência do seu relatório, mas a opinião e a crítica devem ser 100% suas."

Agora, a pergunta é: Como os organizadores podem saber se o juiz realmente escreveu o relatório ou se ele deixou a IA escrever tudo e só pediu para ela "arrumar a casa"?

Este artigo é como um grupo de investigadores que decidiu testar se os "detectores de mentiras" atuais funcionam para essa tarefa. E a conclusão deles é assustadora: Os detectores atuais não funcionam bem o suficiente para aplicar essa regra.

Aqui está a explicação do que eles descobriram, usando analogias simples:

1. O Problema do "Detector de Falsos"

Os organizadores usaram softwares (detectores) para tentar pegar quem está trapaceando. Eles criaram um laboratório com 50.000 relatórios:

  • Alguns escritos 100% por humanos.
  • Alguns escritos 100% por IA.
  • Alguns escritos por humanos e apenas "polidos" (melhorados) pela IA (o que é permitido).

O que aconteceu?
Os detectores ficaram confusos. Eles começaram a acusar falsamente os juízes honestos que usaram a IA apenas para corrigir a gramática. Foi como se um detector de metal dissesse que você está escondendo uma faca, quando na verdade você só está segurando um garfo de plástico.

  • Resultado: Cerca de 3% a 10% dos relatórios perfeitamente legítimos (humanos + polimento IA) foram marcados como "totalmente feitos por IA". Isso significa que pessoas inocentes poderiam ser punidas injustamente.

2. A Ilusão da "Mistura"

Os detectores mais modernos conseguem dizer: "Isso é Humano", "Isso é IA" ou "Isso é uma Mistura".

  • O problema: Mesmo com essa opção de "Mistura", os detectores ainda tendem a classificar a maioria das revisões polidas como "IA Pura".
  • A Analogia: Imagine que você mistura um pouco de leite com café. Um detector ruim pode dizer: "Isso é leite puro!" e ignorar que há café ali. Os pesquisadores mostram que os detectores atuais não conseguem distinguir bem onde termina o humano e onde começa a IA quando há uma colaboração leve.

3. Tentativas de Melhorar (As "Dicas" do Detetive)

Os pesquisadores pensaram: "E se usarmos o contexto? A IA precisa ler o artigo original para escrever a crítica. Talvez possamos usar isso!"

  • Tentativa A (Contexto do Artigo): Eles deram o artigo original para o detector, pensando que ele poderia comparar o texto com o artigo.
    • Resultado: Funcionou um pouco melhor para pegar fraudes graves, mas piorou muito a acusação de inocentes. Foi como tentar achar um criminoso em uma multidão olhando apenas para a cor do sapato; você pega mais ladrões, mas também prende muitos pedestres inocentes.
  • Tentativa B (Estilo de Escrita): Eles tentaram ensinar computadores a reconhecer o "estilo" de um revisor científico.
    • Resultado: Funcionou bem quando o computador conhecia o modelo de IA usado, mas falhou miseravelmente quando os juízes usaram uma IA nova que o computador nunca viu antes. É como tentar pegar um ladrão pela impressão digital, mas o ladrão trocou de luvas e o computador não tem a nova digital no banco de dados.

4. O Perigo das "Humanizações"

Existe uma categoria de pessoas que usam ferramentas para fazer textos de IA parecerem humanos (como um disfarce).

  • Resultado: Quando os textos são "humanizados", os detectores ficam completamente cegos. Eles passam a achar que tudo é humano, mesmo que seja 100% IA. Isso torna a regra de "proibição total de IA" impossível de fiscalizar.

5. A Conclusão Importante (O "Pulo do Gato")

O artigo termina com uma mensagem muito forte para a comunidade científica:

Não confie nos números que você vê nas notícias.

Recentemente, uma empresa disse que "21% das revisões de uma grande conferência foram feitas por IA". Os autores deste estudo dizem: "Cuidado!".
É muito provável que esse número esteja errado. A IA pode ter sido usada apenas para polir textos que foram escritos por humanos, mas o detector marcou como "IA Pura".

  • Analogia Final: É como se alguém dissesse que "50% das pessoas em uma festa estão usando máscaras de plástico". Na verdade, muitas delas só estavam usando um pouco de maquiagem (polimento), mas o detector não consegue ver a diferença e grita "MÁSCARA!" para todos.

Resumo em uma frase:

Atualmente, não existe uma maneira confiável de usar computadores para vigiar se os revisores estão usando IA apenas para corrigir gramática ou para escrever tudo, e tentar fazer isso hoje em dia resultaria em muitas injustiças e acusações falsas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →