← Últimos artículos
💬 NLP

Impact of large language models on peer review opinions from a fine-grained perspective: Evidence from top conference proceedings in AI

Este estudio demuestra que la adopción de modelos de lenguaje grandes en las revisiones por pares de conferencias de IA ha llevado a informes más largos y fluidos con un mayor enfoque en la claridad superficial, mientras que disminuye la atención a dimensiones evaluativas profundas como la originalidad y el razonamiento crítico.

Autores originales: Wenqing Wu, Chengzhi Zhang, Yi Zhao, Tong Bao

Publicado 2026-04-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Wenqing Wu, Chengzhi Zhang, Yi Zhao, Tong Bao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que el mundo académico es como una gran biblioteca donde los investigadores escriben libros (artículos científicos) y necesitan que otros expertos los lean y les digan si son buenos antes de que se publiquen. A este proceso de lectura y crítica se le llama "revisión por pares" (peer review).

Hasta hace poco, esta tarea la hacían humanos cansados, ocupados y a veces con dudas. Pero recientemente, aparecieron unos "asistentes mágicos" muy inteligentes llamados Modelos de Lenguaje Grande (LLM), como el famoso ChatGPT. Estos asistentes pueden escribir textos muy bien, corregir gramática y resumir ideas.

Este estudio se pregunta: ¿Qué pasa cuando los revisores empiezan a usar a estos "asistentes mágicos" para escribir sus críticas? ¿Mejoran los libros o se vuelven más superficiales?

Aquí tienes los hallazgos principales, explicados con analogías sencillas:

1. Los textos se volvieron más largos y "pulidos", pero menos profundos

  • La analogía: Imagina que antes, un crítico de cine escribía una reseña corta y directa: "La película tiene buenos efectos, pero la historia es aburrida". Ahora, con el asistente mágico, esa misma reseña se convierte en un ensayo de tres páginas, con palabras muy elegantes y frases perfectas: "La película presenta una cinematografía meticulosa y una narrativa que, aunque estructuralmente sólida, carece de la chispa innovadora que la haría memorable...".
  • El hallazgo: Los informes de revisión se han vuelto más largos, más fluidos y con un vocabulario más sofisticado. Sin embargo, al usar estas herramientas, los revisores tienden a enfocarse más en la superficie (la claridad, el resumen) y menos en lo profundo (la originalidad real, si los experimentos se pueden repetir, o si la idea es verdaderamente nueva). Es como si el asistente mágico hiciera que el plato se vea muy bonito, pero no necesariamente más nutritivo.

2. Los revisores "inseguros" son los que más cambian

  • La analogía: Piensa en dos tipos de cocineros revisando un menú.
    • El Chef Experto (alta confianza): Sabe exactamente qué está haciendo. Si usa el asistente, lo usa solo para pulir un poco la presentación.
    • El Aprendiz (baja confianza): No está seguro de si el plato está bien sazonado. Al usar el asistente, este le ayuda a escribir mucho más y a sonar más seguro, pero a veces el asistente le hace enfocarse en cosas que no son el corazón del problema.
  • El hallazgo: Los revisores que tenían menos confianza en sus conocimientos (los "aprendices") fueron los que más cambiaron su estilo al usar LLMs. Sus textos se volvieron mucho más largos y estandarizados, pero a veces perdieron el enfoque en los detalles técnicos críticos.

3. Se habla más de "resúmenes" y menos de "novedad"

  • La analogía: Imagina que estás juzgando un invento.
    • Sin asistente: El juez dice: "¡Wow! ¡Nunca había visto un motor que funcione con agua! ¡Es totalmente original!".
    • Con asistente: El juez dice: "El resumen del invento está muy bien escrito. La explicación es clara y lógica. Sin embargo, no estoy seguro de si es realmente nuevo o si ya se ha hecho antes...".
  • El hallazgo: Cuando los revisores usan LLMs, dedican mucho más tiempo a resumir lo que el autor escribió y a elogiar la claridad del texto. Pero disminuye la cantidad de comentarios sobre si la idea es original o si los métodos son sólidos. El asistente es muy bueno para explicar lo que ya está escrito, pero menos bueno para detectar si la idea es genuinamente nueva o si es un plagio disfrazado.

4. ¿Cambian las notas que dan?

  • La analogía: ¿Si un estudiante usa una calculadora para hacer la tarea, le pone una nota más alta o más baja al profesor?
  • El hallazgo: Sorprendentemente, las notas (aceptar o rechazar el artículo) no cambiaron mucho. Aunque los textos de las críticas son más bonitos y largos, la decisión final de aprobar o rechazar un artículo sigue siendo muy similar a cuando los revisores lo hacían solos. El asistente ayuda a escribir la crítica, pero no parece estar decidiendo si el artículo es bueno o malo.

En resumen: ¿Es bueno o malo?

El estudio concluye que los "asistentes mágicos" (LLMs) están mejorando la forma en que se escriben las críticas (más claras, más largas, mejor gramática), pero están debilitando un poco el contenido (menos enfoque en la creatividad y la originalidad).

La lección final: No es que los robots vayan a reemplazar a los humanos, sino que los humanos están usando herramientas que hacen que sus textos suenen más profesionales, pero que a veces los distraen de mirar el "alma" del trabajo científico. La recomendación es usar estas herramientas con cuidado: son excelentes para pulir el texto, pero los humanos deben seguir siendo los guardianes de la originalidad y la verdad científica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →