← Últimos artículos
💬 NLP

Is Peer Review Really in Decline? Analyzing Review Quality across Venues and Time

Desafiando la narrativa popular del declive de los estándares, este artículo introduce un nuevo marco para cuantificar la calidad de las revisiones y demuestra, mediante un análisis cronológico de las principales conferencias de IA y lingüística, que la calidad mediana de las revisiones se ha mantenido estable a lo largo del tiempo.

Autores originales: Ilia Kuznetsov, Rohan Nayak, Alla Rozovskaya, Iryna Gurevych

Publicado 2026-01-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ilia Kuznetsov, Rohan Nayak, Alla Rozovskaya, Iryna Gurevych

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran pregunta: ¿Están empeorando las reseñas?

Imagina que estás dirigiendo un concurso de talentos masivo y global. Cada año, miles de cantantes (investigadores) presentan sus canciones (artículos) para ser juzgadas por un panel de expertos (revisores). Recientemente, ha habido muchos chismes entre el público: "¡Los jueces se están volviendo perezosos! Ya no escuchan con atención. La calidad de la retroalimentación está cayendo porque hay demasiados cantantes y no hay suficientes jueces".

Este artículo plantea una pregunta sencilla: ¿Es cierto este chisme? ¿Realmente las reseñas empeoran con el tiempo, o es solo una sensación?

El problema: No puedes comparar manzanas con naranjas

Para responder a esto, los investigadores intentaron medir la "calidad de la reseña". Pero se toparon con un obstáculo. Imagina intentar comparar la calidad de un sándwich de 2018 con uno de 2025.

  • En 2018, el sándwich podría haber sido servido sobre una servilleta sin instrucciones.
  • En 2025, viene en una caja elegante con una lista de ingredientes.
  • Algunos jueces escriben párrafos largos; otros escriben puntos clave.
  • Algunos jueces escriben en un formato específico; otros escriben libremente.

Debido a que los "formatos" y estilos cambiaron tanto a lo largo de los años y entre diferentes conferencias (como ICLR, NeurIPS y ACL), era imposible compararlos de manera justa. Era como intentar medir la altura de las personas usando una regla para un grupo y una cinta métrica para otro.

La solución: El "Traductor de Reseñas"

Para solucionar esto, los autores construyeron un traductor universal para las reseñas.

  1. Aplanamiento: Tomaron todos los diferentes formatos y los aplanaron en un único bloque de texto continuo.
  2. Itemización: Utilizaron una IA inteligente (un Modelo de Lenguaje Grande) para actuar como un editor profesional. Esta IA tomó el texto desordenado y lo reorganizó en secciones estándar: Resumen, Fortalezas, Debilidades y Otros.

Piensa en esto como tomar cada sándwich, independientemente de cómo fuera servido, y cortarlo en piezas estándar para que puedas probar el pan, la carne y el queso por separado. Esto les permitió comparar directamente las reseñas de 2018 con las de 2025.

Cómo midieron la "Calidad"

Una vez estandarizadas las reseñas, el equipo las midió utilizando tres "pruebas de sabor" principales:

  1. Substancialidad (¿Hay suficiente carne en el hueso?):

    • Ligera: ¿Qué tan larga es la reseña? (Contando caracteres).
    • Profunda: ¿Cuántos puntos o "ítems" distintos señaló el revisor?
    • Analogía: Una reseña corta es como una pequeña galleta; una larga es una comida completa. Ellos contaron cuántos "bocados" de información había en la reseña.
  2. Capacidad de acción (¿Puede el cantante arreglar su canción?):

    • ¿Dio el revisor instrucciones específicas? (por ejemplo, "Cambia la Figura 3" en lugar de "Esto es malo").
    • Analogía: Una buena reseña es como un entrenador que dice: "Tu pie izquierdo está demasiado adelantado". Una mala reseña es solo gritar: "¡Estás mal!". Los autores midieron cuántas solicitudes específicas de "arreglo" había en el texto.
  3. Fundamentación (¿Miraron realmente el artículo?):

    • ¿Señaló el revisor partes específicas del artículo? (por ejemplo, "Ver página 4, línea 10").
    • Analogía: Una reseña fundamentada es como un detective señalando evidencia sobre la mesa. Una reseña no fundamentada es solo adivinar sin mirar las pistas.

Los resultados: El chisme era falso

Tras analizar miles de reseñas de las principales conferencias de ciencias de la computación durante varios años, los datos contaron una historia sorprendente:

La mediana de la calidad de las reseñas NO decayó.

A pesar del temor de que los revisores se estén agotando o que la IA los esté volviendo perezosos, la reseña "promedio" de hoy es tan útil, detallada y fundamentada como las reseñas de hace unos años. El "chisme" del declive no fue respaldado por los números.

¿Por qué se siente como si la calidad estuviera cayendo?

Si la calidad es la misma, ¿por qué todo el mundo siente que está empeorando? Los autores ofrecen algunas teorías (hipótesis):

  • La teoría de "Más gente, más ruido": Incluso si la calidad promedio se mantiene igual, a medida que el número de envíos crece, el número total de reseñas malas aumenta. Si tienes 100 reseñas y 5 son malas, eso es el 5%. Si tienes 10,000 reseñas y 500 son malas, sigue siendo el 5%, pero de repente hay 500 personas enojadas. El volumen de las malas experiencias hace sentir que todo está roto.
  • La teoría de "Lo peor se volvió peor": Tal vez el promedio esté bien, pero las reseñas absolutamente peores se están volviendo aún peores, y esas son las que la gente comenta en las redes sociales.
  • La teoría de "Simplemente no lo sabemos": Tal vez la calidad cayó en formas que los autores no pudieron medir (como el "alma" de la reseña), pero sus herramientas actuales no pudieron verlo.

La conclusión

El artículo concluye que no debemos entrar en pánico y asumir que el sistema está colapsando. La reseña "promedio" se mantiene firme. Sin embargo, debido a que el número de artículos está explotando, necesitamos trabajar más duro para asegurar que todos reciban una buena reseña, no solo el promedio.

Los autores también construyeron un conjunto de herramientas (código y datos) que otros investigadores pueden usar para seguir monitoreando esta "salud" del sistema de revisión en el futuro, asegurando que tengamos hechos, y no solo sentimientos, para guiarnos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →