← Últimos artículos
💬 NLP

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

Este estudio revela que, aunque los jueces basados en modelos de lenguaje y los examinadores humanos convergen en las redacciones del examen de la abogacía tailandesa con rúbricas claras, los modelos de lenguaje fracasan sistemáticamente en reproducir una interpretación minoritaria humana en casos ambiguos, alineándose en cambio uniformemente con la visión humana mayoritaria y enmascarando así su incapacidad para captar el espectro completo del desacuerdo entre expertos.

Autores originales: Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

Publicado 2026-05-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo un concurso de alto riesgo para evaluar la calidad de ensayos jurídicos. Tienes un reglamento muy específico (la "rúbrica") que indica a los evaluadores cómo calificar las respuestas. Por lo general, el reglamento es claro: si la respuesta es correcta, otorga una puntuación alta; si el razonamiento es deficiente, otorga una puntuación baja.

Pero a veces, el reglamento entra en una "zona gris". No especifica exactamente qué hacer cuando un estudiante obtiene la respuesta final correcta pero olvida mencionar una cita legal específica y crucial. Esta es la zona "silenciosa en cuanto a la regulación".

Este artículo presenta un experimento en dos partes para observar cómo los jueces humanos y la Inteligencia Artificial (IA) manejan estas zonas grises.

Parte 1: El "Examen" (Fase 1)

Primero, los investigadores colocaron a 8 modelos de IA diferentes en la "silla del estudiante". Tenían que escribir ensayos jurídicos al igual que 42 estudiantes reales de derecho tailandeses. Los modelos de IA fueron calificados a ciegas por expertos humanos.

  • El Resultado: Los modelos de IA rindieron aproximadamente tan bien como el estudiante humano promedio. Algunos fueron excelentes, otros promedio y algunos tuvieron dificultades. Todos estaban "en el juego".

Parte 2: La "Calificación" (Fase 2)

A continuación, los investigadores tomaron los mismos ensayos y pidieron a dos grupos que los calificaran:

  1. El Panel Humano: Tres examinadores legales reales y certificados.
  2. El Panel de IA: Un grupo masivo de 26 modelos de IA diferentes (incluidos los que tomaron el examen anteriormente, además de muchos otros).

Se les dio a todos exactamente las mismas cuatro cosas que examinar: la pregunta, el reglamento, la "clave de respuestas perfecta" y el ensayo del estudiante.

El Gran Descubrimiento: La "Calle de Sentido Único"

Los investigadores encontraron una división fascinante, pero solo en las preguntas difíciles donde el reglamento guardaba silencio.

La División Humana:
Los tres expertos humanos no estuvieron de acuerdo.

  • Dos de ellos (B y C) dijeron: "El estudiante acertó el punto principal y el razonamiento fue lo suficientemente bueno. Otórgales una puntuación alta (6–8)".
  • Uno de ellos (A) dijo: "El estudiante omitió una cita crucial. Eso hace que el razonamiento sea 'inutilizable'. Otórgales una puntuación muy baja (1–2)".
  • Piensa en ello como un árbitro deportivo: Dos árbitros dicen que el jugador estaba "dentro del campo" y uno dice que estaba "fuera del campo". Ambos están usando el mismo reglamento, pero interpretan la zona gris de manera diferente.

La División de la IA (La Asimetría):
Aquí es donde se pone extraño. Los investigadores esperaban que los 26 modelos de IA se dividieran, quizás algunos apoyando al humano estricto (A) y otros a los humanos permisivos (B y C).

  • No lo hicieron.
  • 22 de los 26 modelos de IA se alinearon con los dos humanos permisivos (B y C). Otorgaron puntuaciones altas.
  • 3 modelos de IA se confundieron y otorgaron puntuaciones medias.
  • Cero modelos de IA se alinearon con el humano estricto (A). Incluso la única IA que intentó ser estricta (GPT-5.4 Nano) no fue lo suficientemente consistente para igualar verdaderamente el estilo del humano estricto.

La Metáfora:
Imagina un grupo de 26 cámaras diferentes tomando una fotografía de un cuadro.

  • Los tres críticos de arte humanos miran el cuadro y discrepan: dos dicen que es una obra maestra y uno dice que es un fracaso.
  • Pides a las 26 cámaras que describan el cuadro.
  • El resultado: Las 26 cámaras coinciden con los dos críticos que lo llamaron una obra maestra. Ninguna de las cámaras coincide con el crítico que lo llamó un fracaso. Aunque las cámaras son de diferentes marcas, tamaños y precios, todas "ven" el cuadro de la misma manera, omitiendo por completo la perspectiva del único crítico estricto.

¿Por Qué Importa Esto?

El artículo argumenta que cuando construimos sistemas de IA para calificar ensayos, por lo general elegimos la IA que más coincide con el "promedio" del evaluador humano.

  • Dado que la mayoría de los humanos en este estudio (2 de cada 3) fueron permisivos, la IA aprendió a ser permisiva también.
  • La IA no aprendió a ser "justa" de manera equilibrada; aprendió a ser asimétrica. Convergió hacia la opinión mayoritaria e ignoró por completo la opinión minoritaria, aunque esa opinión minoritaria fuera una interpretación legal válida.

La Sorpresa del "Doble Rol"

Los investigadores también notaron algo extraño sobre la personalidad de la IA.

  • Los modelos de IA que fueron malos estudiantes en la Fase 1 (obtuvieron puntuaciones bajas en sus propios ensayos) en realidad se convirtieron en los jueces permisivos más consistentes en la Fase 2.
  • Los modelos de IA que fueron excelentes estudiantes en la Fase 1 se convirtieron solo en jueces "aceptables".
  • La Lección: Ser bueno en escribir la respuesta no te hace bueno en calificar la respuesta. Las habilidades son totalmente diferentes.

La Conclusión

El estudio muestra que los jueces de IA son muy estables y consistentes entre sí, pero tienen un punto ciego. Cuando los expertos humanos discrepan sobre una regla de zona gris, la IA no divide la diferencia ni explora todas las opiniones válidas. En su lugar, elige abrumadoramente la opinión humana "mayoritaria" e ignora la "minoritaria".

Si utilizas la IA para calificar ensayos, no estás obteniendo simplemente una segunda opinión; estás obteniendo un espejo que refleja la opinión mayoritaria con tanta fuerza que hace que la opinión minoritaria desaparezca por completo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →