← Últimos artículos
💬 NLP

Validity of LLMs as data annotators: AMALIA on authority

Este artículo demuestra que, si bien el modelo de lenguaje nacional de Portugal AMALIA logra una alta concordancia con los codificadores humanos en la base moral de la autoridad, carece de validez de constructo debido a que se basa en atajos superficiales en lugar de un razonamiento teórico, lo que resalta la necesidad de bancos de pruebas de modelos de lenguaje nacionales para evaluar la base de evidencia del rendimiento del modelo más allá de la mera concordancia.

Autores originales: Manuel Pita

Publicado 2026-07-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Manuel Pita

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un nuevo robot superinteligente llamado AMALIA. Es el propio robot de lenguaje de Portugal, creado con dinero público para entender y hablar el portugués europeo mejor que nadie. La gran esperanza era que AMALIA pudiera actuar como un asistente humano superrápido y superbarato para los investigadores. Específicamente, los científicos querían usarlo para leer miles de publicaciones en redes sociales y determinar si la gente estaba hablando de "Autoridad"—una idea complicada que no se trata solo de la palabra "jefe" o "policía", sino de si alguien está respetando o desafiando las reglas de la jerarquía.

Aquí está el giro: AMALIA es excelente adivinando la respuesta correcta, pero es terrible mostrando su trabajo.

El problema del "Resultado correcto, razón equivocada"

Piensa en AMALIA como un estudiante haciendo un examen de matemáticas.

  • El Objetivo: El profesor pregunta: "Resuelve X usando esta fórmula específica".
  • El Resultado: AMALIA escribe el número correcto para X.
  • El Problema: Cuando el profesor le pide: "Muéstrame tus pasos", AMALIA no puede. En lugar de usar la fórmula, simplemente adivinó la respuesta porque vio un patrón, como: "Oh, la palabra 'jefe' está en la frase, así que la respuesta debe ser 'Autoridad'".

En el mundo real, esto es peligroso. Si un robot está de acuerdo con los expertos humanos el 90% de las veces, solemos decir: "¡Genial! ¡Podemos confiar en él!". Pero este artículo argumenta que para AMALIA, ese acuerdo es un engaño. Es como un loro que aprende a decir "Te amo" cada vez que ve a un humano sonreír. El loro no está sintiendo amor; solo está asociando la sonrisa con la frase. AMALIA estaba asociando pistas superficiales (como ver a un oficial de policía o escuchar a alguien enojado) con la etiqueta "Autoridad", en lugar de entender realmente la compleja teoría del poder y el respeto que los investigadores intentaban medir.

La prueba de la "Caja Negra"

Para demostrar esto, los investigadores no solo le hicieron a AMALIA la gran pregunta. Dividieron la pregunta en piezas diminutas y simples, como un detective descomponiendo un caso en pistas.

  1. La Gran Pregunta: "¿Trata este texto sobre Autoridad?"
  2. Las Pistas Diminutas: "¿Menciona a un líder?" "¿Juzga ese texto el comportamiento de ese líder?" "¿Habla de la tradición?"

Si AMALIA realmente entendiera el concepto, debería obtener el mismo resultado ya sea que se le pregunte la gran pregunta o las pistas diminutas. Pero no fue así.

  • Cuando se le preguntó la gran pregunta, AMALIA estuvo de acuerdo con los expertos humanos el 71% de las veces.
  • Cuando se le preguntaron las pistas diminutas y se le obligó a unir las piezas, su acuerdo cayó a solo el 36%.

Esta enorme caída se llama "brecha de recuperación". Es como un mago sacando un conejo de un sombrero. Si preguntas "¿Dónde está el conejo?" y el mago señala el sombrero, eso está bien. Pero si preguntas "Muéstrame el conejo dentro del sombrero", y el sombrero está vacío, te das cuenta de que el mago solo estaba usando un truco. El artículo encontró que el "truco" de AMALIA era depender de atajos superficiales, como ver "indignación moral" cerca de una persona poderosa y asumir que se trata de autoridad, incluso cuando no lo es.

La comparación con el "Robot más grande"

Los investigadores no solo probaron a AMALIA; también probaron a otros dos robots: Llama (uno de tamaño medio) y GPT-OSS (un gigante de 120 mil millones de parámetros, comparado con los 9 mil millones de AMALIA).

  • El Robot Gigante (GPT-OSS): Cuando se le hicieron las mismas preguntas complicadas en portugués, no tuvo una brecha. Obtuvo la respuesta correcta y además pudo mostrar su trabajo. Entendía la teoría.
  • El Robot de Tamaño Medio (Llama): Tenía una brecha pequeña, pero estaba mejorando.
  • AMALIA: Tenía una brecha masiva.

Esto demuestra que el problema no era el idioma portugués ni los textos específicos utilizados. El problema era el tamaño y el entrenamiento del modelo. El artículo sugiere que AMALIA es simplemente demasiado pequeño para manejar el "grano" complejo de la teoría. Es como intentar construir un rascacielos con un martillo diseñado para una casita de pájaros; la herramienta simplemente no es lo suficientemente grande para hacer el trabajo, aunque parezca que está funcionando.

Lo que esto significa para los robots nacionales

El artículo descarta explícitamente algunas ideas populares:

  1. No se trata del idioma: Aunque AMALIA es el robot "nativo" de Portugal, no funcionó mejor que los grandes robots internacionales. De hecho, los robots grandes estuvieron de acuerdo con los humanos más que AMALIA.
  2. El acuerdo no es suficiente: El hecho de que un robot esté de acuerdo con los humanos no significa que esté midiendo lo que debe. Podría estar simplemente asociando patrones.
  3. No es un fallo de los creadores del modelo: El artículo elogia a AMALIA por ser abierto y transparente. El problema es que el "estándar de oro" actual para probar robots (solo verificar si coinciden con los humanos) es defectuoso.

La conclusión fundamental

Entonces, ¿es AMALIA inútil? ¡Para nada! El artículo dice que AMALIA es excelente para el cribado y la precodificación. Puede leer una enorme pila de texto y decir: "Oye, esto parece interesante, los humanos deberían mirar esto". Es un gran primer filtro.

Pero, ¿puede medir ideas complejas como la "Autoridad" por sí solo? No. Todavía no.
El artículo concluye que, antes de confiar en que un robot nacional mida lo que nuestros ciudadanos piensan y valoran, necesitamos hacer una pregunta diferente. No debemos preguntar simplemente, "¿Estás de acuerdo con los humanos?". Necesitamos preguntar: "¿Puedes mostrarme tu trabajo?".

Hasta que AMALIA (o cualquier modelo nacional pequeño) pueda mostrar su trabajo y demostrar que está usando la lógica correcta y no solo adivinando basándose en pistas superficiales, no está listo para ser el juez final. El artículo sugiere que, por ahora, AMALIA es un asistente útil, pero no es el jefe de los datos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →