← Últimos artículos
💬 NLP

Humans and LLMs Diverge on Probabilistic Inferences

Este estudio introduce el conjunto de datos ProbCOPA y demuestra que, a diferencia de los humanos que emiten juicios probabilísticos graduados, los modelos de lenguaje actuales fallan sistemáticamente al replicar estas distribuciones de inferencia no determinista.

Autores originales: Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de Marneffe, Siva Reddy

Publicado 2026-03-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de Marneffe, Siva Reddy

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que el razonamiento humano es como cocinar con una receta incompleta. A veces, no tienes todos los ingredientes, pero basándote en tu experiencia y en lo que "sabe" que suele pasar, adivinas cómo quedará el plato.

  • Ejemplo: Si escuchas que hubo un accidente en la carretera, tu cerebro dice: "Probablemente el tráfico estará peor de lo normal". No es una certeza matemática (quizás todos se enteraron y tomaron otra ruta), pero es una probabilidad alta.
  • El problema: Las Inteligencias Artificiales (IA) modernas, llamadas "modelos de razonamiento", son como chefs robots que son geniales resolviendo ecuaciones matemáticas perfectas, pero cuando se les pide hacer esa "adivinanza culinaria" basada en el sentido común, se comportan de forma extraña.

Este artículo, titulado "Los humanos y las IAs divergen en las inferencias probabilísticas", investiga exactamente esa diferencia. Aquí te lo explico paso a paso:

1. El Experimento: "ProbCOPA" (La prueba de cocina)

Los investigadores crearon un nuevo juego llamado PROBCOPA.

  • La idea: Le dieron a 210 situaciones cotidianas (como "Hubo una sequía" -> "¿Los cultivos murieron?").
  • La tarea: No les pidieron un "Sí" o "No". Les pidieron una nota del 0 al 100 sobre qué tan probable era que ocurriera ese efecto.
  • Los participantes:
    • Humanos: 30 personas reales por cada situación.
    • IAs: 8 de los modelos de IA más avanzados del mundo (como GPT-5, Gemini, Claude, etc.).

2. Lo que hicieron los Humanos (La variedad natural)

Cuando los humanos respondieron, fue como una orquesta con muchos instrumentos.

  • Graduación: Si algo era muy probable, la mayoría puso notas altas (80-90). Si era improbable, notas bajas (10-20).
  • La zona gris: Pero para las cosas inciertas, ¡hubo mucha variedad! Algunos dijeron 40, otros 60, otros 55. Esto es normal. Los humanos tenemos opiniones distintas, dudas y matices.
  • La clave: Los humanos entendieron que la vida no es blanco o negro; es un espectro de grises.

3. Lo que hicieron las IAs (La rigidez robótica)

Aquí es donde las IAs fallaron estrepitosamente. Se comportaron como un metrónomo desajustado o un semáforo atascado.

  • Extremos absolutos: Las IAs casi nunca pusieron notas del medio (como 45 o 55). O decían "¡Casi seguro que sí!" (95) o "¡Casi seguro que no!" (5).
  • Falta de duda: A las IAs les cuesta terriblemente decir "no estoy seguro". Tienen una sobreconfianza increíble.
  • Sin variedad: Si le pediste a una IA la misma pregunta 30 veces, te dio 30 respuestas casi idénticas. No hubo "opiniones diferentes" como entre los humanos.

4. El "Cerebro" de la IA (Las cadenas de razonamiento)

Los investigadores también miraron el "pensamiento" de las IAs (lo que escriben antes de dar la respuesta final).

  • El patrón: Cuando las IAs veían una pregunta difícil (donde los humanos estaban divididos), pensaban más tiempo (escribían textos más largos).
  • El problema: Aunque pensaban más, no pensaban mejor. Seguían saltando a conclusiones extremas. Era como si un estudiante estudiara mucho para un examen, pero al final decidiera adivinar la respuesta más arriesgada en lugar de admitir que no sabe.
  • Analogía: Es como si un abogado, ante un caso ambiguo, en lugar de decir "es un caso difícil, depende de la interpretación", decidiera argumentar con la misma fuerza que si tuviera pruebas irrefutables.

5. ¿Por qué importa esto?

Imagina que usas una IA para tomar decisiones importantes, como diagnósticos médicos o juicios legales.

  • Si la IA dice "99% de probabilidad de que esto es un tumor", pero en realidad es un 60% (una duda humana normal), podrías tomar una decisión drástica e innecesaria.
  • El estudio nos dice que las IAs actuales no son buenas simulando la incertidumbre humana. Son excelentes en lógica pura (2+2=4), pero malas en la vida real, donde las cosas rara vez son 100% seguras.

En resumen

  • Humanos: Somos como un jardín diverso. Tenemos dudas, opiniones variadas y entendemos que a veces las cosas son "probables" pero no "seguras".
  • IAs: Son como estatuas de mármol. Son sólidas y fuertes en lógica, pero rígidas. Les falta la flexibilidad de la duda y la variedad de opiniones que nos hace humanos.

El mensaje final es claro: No podemos confiar en que las IAs piensen como nosotros en situaciones inciertas. Necesitamos enseñarles a ser más humildes, a admitir que no lo saben todo y a aceptar que a veces la respuesta correcta es "depende".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →