← Últimos artículos
💬 NLP

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

El artículo presenta RELIC, un marco para evaluar el razonamiento complejo de los modelos de lenguaje grandes mediante la prueba de su capacidad para reconocer lenguajes libres de contexto en contexto, revelando que incluso los modelos avanzados no logran escalar la computación de inferencia con la dificultad de la tarea y a menudo cambian del razonamiento algorítmico a la conjetura a medida que aumenta la complejidad.

Autores originales: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

Publicado 2026-04-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un asistente muy inteligente y bien leído para resolver un acertijo. Le entregas un libro de reglas completamente nuevo (una "gramática") y una oración específica (una "cadena"). Tu pregunta es simple: "¿Esta oración sigue las reglas del libro?"

Esto es exactamente de lo que trata el artículo RELIC. Es una nueva forma de evaluar qué tan bien los Modelos de Lenguaje Grandes (LLM) —los cerebros de IA detrás de herramientas como ChatGPT— pueden realmente pensar a través de problemas complejos y de múltiples pasos cuando se les dan nuevas instrucciones sobre la marcha.

Aquí está el desglose de los hallazgos del artículo utilizando analogías simples:

1. La Prueba: El "Acertijo del Libro de Reglas"

Los investigadores crearon un juego donde la IA debe actuar como un detective de gramática.

  • La Configuración: Generaron miles de libros de reglas únicos e inventados. No son inglés ni español; son conjuntos abstractos de reglas (como "A debe ir seguido de B", o "C se convierte en D").
  • La Tarea: La IA ve el libro de reglas y una oración compuesta por símbolos aleatorios (como t43 t51 t66). Debe decir "Sí" (esta oración sigue las reglas) o "No" (viola las reglas).
  • El Giro: Hacen los acertijos más difíciles al hacer los libros de reglas más grandes y las oraciones más largas.

2. La Expectativa: La Analogía de "Escalar la Montaña"

Piensa en resolver estos acertijos como escalar una montaña.

  • Montañas Pequeñas (Acertijos Fáciles): Si el libro de reglas es diminuto y la oración es corta, la IA puede escalar fácilmente hasta la cima. Utiliza un mapa lógico (un algoritmo) para verificar cada paso.
  • Montañas Grandes (Acertijos Difíciles): A medida que el libro de reglas se vuelve enorme y la oración se alarga, la montaña se vuelve más empinada. Para resolverlo correctamente, la IA necesita usar más energía mental (más "tokens de pensamiento") para verificar cada posibilidad individual. Es como necesitar una mochila más grande y más agua para escalar un pico más alto.

3. El Descubrimiento: "Renuncia Silenciosa"

Este es el hallazgo más sorprendente y crítico del artículo. Los investigadores esperaban que, a medida que los acertijos se volvieran más difíciles, la IA "se esforzara más" utilizando más poder de pensamiento.

En cambio, la IA comenzó a "renunciar en silencio".

  • La Analogía: Imagina a un trabajador al que se le pide resolver un problema matemático simple. Saca una calculadora y hace el trabajo. Pero cuando le das una ecuación masiva y compleja, en lugar de sacar una supercalculadora y trabajar más tiempo, simplemente adivina. Deja de intentar hacer las matemáticas y comienza a inventar respuestas basadas en corazonadas.
  • La Evidencia:
    • Cuando los acertijos se volvieron difíciles, la IA no usó más tiempo de pensamiento; de hecho, usó menos.
    • La IA dejó de usar un razonamiento lógico, paso a paso (como construir un árbol de posibilidades) y comenzó a depender de atajos deficientes (heurísticas).
    • Incluso los modelos de "razonamiento" más avanzados (aquellos diseñados para pensar profundamente) hicieron esto. Comenzarían con un buen plan, se abrumarían y luego cambiarían silenciosamente a adivinar.

4. El Resultado: "Correcto por las Razones Incorrectas"

El artículo encontró que cuando la IA "renuncia en silencio", a menudo obtiene la respuesta correcta por accidente, pero por las razones equivocadas.

  • Ejemplo: La IA podría rechazar una oración solo porque es "demasiado larga", incluso cuando las reglas permiten oraciones largas. Obtuvo la respuesta "No" correcta, pero su lógica estaba completamente rota.
  • El Problema: Si no puedes ver el proceso de pensamiento de la IA (lo cual es cierto para muchos modelos comerciales), podrías pensar que es inteligente porque obtuvo la respuesta correcta. Pero en realidad, solo está adivinando, y fallará en el siguiente problema difícil.

5. La Conclusión: Cerebros Frágiles

El artículo concluye que los modelos de IA actuales son frágiles.

  • Entienden la idea de la tarea cuando es fácil.
  • Pero no pueden escalar su esfuerzo para igualar la dificultad del problema.
  • No tienen un "motor interno" confiable que diga: "Esto es difícil, necesito gastar más tiempo en esto". En su lugar, se rinden y adivinan.

Resumen

El artículo introduce RELIC como una prueba de estrés para el razonamiento de la IA. Muestra que incluso los modelos de IA más inteligentes de hoy son como estudiantes que pueden resolver tareas escolares fáciles, pero, cuando se enfrentan a un examen difícil, dejan de intentar resolver los problemas y simplemente rellenan las burbujas al azar. "Renuncian en silencio" en tareas difíciles, lo que los hace poco confiables para el razonamiento complejo del mundo real, donde necesitas que realmente sigan las reglas, no que solo adivinen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →