← Últimos artículos
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

Este estudio revela que los demostradores de teoremas Lean entrenados con RL sufren de colapso de modo en tiempo de inferencia, lo cual puede mitigarse eficazmente aplicando un calendario fijo de esqueletos de tácticas diversos para recuperar ganancias significativas de rendimiento, mientras que el parafraseo de prompts y los comentarios irrelevantes resultan ineficaces o perjudiciales.

Autores originales: Zachary Burton

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zachary Burton

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un estudiante brillante que ha sido entrenado para resolver acertijos matemáticos muy difíciles usando un lenguaje informático especial llamado Lean. Este estudiante, llamémoslo "DeepSeek", es increíblemente inteligente pero tiene un hábito extraño: cuando se le pide resolver un acertijo, se queda atrapado en un carril mental.

Este artículo es un informe de diagnóstico sobre por qué ocurre esto y cómo solucionarlo. Aquí está la historia de lo que descubrieron los investigadores, contada en términos cotidianos.

1. El Problema: El Efecto del "Disco Rayado"

Los investigadores notaron que cuando pedían a DeepSeek resolver el mismo acertijo matemático una y otra vez (solo con semillas aleatorias ligeramente diferentes, como lanzar dados), el estudiante seguía intentando exactamente el mismo primer paso.

  • La Analogía: Imagina que estás intentando abrir una puerta cerrada con llave. Pruebas la llave en la cerradura. No funciona. Lo intentas de nuevo. Aún no funciona. Lo intentas por tercera vez, y por centésima vez. Incluso si lo intentas 64 veces, solo estás introduciendo la misma llave en la misma cerradura de la misma manera. No estás explorando otras llaves ni otras formas de abrir la puerta.
  • El Resultado: En el estudio, duplicar el número de intentos de 32 a 64 no resolvió un solo acertijo nuevo. El estudiante había sufrido un "colapso de modo": estaba atrapado en un camino estrecho y no podía pensar en nada más.

2. La Solución: Dar una Pista de "Primer Paso"

Los investigadores se dieron cuenta de que el estudiante no era perezoso; simplemente estaba demasiado atrapado en su rutina. Así que probaron un nuevo truco: antes de pedirle al estudiante que resolviera el acertijo, le dieron una instrucción específica sobre cómo empezar.

  • La Analogía: En lugar de decir simplemente "Resuelve este acertijo", los investigadores dijeron "Empieza simplificando los números" o "Empieza introduciendo una nueva variable". Es como darle al estudiante una llave específica para probar primero, en lugar de dejar que adivine.
  • El Resultado: Este simple empujón rompió el carril. De repente, el estudiante comenzó a resolver muchos más acertijos. El "carril" no se debía a que el estudiante fuera malo en matemáticas; se debía a que era demasiado rígido en cómo comenzaba.

3. El "Por Qué": Es un Problema de Entrenamiento, No de Cerebro

Los investigadores querían saber: ¿Es el estudiante naturalmente malo en matemáticas, o fue el entrenamiento el que lo volvió rígido?

  • El Experimento: Probaron al estudiante antes de recibir el entrenamiento matemático especial (el modelo "Base").
  • El Hallazgo: El estudiante no entrenado no podía resolver ningún acertijo en absoluto. Simplemente se rendía o repetía la pregunta.
  • La Conclusión: El entrenamiento especial (Aprendizaje por Refuerzo) fue lo que enseñó al estudiante a resolver acertijos en primer lugar. Pero, ese mismo entrenamiento es también lo que lo volvió rígido y lo atrapó en un carril. El entrenamiento creó la habilidad, pero también creó el problema del "disco rayado".

4. ¿Quién Más Tiene Este Problema?

Los investigadores probaron a otros "estudiantes" (diferentes modelos de IA) para ver si este era un problema universal.

  • El Estudiante "SFT": Un estudiante fue entrenado de manera diferente (Ajuste Fino Supervisado). Este estudiante era en realidad mejor resolviendo acertijos en general, pero no tenía el problema del "carril". Cuando los investigadores le dieron pistas, en realidad lo hizo ligeramente peor. Ya era lo suficientemente flexible como para encontrar su propio camino.
  • Los Estudiantes "RL": Los estudiantes entrenados con el método especial de "Aprendizaje por Refuerzo" (como DeepSeek) fueron los que se quedaron atrapados. Necesitaban las pistas de "primer paso" para salir de su pensamiento estrecho.

5. La Evidencia del "Primer Movimiento"

Para demostrar que esto no era solo una casualidad, los investigadores examinaron los "primeros movimientos" reales que hacían los estudiantes.

  • El Hallazgo: De 64 intentos en un solo acertijo, el estudiante "atrapado en un carril" usó exactamente el mismo primer movimiento en casi la mitad de los casos. Era increíblemente predecible.
  • La Metáfora: Si le pidieras a un humano que escribiera una historia 64 veces, podría empezar con "Érase una vez", "El sol brillaba" o "Era una noche oscura". Pero este estudiante de IA empezaría con "Érase una vez" 32 veces, y "El sol brillaba" 30 veces. Tenía casi ninguna variedad en su apertura.

Resumen

El artículo concluye que el Aprendizaje por Refuerzo (una forma específica de entrenar IA) crea un arma de doble filo:

  1. Enseña a la IA a resolver pruebas matemáticas formales (algo que no podía hacer antes).
  2. Pero también hace que la IA se enfoque tanto en unas pocas estrategias "ganadoras" que deja de explorar nuevas.

La solución no es darle a la IA más potencia de cálculo ni más tiempo para pensar; es darle guía estructural: un simple empujón sobre cómo comenzar la prueba. Esto obliga a la IA a romper su rutina y explorar nuevos caminos, desbloqueando soluciones que anteriormente era demasiado terca para encontrar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →