← Últimos artículos
🤖 AI

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

El artículo presenta QED-Nano, un modelo de 4B parámetros entrenado mediante un proceso de tres etapas que incluye fine-tuning supervisado, aprendizaje por refuerzo con recompensas basadas en rúbricas y una caché de razonamiento, logrando un rendimiento en demostraciones matemáticas de nivel olímpico que supera a modelos open-source más grandes y se acerca a sistemas propietarios, todo ello con un coste de inferencia significativamente menor.

Autores originales: LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

Publicado 2026-04-07
📖 4 min de lectura☕ Lectura para el café

Autores originales: LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que quieres enseñle a un niño de primaria a resolver los problemas de matemáticas más difíciles del mundo, como los que se presentan en las Olimpiadas Internacionales de Matemáticas (IMO). Normalmente, para lograr esto, necesitarías contratar a un genio con un cerebro enorme (un modelo de IA gigante) que cuesta millones de dólares entrenar y ejecutar.

Pero, ¿y si pudieras entrenar a un "niño" pequeño (un modelo de IA de solo 4 mil millones de parámetros) para que piense tan bien como ese genio gigante?

Eso es exactamente lo que hace el equipo detrás de QED-Nano. Aquí te explico cómo lo lograron, usando analogías sencillas:

1. El Problema: Los Gigantes vs. Los Pequeños

Hasta ahora, los modelos de IA que ganaban estas olimpiadas eran como "superhéroes" con trajes de alta tecnología: enormes, caros y secretos. Nadie sabía exactamente cómo los entrenaban. El equipo se preguntó: "¿Podemos crear un superhéroe pequeño, barato y de código abierto que haga lo mismo?".

2. La Solución: La Receta de QED-Nano

No fue magia, fue una receta de cocina muy bien planificada en tres pasos:

Paso 1: El Entrenamiento Básico (SFT) - "Aprender a escribir"

Imagina que le das al niño pequeño (el modelo base) un montón de libros de matemáticas escritos por los mejores genios del mundo (en este caso, un modelo gigante llamado DeepSeek-Math-V2).

  • La analogía: Es como si el niño leyera miles de ensayos de un Nobel. No solo aprende qué responder, sino cómo escribirlo: con estructura, claridad y rigor.
  • El resultado: El niño ahora sabe escribir pruebas matemáticas, pero a veces se pierde en sus propios pensamientos o escribe cosas muy largas y confusas.

Paso 2: El Refuerzo con Reglas Estrictas (RL) - "El profesor exigente"

Aquí es donde entra la parte divertida. En lugar de dejar que el niño adivine, les dieron un profesor muy estricto (un sistema de calificación basado en una "rúbrica").

  • La analogía: Imagina un examen donde no solo te dan un "aprobado" o "reprobado". El profesor te dice: "Oye, en este paso olvidaste justificar por qué usaste esa fórmula (-1 punto)", "¡Muy bien, demostraste que la secuencia es acotada (+4 puntos)!", "Pero aquí hiciste una suposición sin prueba (-2 puntos)".
  • El truco: El modelo aprende a recibir estas críticas y a mejorar paso a paso, no solo a buscar la respuesta final. Aprende a pensar mejor mientras escribe.

Paso 3: El "Caché de Razonamiento" - "Tomar notas para no perderse"

Los problemas de olimpiada son tan largos que un modelo pequeño se puede marear si intenta resolverlo todo de una sola vez.

  • La analogía: Imagina que el niño está resolviendo un laberinto gigante. Si intenta verlo todo de una vez, se pierde. Pero, si le enseñamos a hacer un resumen cada 10 pasos ("Hasta aquí llegué, estoy en la esquina azul, ahora voy a la derecha"), puede seguir avanzando sin olvidar el camino.
  • La innovación: El modelo aprende a generar un pequeño resumen de su progreso, y luego usa ese resumen para continuar. Esto le permite pensar durante horas (o millones de "tokens") sin volverse loco, algo que los modelos pequeños normalmente no pueden hacer.

3. Los Resultados: ¡El Pequeño Gana!

Al final, QED-Nano (el modelo pequeño) logró algo increíble:

  • Sin ayuda extra: Ya rinde mejor que modelos mucho más grandes y famosos (como Nomos-1 o GPT-OSS-120B).
  • Con ayuda (el "Agente"): Cuando se le permite usar su técnica de "resumir y seguir" durante mucho tiempo, ¡su puntuación se dispara! Se acerca peligrosamente a los modelos privados y carísimos como Gemini 3 Pro.

¿Por qué es importante esto?

Es como si un coche pequeño y económico (QED-Nano) pudiera ganar una carrera contra un Ferrari (los modelos gigantes) si el conductor sabe usar bien los espejos y las notas (la técnica de razonamiento).

  • Es más barato: No necesitas una fábrica entera para ejecutarlo.
  • Es transparente: Todo el código y los datos son públicos, así que cualquiera puede estudiarlo y mejorarlo.
  • Es escalable: Demuestra que no necesitamos modelos de billones de parámetros para hacer matemáticas de élite; necesitamos modelos pequeños bien entrenados y con buenas herramientas para pensar.

En resumen: QED-Nano nos enseña que, a veces, no se trata de tener el cerebro más grande, sino de tener el mejor método para pensar. ¡Y eso es algo que cualquiera puede aprender!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →