← Últimos artículos
🤖 AI

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

Este artículo presenta AIR, un marco que mejora la capacidad de los Modelos de Lenguaje Multimodales Grandes para realizar un razonamiento intercalado adaptativo con código para computación numérica compleja a través de una solución de tres componentes que involucra la construcción de datos de arranque en frío, la curación de conjuntos de datos y una estrategia de invocación de herramientas adaptativa guiada por el aprendizaje por refuerzo con restricciones de grupo, lo que resulta en mejoras significativas de rendimiento en los bancos de pruebas de evaluación.

Autores originales: Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

Publicado 2026-06-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente muy inteligente que es excelente mirando imágenes y leyendo texto, pero que a veces se queda atascado cuando un problema matemático requiere un cálculo pesado. Si le pides a este asistente que resuelva un problema complejo de geometría que involucre volumen, podría intentar hacer la matemática en su "cabeza" (la red neuronal) y cometer un error, tal como lo haría un humano al intentar multiplicar números grandes sin una calculadora.

El artículo presenta un nuevo sistema llamado AIR (Razonamiento Intercalado Adaptativo con Código) que le enseña a este asistente un nuevo superpoder: saber cuándo dejar de pensar y empezar a usar una herramienta.

Así es como funciona AIR, desglosado en conceptos simples:

1. La idea central: La analogía del "Calculador Humano"

Piensa en la IA como un estudiante haciendo un examen.

  • La forma antigua: El estudiante intenta resolver cada problema usando solo su cerebro. Si la matemática es demasiado difícil, adivina o se equivoca.
  • La forma de AIR: El estudiante aprende que, cuando un problema se vuelve demasiado complicado, puede levantar la mano y pedir una calculadora. Escribe los números, presiona los botones, obtiene el resultado y luego escribe la respuesta final.
  • El giro: La IA no usa una calculadora para cada pregunta. Aprende a ser adaptativa. Sabe: "Esta pregunta es fácil, la haré mentalmente", y "Esta pregunta es difícil, necesito escribir algo de código para resolverla".

2. El proceso de entrenamiento: Un viaje de dos pasos

El artículo explica que no puedes simplemente decirle a un modelo "usa una calculadora" y esperar que funcione de inmediato. Necesita un plan de entrenamiento específico:

Paso 1: El "Arranque en Frío" (Aprendiendo lo básico)
Antes de que la IA pueda aprender a usar herramientas por sí misma, necesita ver ejemplos de cómo se hace. Los investigadores construyeron un conjunto de datos especial donde tomaron problemas matemáticos difíciles y mostraron manualmente a la IA cómo alternar entre "pensar" (texto) y "calcular" (escribir código Python).

  • Analogía: Imagina a un profesor mostrando a un estudiante algunos ejemplos resueltos donde el estudiante usa una calculadora para las partes difíciles. Esto le da al estudiante una plantilla básica a seguir.

Paso 2: Aprendizaje por Refuerzo (La fase de "Ensayo y Error")
Una vez que la IA tiene los conceptos básicos, comienza a practicar por su cuenta. Aquí es donde ocurre la magia. Los investigadores utilizaron un sistema de puntuación especial (una función de recompensa) para enseñar a la IA cuándo usar la herramienta.

  • El problema: Si la IA usa la calculadora demasiado, se confunde y el entrenamiento se desmorona (como un estudiante que se niega a pensar por sí mismo). Si nunca la usa, sigue cometiendo errores matemáticos.
  • La solución: Los investigadores crearon una "Recompensa Restringida por Grupo". Imagina a un entrenador observando a todo un equipo de jugadores. El entrenador no solo recompensa al jugador que anota; recompensa al equipo por tener el equilibrio adecuado de jugadores usando calculadoras.
    • Si la IA usa la herramienta con demasiada frecuencia, recibe una puntuación más baja.
    • Si la IA la usa lo justo y necesario para obtener la respuesta correcta, recibe una puntuación alta.
    • Esto mantiene a la IA estable y evita que se vuelva loca con el uso de la herramienta.

3. El resultado: Más inteligente y más estable

El artículo afirma que, tras este entrenamiento:

  • Precisión: La IA mejoró significamente en los problemas matemáticos, especialmente en aquellos que requerían cálculos complejos. En promedio, sus puntuaciones aumentaron unas 6 unidades, y para los problemas específicos donde utilizó la herramienta, mejoró casi 10 puntos.
  • Fiabilidad: La IA utilizó la herramienta con éxito más del 95% de las veces que decidió usarla.
  • Estabilidad: El método "Restringido por Grupo" evitó que la IA colapsara o se volviera inestable durante el entrenamiento, un problema común al enseñar a una IA a usar herramientas.

Resumen

En resumen, AIR es un método que enseña a los Modelos de Lenguaje Extensos Multimodales (IA que ve y lee) a actuar como un solucionador de problemas humano: piensa en un problema, se da cuenta de cuándo la matemática es demasiado difícil, escribe un script de computadora rápido para resolver el cálculo y luego termina la respuesta. La innovación clave es enseñar a la IA a hacer esto de forma automática y en el momento adecuado, sin necesidad de que un humano le diga cuándo recoger la calculadora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →