← Últimos artículos
🤖 AI

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

Este estudio demuestra que actualizar los modelos de lenguaje preentrenados en los modelos de visión y lenguaje no garantiza mejoras universales, ya que el impacto en el rendimiento depende de la tarea específica, con los modelos más nuevos mostrando ventajas en la calibración y el razonamiento pero beneficios limitados en tareas puramente visuales.

Autores originales: Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

Publicado 2026-04-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Volvamos al Granero con las LLAMAs: ¿Mejoran las "Cerebros" de IA los Ojos de la IA?

Imagina que estás construyendo un robot explorador muy inteligente. Este robot tiene dos partes principales:

  1. Sus Ojos (El Codificador Visual): Son los que miran las fotos y entienden qué hay en ellas (un árbol, un terremoto, un gráfico científico).
  2. Su Cerebro (El Modelo de Lenguaje o LLM): Es el que piensa, lee las preguntas y escribe las respuestas.

Los investigadores de este estudio se preguntaron: "Si actualizamos el 'Cerebro' del robot con la versión más nueva y potente, ¿el robot se vuelve automáticamente mejor en todo?"

Para responder esto, hicieron un experimento muy limpio y controlado. Mantuvieron los Ojos exactamente iguales (no los cambiaron) y usaron los mismos libros de entrenamiento. Solo cambiaron el Cerebro, probando tres generaciones de modelos "LLAMA" (LLAMA-1, LLAMA-2 y LLAMA-3), que son como versiones cada vez más inteligentes de un mismo genio.

Aquí están los hallazgos principales, explicados con analogías sencillas:

1. No siempre hay mejora: Depende de la tarea

La analogía: Imagina que tienes un coche de carreras. Si le pones un motor nuevo y más potente (el nuevo Cerebro), ¿va a ganar todas las carreras?

  • En una pista de carreras (Preguntas Visuales de la Vida Real): ¡Sí! El motor nuevo ayuda mucho. El robot entendió mejor las imágenes de escenas cotidianas y dio respuestas más acertadas.
  • En un examen de memoria (Ciencias): ¡No! De hecho, el robot con el motor nuevo empeoró un poco. ¿Por qué? Porque este examen requería memorizar patrones de texto específicos. El nuevo cerebro, al ser más "inteligente" y creativo, a veces ignoraba las reglas estrictas del examen para intentar ser más ingenioso, y eso le costó puntos.

Lección: Un cerebro más inteligente no garantiza un robot mejor en todas las situaciones. A veces, lo que necesitas es un cerebro que siga las reglas al pie de la letra, no uno que piense "fuera de la caja".

2. Resuelven problemas diferentes, no los mismos problemas

La analogía: Imagina que tienes a tres detectives resolviendo el mismo caso.

  • Los detectives antiguos (LLAMA-1 y 2) casi siempre coinciden en quién es el culpable.
  • El detective nuevo (LLAMA-3) a veces acusa a alguien totalmente diferente.

El estudio descubrió que el nuevo cerebro no solo resuelve más preguntas correctas; resuelve un conjunto diferente de preguntas. A veces acierta donde los antiguos fallaban, pero falla donde los antiguos acertaban. Si solo miramos la puntuación total, no vemos este cambio de comportamiento. El nuevo cerebro "piensa" de una manera distinta, enfocándose en detalles que los anteriores ignoraban.

3. Cuando los ojos son el problema, el cerebro no importa

La analogía: Imagina que intentas leer un texto escrito en un papel muy borroso y arrugado.

  • Si tienes el mejor cerebro del mundo (LLAMA-3), pero tus ojos no pueden ver las letras borrosas, no podrás leer nada.
  • En la tarea de analizar imágenes de sismos (terremotos), el problema era que la imagen era difícil de interpretar. Como los "Ojos" del robot eran los mismos para todos, el nuevo cerebro no pudo hacer magia. Todos los robots, con cerebros viejos o nuevos, fallaron o acertaron en las mismas imágenes.

Lección: Si la tarea depende de "ver" bien (percepción visual), actualizar el cerebro no sirve de mucho. Necesitas mejorar los "Ojos" (el escáner de imágenes).

4. Nuevas habilidades mágicas aparecen de la nada

La analogía: Es como si un niño aprendiera a caminar y luego, de repente, sin entrenamiento extra, aprendiera a hablar en coordenadas GPS.

  • En una tarea donde el robot debía decir la ubicación exacta (latitud y longitud) de un terremoto, los cerebros antiguos (LLAMA-1 y 2) fallaron estrepitosamente (0% de acierto). Solo podían decir "está en California".
  • El cerebro nuevo (LLAMA-3), sin embargo, acertó el 76% de las veces.

Esto sugiere que con los cerebros más nuevos, aparecen habilidades completamente nuevas que los anteriores ni siquiera tenían, especialmente cuando se necesita dar respuestas numéricas estructuradas o conocimientos muy específicos.

5. El nuevo cerebro es más humilde (y por eso es mejor)

La analogía:

  • Los cerebros antiguos eran como un estudiante que siempre levanta la mano y grita la respuesta con un 100% de seguridad, aunque esté equivocado.
  • El cerebro nuevo es como un estudiante que piensa más, duda un poco y dice: "Creo que la respuesta es X, pero no estoy 100% seguro".

Curiosamente, ese cerebro que "duda" (tiene menos confianza) es el que más aciertos tiene. Los antiguos eran demasiado seguros de sí mismos (sobreconfiados), mientras que el nuevo es más preciso y realista sobre lo que sabe.

Conclusión Final

Este estudio nos dice que no basta con comprar el modelo de IA más nuevo y esperar que todo mejore.

  • Si tu tarea es ver y entender imágenes complejas, necesitas mejorar los "Ojos" (el escáner), no el cerebro.
  • Si tu tarea es razonar o seguir instrucciones, un cerebro nuevo puede ayudarte, pero a veces cambiará cómo resuelve los problemas, no solo qué resuelve.
  • A veces, un cerebro nuevo descubre habilidades mágicas que los anteriores no tenían, pero otras veces, simplemente no hace ninguna diferencia.

Es como actualizar el motor de un coche: a veces te hace volar, a veces solo consume más gasolina, y a veces, si tienes las ruedas viejas y rotas, no importa qué motor pongas, el coche no irá rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →