← Últimos artículos
💻 computer science

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

El artículo presenta CASHEW, un marco de trabajo en tiempo de inferencia, y CASHEW-RL, una variante aprendida entrenada con Optimización de Política de Secuencia de Grupo, para estabilizar el razonamiento multimodal mediante la agregación iterativa de trayectorias candidatas y el filtrado de alucinaciones a través de verificación visual, logrando mejoras significativas de rendimiento en 13 evaluaciones de comprensión de imágenes y videos.

Autores originales: Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli

Publicado 2026-06-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas difícil, como averiguar exactamente qué está haciendo una taza de agua en un video de una pintura. Si le preguntas a una IA estándar (un Modelo de Lenguaje-Visión) solo una vez, podría suponer: "¿Tal vez el artista está guardando el pincel ahí?". Está segura, pero se equivoca. Si le preguntas de nuevo, podría suponer: "¿Tal vez es para descansar el pincel?". Sigue adivinando, y sus respuestas cambian constantemente. Este es el problema que el artículo llama razonamiento inestable.

Los autores de este artículo, de la Universidad Estatal de Arizona y NewsBreak, crearon una solución llamada CASHEW (y una versión más inteligente llamada CASHEW-RL) para solucionar esto. Así es como funciona, usando analogías simples:

1. El Problema: El "Pensador Solitario"

Los modelos de IA actuales son como una sola persona intentando resolver un rompecabezas en una habitación oscura. Podrían tropezar con sus propios pies (cometer un error) y seguir caminando en la dirección equivocada porque no pueden ver toda la imagen con claridad. A menudo "alucinan", lo que significa que inventan hechos que no están ahí, como decir que una taza es para almacenamiento cuando en realidad es para limpiar.

2. La Solución: El "Grupo de Estudio" (CASHEW)

En lugar de dejar que la IA piense sola, CASHEW convierte a la IA en un grupo de estudio.

  • El Proceso: Cuando la IA recibe una pregunta, no da solo una respuesta. Genera toda una multitud de diferentes "rutas de pensamiento" (trayectorias). Imagina a 8 estudiantes diferentes en una habitación, cada uno intentando resolver el rompecabezas por su cuenta.
  • La Verificación de la Realidad (Verificación Visual): Esta es la esencia del éxito. Antes de que el grupo acuerde una respuesta, un "árbitro" (una herramienta de verificación visual) revisa su trabajo contra la imagen o el video real. Si un estudiante dice: "La taza es para almacenamiento", el árbitro mira el video y dice: "No, no veo un estante de almacenamiento. Veo al artista sumergiendo el pincel para limpiarlo".
  • La Síntesis: La IA toma las mejores partes de las ideas de los 8 estudiantes, filtra las mentiras (alucinaciones) usando las notas del árbitro y las combina en una respuesta superprecisa y basada en evidencia.

Es como tomar una sesión de lluvia de ideas desordenada y convertirla en un informe pulido y verificado por hechos.

3. La Mejora: El "Experto Internalizado" (CASHEW-RL)

La primera versión (CASHEW) es genial, pero requiere que la computadora ejecute el proceso del "grupo de estudio" cada vez que responde a una pregunta, lo cual puede ser lento.

Los autores también crearon CASHEW-RL. Piensa en esto como tomar ese grupo de estudio y enseñar a la IA a convertirse ella misma en la líder del grupo.

  • Entrenaron a la IA utilizando un sistema de recompensa especial (como la puntuación de un videojuego) que otorgaba puntos por:
    1. Obtener la respuesta correcta.
    2. Citar la evidencia visual correcta (como señalar la taza).
    3. No perder el tiempo en preguntas fáciles (ser eficiente).
  • Después de este entrenamiento, la IA aprendió a realizar el "pensamiento grupal" y la "verificación de hechos" por sí misma, dentro de su propio cerebro, de manera mucho más rápida y eficiente.

¿Qué Encontraron?

El artículo probó esto en 13 bancos de pruebas diferentes que involucran imágenes y videos. Los resultados fueron como encontrar una varita mágica para el razonamiento de la IA:

  • Grandes Saltos en la Precisión: En un examen científico llamado ScienceQA, la puntuación de la IA saltó 26.2 puntos porcentuales. En una prueba de razonamiento de video llamada EgoSchema, saltó 9.1 puntos porcentuales.
  • Menos Alucinación: La IA dejó de inventar hechos. Empezó a ceñirse a lo que realmente podía ver en la imagen.
  • Mejor que la Competencia: Cuando se comparó con otros métodos que intentan arreglar el razonamiento de la IA (como simplemente preguntarle a la IA la misma pregunta 8 veces y elegir la respuesta más común), CASHEW ganó en todas las ocasiones.

En Resumen

El artículo afirma que, al obligar a la IA a pensar en grupos, verificar su trabajo contra la evidencia visual y aprender de sus errores, podemos hacer que sea mucho más confiable. Esto evita que la IA adivine con confianza y la pone en el camino de un razonamiento cuidadoso y basado en la evidencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →