← Últimos artículos
💬 NLP

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

Este artículo presenta SPARC, un marco modular que desacopla la percepción visual del razonamiento en modelos de visión y lenguaje para permitir un escalado asimétrico y eficiente en tiempo de prueba y mejorar significativamente el rendimiento en tareas de razonamiento visual con presupuestos de tokens reducidos.

Autores originales: Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigotti

Publicado 2026-06-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigotti

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas complejo, pero en lugar de mirar la imagen completa de una vez, tienes que describir cada una de las piezas en una historia larga y divagante antes de poder adivinar cuál es la imagen final. Así es como funcionan muchos de los actuales "Modelos de Lenguaje-Visión" (IA que ve y habla) hoy en día. Intentan observar una imagen y razonar sobre ella todos al mismo tiempo, lo que a menudo los confunde, hace que inventen detalles o que se pierdan en sus propias explicaciones largas.

El artículo presenta un nuevo método llamado SPARC (Separating Perception And Reasoning Circuits - Circuitos de Percepción y Razonamiento Separados). Piensa en SPARC como un equipo inteligente de dos especialistas trabajando juntos, en lugar de un generalista sobrecargado que intenta hacer todo a la vez.

Así es como funciona, utilizando analogías sencillas:

1. El Problema: El detective que "sobrepiensa"

Los modelos de IA actuales son como detectives que intentan resolver un crimen mirando toda la escena del crimen y hablando en voz alta sobre todas las posibilidades simultáneamente.

  • El Problema: Si el detective pasa por alto una pista diminuta (como una mota de polvo) mientras está ocupado hablando del clima, podría construir toda una teoría errónea basada en ese error. Esto se llama "alucinación".
  • El Costo: Para obtener la respuesta correcta, estos modelos a menudo tienen que generar miles de palabras de "pensamiento" (tokens), lo cual es lento y costoso.

2. La Solución SPARC: El "Localizador" y el "Solucionador"

SPARC divide el trabajo en dos pasos distintos, inspirado en cómo funciona el cerebro humano. Separa la Percepción (ver) del Razonamiento (pensar).

  • Paso 1: El Localizador (Circuito de Percepción)
    Imagina a un localizador altamente entrenado cuya única tarea es mirar una foto y señalar con el dedo la parte específica de la imagen que es relevante para la pregunta.

    • Ejemplo: Si la pregunta es "¿De qué color es la bufanda?", el Localizador no responde. Solo dice: "Mira justo aquí, en el cuello de la mujer", y hace un acercamiento (zoom) a esa pequeña área.
    • Este paso es rápido, enfocado y no intenta resolver el rompecabezas todavía. Solo encuentra la "aguja en el pajar".
  • Paso 2: El Solucionador (Circuito de Razonamiento)
    Una vez que el Localizador ha hecho zoom en el área correcta, el Solucionador obtiene una vista clara y de alta resolución solo de ese punto.

    • El Solucionador ahora mira la imagen ampliada y dice: "Ah, esa es una bufanda verde".
    • Debido a que el Solucionador no se distrae con el resto del fondo desordenado, puede dar la respuesta de forma rápida y precisa.

3. Por qué esto cambia las reglas del juego

A. El "Efecto Lupa"
El artículo muestra que si le das a la IA una vista perfecta y ampliada del lugar correcto, puede resolver el problema incluso si el resto de la imagen es borrosa o de baja calidad.

  • Analogía: Es como intentar leer una etiqueta diminuta en una botella. No necesitas ver toda la tienda; solo necesitas una lupa sobre la etiqueta. SPARC actúa como esa lupa, permitiendo que la IA utilice menos potencia de cómputo mientras obtiene mejores resultados.

B. La "Red de Seguridad" (Autoconsistencia)
A veces, el Localizador podría señalar el lugar equivento por accidente. SPARC tiene un truco ingenioso: le pide al Localizador que señale ocho veces rápidamente.

  • Si el Localizador señala el mismo lugar 7 de las 8 veces, el sistema sabe que ese es el lugar correcto.
  • Esto es mucho más barato que pedirle al "Detective" completo que piense de ocho maneras diferentes el problema. Es como pedirle a un equipo de localizadores que voten sobre la ubicación, y luego enviar la respuesta final al experto solucionador.

C. Entrenar al equipo por separado
En la forma antigua, si intentabas enseñar a la IA a mejorar en la localización de cosas, podrías accidentalmente hacer que empeore en la resolución de problemas (como enseñarle a un jugador de ajedrez a hacer malabares, y que entonces olvide cómo jugar al ajedrez).

  • Con SPARC, puedes entrenar al "Localizador" para que sea increíble encontrando cosas sin tocar al "Solucionador". Esto significa que puedes mejorar la visión de la IA sin romper su cerebro.

4. Los Resultados en lenguaje sencillo

Los investigadores probaron esto en acertijos visuales muy difíciles donde la IA tenía que encontrar detalles diminutos en imágenes enormes y de alta resolución (como fotos satelitales o diagramas complejos).

  • Mejor Precisión: SPARC acertó significativamente más preguntas que los modelos estándar de "sobrepensamiento".
  • Mucho más Rápido: Utilizó hasta 200 veces menos potencia de cómputo (tokens) para obtener los mismos o mejores resultados.
  • Robustez: Incluso cuando la imagen era borrosa o la pregunta era complicada, SPARC no se confundió ni inventó respuestas falsas con tanta frecuencia como los otros modelos.

Resumen

SPARC es como contratar a un Localizador para encontrar la pieza correcta del rompecabezas y a un Solucionador para armarla, en lugar de obligar a una sola persona a hacer ambas tareas mientras habla consigo misma durante horas. Al separar el "mirar" del "pensar", la IA se vuelve más rápida, más barata de ejecutar y mucho menos propensa a cometer errores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →