← Últimos artículos
🤖 AI

CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

Este artículo presenta CoBa, una política de enrutamiento de cómputo equilibrado que optimiza el escalado en tiempo de prueba al asignar dinámicamente los recursos de inferencia entre la generación y la verificación, logrando una precisión de vanguardia en evaluaciones de razonamiento matemático al tiempo que reduce significativamente los costos computacionales en comparación con los métodos de escalado tradicionales.

Autores originales: Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng Xiang

Publicado 2026-08-11
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng Xiang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un acertijo realmente difícil. Tienes una cantidad limitada de energía para gastar, y tienes tres formas de usarla: puedes pensar en una respuesta nueva, puedes verificar una respuesta que ya tienes, o simplemente puedes decir: "Está bien, he terminado, aquí está mi mejor suposición". Durante mucho tiempo, las computadoras que intentan resolver problemas difíciles (como acertijos matemáticos) han sido instruidas a simplemente "esforzarse más" haciendo una de estas cosas repetidamente. Podrían generar cien respuestas diferentes y elegir la más popular, o podrían gastar una enorme cantidad de energía revisando cada una de las respuestas con un robot juez súper inteligente y lento. El problema es que esto es como usar un mazo para romper una nuez. Si la respuesta es obvia, revisarla cien veces es un desperdicio. Si la respuesta es súper difícil, simplemente adivinar al azar podría no encontrarla nunca. La gran pregunta para los científicos es: ¿cómo gastamos nuestra energía limitada para obtener la respuesta correcta sin agotar la batería?

Aquí es donde entra una nueva idea llamada CoBa. Piensa en CoBa como un gerente inteligente para un equipo de trabajadores. En lugar de decirle a cada trabajador que haga exactamente lo mismo, CoBa observa la situación y decide el mejor siguiente paso. Si los trabajadores ya están de acuerdo en una respuesta fácil, CoBa dice: "¡Genial, deténganse! Hemos terminado". Si están confundidos, CoBa podría decir: "Pidamos ideas a dos personas más". Pero si están trabados en un problema realmente difícil, Coب dice: "Bien, enviemos las dos mejores ideas al juez experto para que las revise". Los investigadores probaron esto en miles de problemas matemáticos y descubrieron que, al ser un gerente inteligente, CoBa podía obtener los mismos puntajes altos que los métodos de "fuerza bruta" (que lo intentan todo) pero utilizó un 49.1% menos de las "unidades de energía costosas" (llamadas tokens ponderados por parámetros). Es como obtener la misma comida deliciosa pero usando la mitad de los ingredientes.

El Problema: La trampa del "Más es Mejor"

Durante un tiempo, la mejor manera de hacer que la IA fuera más inteligente para resolver problemas era simplemente lanzarle más potencia de cómputo. Si querías una mejor respuesta, le pedías a la IA que generara más soluciones. Si querías estar seguro, le pedías a una segunda IA que las revisara todas. Esto es como intentar encontrar una aguja en un pajar trayendo a mil personas para que busquen en todo el pajar, incluso si la aguja está justo encima. Funciona, pero es increíblemente caro y lento.

El artículo argumenta que este enfoque de "talla única" es un desperdicio. Algunos problemas son fáciles y necesitan una mirada rápida. Otros son difíciles y necesitan un pensamiento profundo. Pero los métodos antiguos trataban cada problema de la misma manera. Gastarían la misma enorme cantidad de energía en una pregunta matemática simple que en un complejo rompecabezas de nivel Olimpiada. Los autores de este artículo querían solucionar esto convirtiendo el escalado en tiempo de prueba (hacer que la IA piense más duro durante la prueba) en un problema de asignación de recursos. Se preguntaron: "Dado un presupuesto fijo de energía, ¿deberíamos gastar el siguiente poco de energía generando una nueva idea, verificando una antigua o simplemente deteniéndonos?".

La Solución: El Gerente Inteligente (CoBa)

Los autores introdujeron CoBa (escalado de tiempo de prueba equilibrado por cómputo), que actúa como un controlador de tráfico para el cerebro de la IA. Así es como funciona, paso a paso:

  1. El Calentamiento: Primero, CoBa le pide a la IA que genere un conjunto pequeño y diverso de respuestas (como pedir ideas a dos amigos). Este es el "calentamiento".
  2. La Verificación Barata: Luego, ejecuta una revisión rápida y de baja energía en todas las respuestas. Esto es como preguntarle a un amigo: "¿Esto suena bien?". Es rápido y barato.
  3. La Decisión: Basándose en lo que encontró la verificación barata, CoBa toma una decisión:
    • Detenerse: Si todos están de acuerdo y la verificación barata tiene confianza, CoBa se detiene inmediatamente. No hay necesidad de desperdiciar energía.
    • Generar Más: Si las respuestas están por todos lados, CoBa pide algunas ideas más para obtener más opciones.
    • Verificación Fuerte: Si hay algunas respuestas prometedoras que aún son un poco inciertas, CoBa las envía solo a esas candidatas específicas a un "Súper Juez" (un modelo de IA mucho más potente y costoso) para una revisión profunda y exhaustiva.

Esta es la diferencia clave: en lugar de revisar todo con el Súper Juez, CoBa solo envía los candidatos más interesantes. Ahorra la energía costosa para los momentos en que realmente importa.

Los Resultados: Más Inteligente, No Más Duro

Los investigadores probaron este sistema en más de 3,000 problemas matemáticos, que van desde matemáticas escolares estándar hasta acertijos muy difíciles de nivel de competencia (como AIME y AMC). Compararon CoBa contra los métodos antiguos de "fuerza bruta".

  • La Gran Victoria: La mejor versión de CoBa (llamada CoBa-Routed-Strong) logró una precisión del 85.13%. Esto es casi exactamente lo mismo que los métodos más caros, que puntuaron 85.20% (usando un sistema de votación de autoevaluación) y 85.12% (usando un "best-of-16" de voto por mayoría).
  • Los Ahorros: Aquí está la parte mágica. Para obtener ese mismo puntaje alto, los métodos costosos usaron una enorme cantidad de potencia de cómputo. CoBa-Routed-Strong utilizó un 49.1% menos de tokens ponderados por parámetros que el método de autoevaluación y un 58.9% menos que el método "best-of-16".
  • El Intercambio: El artículo señala que el método "best-of-16" (que simplemente genera 16 respuestas y elige la más común) fue todavía ligeramente más preciso por una fracción minúscula (0.01 puntos), pero costó 2.43 veces más ejecutarlo. CoBa sugiere que, para la mayoría de los usos en el mundo real, la ganancia de precisión mínima no vale el enorme costo.

Qué Significa para el Futuro

El artículo sugiere que el futuro del razonamiento de la IA no es solo hacer modelos más grandes y fuertes. Es ser más inteligentes con los recursos que tenemos. Los autores encontraron que el mayor cuello de botella no siempre es la verificación; a veces, es que la IA simplemente no llegó a la respuesta correcta en primer lugar. En los problemas más difíciles (como AIME 2025), incluso el gerente más inteligente no pudo encontrar la respuesta correcta si el "grupo inicial" de ideas no la contenía.

Sin embargo, para la gran mayoría de los problemas, CoBa demostró que podemos dejar de desperdiciar energía. Al utilizar un sistema de "triaje" —verificaciones baratas para todos, y verificaciones caras solo para los complicados— podemos obtener los mejores resultados sin romper el banco. El artículo concluye que este enfoque convierte la "brecha del oráculo" (la diferencia entre lo que la IA podría hacer si supiera la respuesta y lo que realmente hace) en una señal útil. Si la IA falla, ahora sabemos exactamente dónde mirar: ¿nos detuvimos demasiado pronto? ¿Verificamos los candidatos equivocados? ¿O simplemente necesitábamos generar mejores ideas en primer lugar?

En resumen, CoBa nos enseña que en el mundo de la IA, el tiempo y el objetivo son tan importantes como la potencia bruta. No se trata de qué tan duro pienses; se trata de saber cuándo pensar duro y cuándo detenerte.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →