← Últimos artículos
🤖 machine learning

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Este artículo presenta Macaron-V1, una familia de modelos de agentes abiertos diseñada para el aprendizaje continuo y la automejora en entornos reales, que cuenta con una arquitectura de Mezcla de LoRA que congela un modelo base mientras compone dinámicamente adaptadores especialistas, junto con un marco de codiseño de Model-Harness recursivo e infraestructura de soporte para la adaptación y evaluación recursiva.

Autores originales: Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nol
Publicado 2026-08-11
📖 9 min de lectura🧠 Análisis profundo

Autores originales: Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La máquina de aprendizaje que nunca deja de crecer

Imagina que tienes un nuevo y brillante amigo que sabe todo sobre el mundo hasta el día en que lo conociste. Es inteligente, pero si le preguntas sobre una nueva aplicación lanzada ayer o un hábito personal que desarrollaste la semana pasada, se queda bloqueado. No puede aprender de tus conversaciones específicas porque su cerebro está "congelado" en el tiempo. Este es el límite actual de la mayoría de la inteligencia artificial: son entrenadas una vez, se distribuyen y luego simplemente repiten lo que saben, incapaces de crecer realmente a partir de sus experiencias diarias.

El campo de la informática que intenta solucionar esto se llama Aprendizaje Continuo (Continual Learning). Piensa en ello como intentar enseñar a un estudiante que nunca deja de ir a la escuela. En lugar de solo memorizar un libro de texto y tomar un examen final, un agente verdaderamente inteligente necesita aprender de cada interacción, cada error y cada nueva herramienta que adquiere, todo esto mientras recuerda quién es y en qué es bueno. La gran pregunta que los investigadores se plantean es: ¿Cómo construimos una IA que no solo "sepa" cosas, sino que realmente las experimente y mejore siendo un asistente personal con el paso del tiempo?

Aquí es donde entra Macaron-V1. Es una nueva familia de modelos de IA diseñados para ser "experienciales", lo que significa que aprenden de las interacciones de la vida real y siguen mejorando incluso después de haber sido desplegados. Los investigadores detrás de él, Mind Lab, se dieron cuenta de que para hacer que una IA sea verdaderamente inteligente, no basta con verter más datos en un cerebro gigante. Necesitas un sistema que pueda adaptar su entorno y colaborar con ayudantes especializados. Construyeron un sistema que trata a la IA no como un cerebro único y estático, sino como un equipo flexible que puede intercambiar herramientas y refinar sus propias instrucciones en un bucle de automejora.

El equipo de Macaron-V1: Un cerebro congelado y un kit de herramientas intercambiable

Imagina una biblioteca masiva y súper inteligente (el "modelo base") que nunca cambia sus libros. Es tan grande y está tan bien organizada que lo sabe casi todo. Pero una biblioteca es solo una biblioteca; no sabe cómo ayudarte específicamente. Para hacerla útil, Macaron-V1 añade una capa de "adaptadores especialistas" sobre esta biblioteca. Piensa en estos adaptadores como diferentes pares de gafas o kits de herramientas que puedes acoplar a la cabeza de la biblioteca.

Un par de gafas es para chatear (L0), otro para actuar como un agente para realizar tareas (L1), un tercero para programar (L2) y un cuarto para diseñar interfaces de usuario (L3). Esta configuración se llama Mezcla de LoRA (Mixture-of-LoRA o MoL). En lugar de reentrenar toda la biblioteca gigante cada vez que quieres que aprenda una nueva habilidad, simplemente cambias un nuevo par de gafas o ajustas los existentes. La biblioteca principal permanece congelada y segura, mientras que los especialistas hacen el trabajo pesado. Esto significa que la IA puede tener una personalidad de "chat" un minuto y una personalidad de "programación" al siguiente, sin confundirse ni olvidar su conocimiento central.

El sistema utiliza un "Proxy" inteligente (como un recepcionista) para decidir a qué especialista llamar. Cuando haces una pregunta, el recepcionista la lee, determina si necesitas a un programador, a un diseñador o solo a un compañero de charla, e instantáneamente cambia al especialista adecuado. Esto sucede tan rápido que apenas notas el cambio. El artículo muestra que este sistema es increíblemente preciso al elegir al especialista adecuado —aproximadamente el 99% de las veces— y no ralentiza demasiado las cosas, añadiendo solo un retraso mínimo.

El bucle de automejora: Ajustando las instrucciones, no el cerebro

La verdadera magia de Macaron-V1 no es solo tener estos especialistas; es cómo el sistema optimiza su rendimiento. Los investigadores construyeron un sistema llamado MindForge que ejecuta un bucle de "automejora recursiva". Imagina un videojuego donde la IA juega un nivel, falla, y luego el juego reescribe automáticamente las reglas o le da a la IA una nueva guía de estrategia para intentar de nuevo.

Así es como funciona:

  1. Descubrimiento: La IA observa lo que aún no puede hacer y crea desafíos más difíciles para sí misma.
  2. Expansión: Intenta resolver estos desafíos en un entorno simulado (como un banco de pruebas o sandbox). Si falla, el sistema no se limita a decir "incorrecto". Analiza por qué falló. ¿Fue la instrucción poco clara? ¿Faltaba la herramienta?
  3. Actualización: Si la IA encuentra una forma de tener éxito cambiando las instrucciones o las herramientas (el "harness" o arnés), registra eso. Si necesita mejorar en la habilidad real, entrena una nueva versión de su adaptador especialista.

El artículo probó esto en un conjunto de 122 tareas difíciles que la IA base no podía resolver en absoluto. En un experimento específico descrito en el informe, el cerebro del modelo permaneció completamente congelado —no se cambiaron sus pesos internos. En su lugar, el sistema utilizó una búsqueda de configuración para encontrar la combinación perfecta de instrucciones, herramientas y ajustes. Simplemente ajustando estas instrucciones y herramientas externas, lograron encontrar una configuración que permitió al sistema superar el 100% de las tareas (122 de 122).

Es crucial notar lo que este experimento demuestra: demuestra que el sistema puede lograr una cobertura de búsqueda de configuración completa en estas tareas. Esto significa que la IA ya poseía la capacidad subyacente para resolver los problemas, pero necesitaba el entorno o el prompt adecuado para desbloquearla. El experimento aisló esta etapa de "Expansión" para mostrar que cambiar la configuración funciona, pero no demostró que el modelo aprendiera la habilidad de una manera que pudiera generalizarse sin esas instrucciones específicas, ni probó el bucle completo de automejora donde los pesos reales del modelo se actualizan.

Los Benchmarks "Vivos": Probando la inteligencia en el mundo real

Para ver si Macaron-V1 es realmente bueno siendo un asistente personal, los investigadores crearon nuevas pruebas llamadas Macaron ChatBench y Macaron LivingBench. Estos no son solo cuestionarios de opción múltiple.

  • ChatBench prueba si la IA puede tener una conversación natural y empática que se sienta como si estuviera hablando con una persona real, no con un robot. Comprueba si la IA entiende tu estado de ánimo, se mantiene honesta y hace avanzar la conversación.
  • LivingBench es una simulación de la vida real. Imagina que la IA es tu asistente personal intentando planificar un viaje. El "mundo" cambia a su alrededor: los vuelos se retrasan, los precios suben y de repente tú cambces de opinión. La prueba ve si la IA puede adaptar su plan sobre la marcha, verificar la información y mantenerte tranquilo.

En estas pruebas, Macaron-V1-Venti (la versión grande de 744B) obtuvo puntuaciones muy altas, superando a varios otros modelos de primer nivel en inteligencia personal y programación. Por ejemplo, obtuvo 87.8 en el UI4A-Bench (diseño de interfaces), mientras que el siguiente mejor rondaba los 75.9. También obtuvo 94.0 en PinchBench, una prueba de uso complejo de herramientas.

Los resultados: Lo que sabemos y lo que sigue siendo un misterio

Los resultados son prometedores, pero el artículo es cuidadoso de no exagerarlos. El sistema funciona de maravilla en lo que fue probado:

  • Adaptación: Logró encontrar configuraciones para superar el 100% de un conjunto de tareas difíciles mediante el simple cambio de instrucciones y herramientas (búsqueda de configuración), demostrando que encontrar la configuración adecuada es una forma poderosa de mejorar el rendimiento sin reentrenar el cerebro.
  • Colaboración: El enfoque de "Mezcla de LoRA" funciona. La IA puede cambiar entre modos de chat, programación y diseño de manera efectiva sin perder la cabeza.
  • Eficiencia: Al mantener el cerebro principal congelado y solo cargar pequeñas herramientas especializadas, el sistema ahorra una cantidad masiva de memoria informática (aproximadamente un 74% menos que ejecutar cuatro modelos gigantes por separado).

Sin embargo, el artículo también señala lo que aún no sabe.

  • Aprendizaje a largo plazo: Aunque el sistema puede mejorar en un bucle, el artículo no demuestra que pueda seguir haciendo esto para siempre sin empeorar en las tareas antiguas (un problema llamado "olvido catastrófico"). Midieron el potencial de mejora mediante la búsqueda de configuración, pero la estabilidad a largo plazo de las actualizaciones continuas de parámetros sigue siendo una pregunta abierta.
  • Inteligencia colectiva: El sistema utiliza especialistas entrenados por el mismo equipo. La idea de tener especialistas de diferentes equipos o usuarios trabajando juntos (como un chatbot de una empresa y un bot de programación de otra) es un objetivo futuro, no algo probado aquí.
  • Despliegue en el mundo real: Las pruebas se realizaron en simulaciones controladas. Aún no sabemos cómo manejará el caos de internet real o a millones de usuarios diferentes con necesidades únicas.

Conclusión

Macaron-V1 es un paso audaz hacia una IA que no solo "sabe" cosas, sino que las "experimenta". Al combinar un cerebro estable y congelado con herramientas especialistas intercambiables y un sistema que constantemente reescribe sus propias instrucciones para resolver problemas, los investigadores han construido un modelo que es más adaptable de lo que hemos visto antes. Es como darle a una IA una navaja suiza y la capacidad de inventar nuevas herramientas sobre la marcha.

El artículo muestra que este enfoque funciona: resuelve tareas difíciles, diseña mejores interfaces y maneja conversaciones complejas mejor que muchos líderes actuales. Pero también nos recuerda que esto es solo el comienzo. El sueño de una IA que aprenda de cada interacción, para siempre, sin olvidar nunca, es todavía un trabajo en progreso. El "Macaron" ya está horneado, pero la receta para un aprendizaje verdadero y sin fin todavía se está perfeccionando.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →