← Últimos artículos
🤖 machine learning

Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs

Este artículo presenta ZO-Finetuner, un optimizador de orden cero basado en aprendizaje que aprende automáticamente estrategias de perturbación eficientes mediante un diseño con eficiencia de memoria, permitiendo un entrenamiento de una sola vez por modelo y un rendimiento superior en diversas tareas de seguimiento en comparación con los métodos estáticos de orden cero existentes.

Autores originales: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

Publicado 2026-06-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva e increíblemente compleja (un Modelo de Lenguaje Grande, o LLM) que sabe escribir, razonar y charlar. Quieres enseñarle a esta biblioteca una nueva habilidad específica, como escribir contratos legales o resolver problemas matemáticos. Este proceso se llama "ajuste fino" (fine-tuning).

Normalmente, enseñar a esta biblioteca implica un método muy costoso llamado "retropropagación" (backpropagation). Piensa en esto como un profesor que, después de cada frase que el estudiante escribe, tiene que recorrer toda la biblioteca, revisar cada libro y calcular exactamente cómo ajustar el cerebro del estudiante. Es preciso, pero requiere una cantidad enorme de memoria y energía, lo que a menudo hace que sea imposible realizarlo en computadoras estándar.

Para solucionar esto, los investigadores desarrollaron un método de "Orden Cero" (como MeZO). En lugar de recorrer toda la biblioteca, este método es como un explorador con los ojos vendados. El explorador hace una pequeña suposición (una perturbación), ve si el resultado mejoró o empeoró, y luego hace otra pequeña suposición en la dirección opuesta. Al comparar los dos resultados, puede determinar hacia dónde ir sin necesidad de ver todo el panorama. Esto ahorra una enorme cantidad de memoria.

El Problema: El Mapa de "Talla Única"
Los exploradores con los ojos vendados existentes utilizan una estrategia aleatoria fija. Hacen suposiciones de dirección basadas en una regla estándar y aburrida (como lanzar un dado equilibrado). Esto es ineficiente. A veces, la biblioteca tiene "habitaciones" específicas (bloques de parámetros) donde necesitas ser muy preciso, y otras donde puedes ser más audaz. Una estrategia fija no sabe esto; trata a cada parte de la biblioteca por igual.

La Solución: ZO Fine-tuner (El Explorador Inteligente)
Los autores crearon el ZO Fine-tuner, un sistema de "aprender a aprender". En lugar de usar una regla fija, entrenaron a un "entrenador" diminuto y súper eficiente (una red neuronal pequeña) para enseñar al explorador con los ojos vendados a adivinar mejor.

Así es como funciona, usando algunas analogías:

  1. El Entrenador (ZO Fine-tuner): Imagina a un entrenador que observa al explorador. El entrenador no necesita ver toda la biblioteca. En su lugar, el entrenador observa algunos datos estadísticos simples: "¿Qué tan desordenada está esta habitación ahora mismo?" y "¿La última suposición ayudó o perjudicó?". Basándose en esto, el entrenador le dice al explorador: "En esta habitación específica, da un paso grande y audaz. En esa otra habitación, da un paso pequeño y cuidadoso".
  2. La Estrategia de Bloques: La biblioteca es enorme (miles de millones de parámetros). Si el entrenador intentara dar instrucciones para cada libro individualmente, sería demasiado lento y consumiría mucha memoria. Sin embargo, los investigadores notaron que la biblioteca está organizada en "bloques" (como secciones de libros). El entrenador aprende a dar una instrucción por bloque. Esto es como un entrenador que le dice a todo un equipo de jugadores cómo moverse juntos, en lugar de gritarle a cada jugador individualmente. Esto mantiene el uso de memoria muy bajo.
  3. La Magia de "Entrenar una vez, Reutilizar ampliamente": Normalmente, tienes que entrenar un nuevo entrenador para cada nueva tarea. Pero los autores descubrieron algo asombroso: la "forma" de la biblioteca no cambia mucho, ya sea que estés enseñando matemáticas o escribiendo historias. Por ello, entrenaron al entrenador una sola vez en un conjunto de datos (COPA). Luego, tomaron ese mismo entrenador y lo enviaron a enseñar a la biblioteca en tareas completamente diferentes (como análisis de sentimiento o comprensión lectora) e incluso en diferentes versiones de la biblioteca.
    • El Resultado: El entrenador entrenado en una tarea funcionó sorprendentemente bien en todas las demás. Es como entrenar a un conductor en una pista específica y que luego conduzca perfectamente en una autopista totalmente distinta sin necesidad de nueva práctica.

Los Resultados
El artículo probó esto en cuatro modelos de lenguaje grandes diferentes y siete tareas distintas.

  • Rendimiento: En aproximadamente el 82% de los casos, este nuevo "Explorador Inteligente" alcanzó un mejor resultado más rápido que los exploradores de "Regla Fija" antiguos.
  • Eficiencia: No requirió mucha memoria adicional. El "entrenador" en sí es tan pequeño (menos de 2 MB para un modelo de 30 mil millones de parámetros) que es como añadir una sola página de notas a una enciclopedia de 60 GB.
  • Estabilidad: El nuevo método también fue menos sensible a la "tasa de aprendizaje" (qué tan grandes son los pasos). Incluso si le decías que diera pasos más grandes, no fallaba tan fácilmente como los métodos antiguos.

En Resumen
El artículo presenta una forma de enseñar nuevas habilidades a modelos de IA gigantes sin necesidad de una supercomputadora. Reemplazaron una estrategia de adivinación rígida y aleatoria con un entrenador diminuto e inteligente que aprende a adivinar las direcciones correctas para diferentes partes del modelo. Una vez que este entrenador es entrenado para una tarea, puede reutilizarse para enseñar al modelo muchas otras tareas de manera eficiente, ahorrando tiempo y memoria de computadora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →