← Últimos artículos
🤖 AI

Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

Hera es un coordinador novedoso a nivel de paso entre dispositivos y la nube para agentes LLM de largo horizonte que emplea un paradigma de entrenamiento en dos etapas de aprendizaje por imitación y aprendizaje por refuerzo consciente de los costos para optimizar la compensación entre el éxito de la tarea y el costo computacional, logrando un rendimiento cercano al exclusivo de la nube con un uso de la nube significativamente reducido.

Autores originales: Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie, Zihan Fang, Jing Yang, Wenjun Zhu, Zhiwen Chen, Chengfei Lv, Zhe Chen

Publicado 2026-05-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie, Zihan Fang, Jing Yang, Wenjun Zhu, Zhiwen Chen, Chengfei Lv, Zhe Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente muy inteligente pero costoso (la Nube) y un asistente rápido, barato, pero a veces olvidadizo (el Dispositivo). Necesitas que trabajen juntos para resolver un rompecabezas largo y complicado, como planificar unas vacaciones de una semana o navegar por un laberinto.

El problema es:

  • Si dejas que el Dispositivo lo haga todo, es rápido y gratuito, pero podría perderse o cometer errores en las partes difíciles del rompecabezas.
  • Si dejas que la Nube lo haga todo, es perfecto, pero cuesta mucho dinero y tarda mucho en responder porque está lejos.

La mayoría de los sistemas existentes intentan decidir: "¿Deberíamos usar la Nube para toda esta tarea?". Si la tarea parece difícil, pagan por la Nube. Si parece fácil, usan el Dispositivo. Pero esto es como contratar a un chef maestro para que pique cada vegetal durante toda una semana solo porque el menú es complejo, aunque el chef solo necesite ayudar con la guarnición complicada.

Presentamos a Hera.

Hera es un nuevo "Capitán de Equipo" que no decide por toda la tarea. En su lugar, observa el trabajo paso a paso y toma decisiones en fracciones de segundo: "¿Es este movimiento específico fácil? Que lo haga el Dispositivo. ¿Es este movimiento complicado? Llama a la Nube para pedir ayuda."

Cómo Hera Aprende a Ser un Gran Capitán

Hera aprende a ser este capitán mediante un proceso de entrenamiento en dos etapas, como un entrenador deportivo preparando a un atleta:

Etapa 1: La Fase de "Observación" (Aprendizaje por Imitación)
Primero, Hera observa cómo la Nube realiza toda la tarea perfectamente. Luego, le pide al Dispositivo que intente los mismos pasos exactos utilizando las respuestas de la Nube como guía.

  • Si el Dispositivo acierta el paso por sí mismo, Hera aprende: "Bien, el Dispositivo es capaz aquí. No hace falta llamar a la costosa Nube."
  • Si el Dispositivo se confunde o toma una decisión diferente, Hera aprende: "Ah, este paso es demasiado difícil para el Dispositivo. Necesitamos la ayuda de la Nube aquí."
    Esto le da a Hera un reglamento básico sobre dónde el Dispositivo tiene dificultades.

Etapa 2: La Fase de "Estrategia" (Aprendizaje por Refuerzo)
Ahora, Hera juega el juego por sí mismo. Intenta resolver tareas mezclando pasos del Dispositivo y de la Nube. Obtiene una puntuación basada en dos cosas:

  1. ¿Ganamos? (¿Se completó la tarea?)
  2. ¿Gastamos demasiado? (¿Llamamos a la Nube con demasiada frecuencia?)

Hera aprende que no necesita la Nube para cada paso difícil. Aprende que, a veces, llamar a la Nube solo para un paso crítico en medio de un largo viaje es suficiente para mantener todo el plan en la dirección correcta. Aprende a ahorrar dinero llamando a la Nube solo cuando es absolutamente necesario para evitar el fracaso.

Los Resultados: Lo Mejor de Ambos Mundos

Los investigadores probaron Hera en tres "rompecabezas" diferentes:

  1. ALFWorld: Un robot intentando ordenar una casa.
  2. WebShop: Un agente intentando comprar artículos específicos en un sitio web.
  3. AppWorld: Un agente intentando escribir código para gestionar aplicaciones.

Los Números Mágicos:

  • Tasa de Éxito: Hera logró el 92.5% de la tasa de éxito de usar la Nube todo el tiempo. Casi nunca falla.
  • Ahorro de Costos: Solo utilizó la costosa Nube para el 46.3% de los pasos. El Dispositivo se encargó del resto.
  • Velocidad: Debido a que utilizó tanto el Dispositivo local, todo el proceso fue mucho más rápido que esperar a la Nube cada vez.

La Conclusión

Piensa en Hera como un gerente inteligente que sabe exactamente cuándo dejar que el empleado junior (Dispositivo) maneje el trabajo rutinario y cuándo traer al experto senior (Nube) para los problemas difíciles. Al hacer esto, el equipo termina el trabajo casi tan bien como si el experto lo hubiera hecho todo, pero a la mitad del costo y al doble de velocidad.

El artículo afirma que este es el primer sistema que toma estas decisiones paso a paso en lugar de para toda la tarea, demostrando que no necesitas un superordenador para cada movimiento individual para resolver un problema complejo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →