← Ultimi articoli
🤖 AI

Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

Hera è un innovativo coordinatore dispositivo-cloud a livello di step per agenti LLM a lungo orizzonte che impiega un paradigma di addestramento in due fasi, basato sull'apprendimento per imitazione e sul reinforcement learning consapevole dei costi, per ottimizzare il compromesso tra successo del compito e costo computazionale, raggiungendo prestazioni vicine a quelle del cloud esclusivo con un utilizzo del cloud significativamente ridotto.

Autori originali: Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie, Zihan Fang, Jing Yang, Wenjun Zhu, Zhiwen Chen, Chengfei Lv, Zhe Chen

Pubblicato 2026-05-26
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie, Zihan Fang, Jing Yang, Wenjun Zhu, Zhiwen Chen, Chengfei Lv, Zhe Chen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un assistente molto intelligente ma costoso (il Cloud) e un assistente veloce, economico, ma a volte distratto (il Dispositivo). Hai bisogno che lavorino insieme per risolvere un puzzle lungo e complicato, come pianificare una vacanza di una settimana o navigare in un labirinto.

Il problema è:

  • Se lasci che il Dispositivo faccia tutto, è veloce e gratuito, ma potrebbe perdersi o commettere errori nelle parti difficili del puzzle.
  • Se lasci che il Cloud faccia tutto, è perfetto, ma costa molto e richiede molto tempo per comunicare perché è lontano.

La maggior parte dei sistemi esistenti cerca di decidere: "Dovremmo usare il Cloud per tutto questo compito?" Se il compito sembra difficile, pagano per il Cloud. Se sembra facile, usano il Dispositivo. Ma questo è come assumere uno chef maestro per tagliare ogni verdura per un'intera settimana solo perché il menu è complesso, anche se lo chef ha bisogno di aiutare solo con le guarnizioni difficili.

Ecco Hera.

Hera è un nuovo "Capitano della Squadra" che non decide per l'intero compito. Invece, osserva il lavoro passo dopo passo e prende decisioni in frazioni di secondo: "Questa mossa specifica è facile? Lascia che lo faccia il Dispositivo. Questa mossa è complicata? Chiama il Cloud per aiuto."

Come Hera Impara ad Essere un Grande Capitano

Hera impara a essere questo capitano attraverso un processo di addestramento in due fasi, come un allenatore sportivo che allena un atleta:

Fase 1: La Fase di "Ombreggiamento" (Apprendimento per Imitazione)
Prima, Hera osserva il Cloud eseguire l'intero compito perfettamente. Poi, chiede al Dispositivo di provare gli stessi identici passaggi usando le risposte del Cloud come guida.

  • Se il Dispositivo esegue correttamente il passaggio da solo, Hera impara: "Ok, il Dispositivo è capace qui. Non serve chiamare il costoso Cloud."
  • Se il Dispositivo si confonde o prende una decisione diversa, Hera impara: "Ah, questo passaggio è troppo difficile per il Dispositivo. Abbiamo bisogno dell'aiuto del Cloud qui."
    Questo fornisce a Hera una regola di base su dove il Dispositivo fatica.

Fase 2: La Fase di "Strategia" (Apprendimento per Rinforzo)
Ora, Hera può giocare la partita da solo. Cerca di risolvere i compiti mescolando passaggi del Dispositivo e del Cloud. Ottiene un punteggio basato su due cose:

  1. Abbiamo vinto? (Il compito è stato completato?)
  2. Abbiamo speso troppo? (Abbiamo chiamato il Cloud troppo spesso?)

Hera impara che non ha bisogno del Cloud per ogni passaggio difficile. Impara che a volte, chiamare il Cloud per un solo passaggio critico nel mezzo di un lungo viaggio è sufficiente per mantenere l'intero piano sulla giusta strada. Impara a risparmiare denaro chiamando il Cloud solo quando è assolutamente necessario per evitare il fallimento.

I Risultati: Il Meglio di Due Mondi

I ricercatori hanno testato Hera su tre diversi "puzzle":

  1. ALFWorld: Un robot che cerca di riordinare una casa.
  2. WebShop: Un agente che cerca di acquistare articoli specifici su un sito web.
  3. AppWorld: Un agente che cerca di scrivere codice per gestire applicazioni.

I Numeri Magici:

  • Tasso di Successo: Hera ha raggiunto il 92,5% del tasso di successo dell'uso del Cloud tutto il tempo. Raramente fallisce.
  • Risparmio sui Costi: Ha utilizzato il costoso Cloud solo per il 46,3% dei passaggi. Il Dispositivo ha gestito il resto.
  • Velocità: Poiché ha utilizzato molto il Dispositivo locale, l'intero processo è stato molto più veloce rispetto all'attesa del Cloud ogni singola volta.

La Conclusione

Pensa a Hera come a un manager intelligente che sa esattamente quando lasciare che il dipendente junior (Dispositivo) gestisca il lavoro di routine e quando coinvolgere l'esperto senior (Cloud) per i problemi difficili. Facendo questo, il team finisce il lavoro quasi altrettanto bene come se l'esperto avesse fatto tutto, ma a metà costo e con il doppio della velocità.

Il documento afferma che questo è il primo sistema a prendere queste decisioni passo dopo passo piuttosto che per l'intero compito, dimostrando che non serve un supercomputer per ogni singola mossa per risolvere un problema complesso.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →