← Ultimi articoli
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO introduce un framework efficiente di distillazione delle competenze online che consente agli agenti web multimodali di migliorare le prestazioni e ridurre il consumo di token mantenendo una libreria strutturata di competenze e impiegando tecniche come la riflessione sui progressi e il prompting consapevole della cache, ottenendo un tasso di successo del 58,3% su VisualWebArena con costi di inferenza significativamente inferiori rispetto ai metodi esistenti.

Autori originali: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Pubblicato 2026-05-26
📖 5 min di lettura🧠 Approfondimento

Autori originali: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Grande Problema: La Trappola del "Pagamento per Clic"

Immagina di assumere un assistente molto intelligente, ma costoso, per aiutarti a fare acquisti online. Ogni volta che guarda una pagina web, riflette su cosa fare o clicca un pulsante, devi pagare una piccola tassa (chiamata "token").

Attualmente, la maggior parte degli agenti AI cerca di migliorare nel loro lavoro spendendo più denaro. Se falliscono, riprovano. Se si bloccano, chiedono un secondo parere. Esegono la stessa attività dieci volte e scelgono il risultato migliore. Questo funziona, ma è come pagare un taxi per andare al supermercato, poi pagare un secondo taxi per tornare indietro e controllare se hai dimenticato il portafoglio, e un terzo taxi per verificare il prezzo. Il lavoro viene svolto, ma è incredibilmente costoso e lento.

Gli autori di questo documento si sono chiesti: Possiamo creare un agente che diventa più economico e più veloce man mano che lavora, invece di spendere semplicemente più denaro ogni volta?

La Soluzione: PANDO (L'Agente "Gigante Aspen")

I ricercatori hanno costruito un agente chiamato PANDO. Lo hanno battezzato in onore del boschetto di pioppi tremuli "Pando" nello Utah.

  • La Metafora: Pando sembra composto da 47.000 alberi separati, ma in realtà sono tutti collegati da un unico sistema radicale sotterraneo. Quando un albero cresce, condivide i nutrienti con gli altri. Quando un albero muore, il sistema radicale lo ricorda e mantiene in vita l'intero bosco.
  • La Versione AI: PANDO è un agente AI che possiede una radice di memoria condivisa (una Libreria di Abilità). Invece di trattare ogni nuovo compito come un problema completamente nuovo, ricorda ciò che ha imparato dai compiti precedenti e utilizza quelle lezioni per risolverne di nuovi.

Come Funziona PANDO (Il Ciclo a 4 Passi)

PANDO non si limita a indovinare e verificare. Segue un ciclo: Pianifica → Agisci → Rifletti → Impara.

  1. Pianifica: Il "Cervello" (un'AI intelligente ma costosa) scompone un grande compito (come "trovare la chitarra più economica sotto i 500 dollari") in piccoli passi.
  2. Agisci: Le "Mani" (un'AI più economica e veloce) cliccano effettivamente sui pulsanti.
  3. Rifletti: Un "Responsabile" verifica se i passaggi hanno funzionato. Il filtro del prezzo ha effettivamente modificato l'elenco? Se no, perché?
  4. Impara (La Parte Magica): È qui che PANDO diventa più intelligente.
    • Libreria di Abilità: Se l'agente trova con successo una chitarra economica, scrive la ricetta: "Per trovare oggetti economici, clicca su 'Ordina per Prezzo' e poi dal 'Minimo al Massimo'." Salva questo come una Regola o una Routine.
    • Riutilizzo delle Abilità: La prossima volta che l'agente deve trovare l'oggetto "più costoso", non ha bisogno di pensare intensamente. Guarda semplicemente nella sua libreria, vede la regola e inverte l'interruttore su "Dal Massimo al Minimo".
    • Demozione (La Pulizia): Se una regola smette di funzionare (ad esempio, un sito web cambia il suo layout), l'agente la segna come "rotta" e smette di usarla. Questo impedisce all'agente di rimanere intrappolato in loop cercando di utilizzare vecchie istruzioni inutilizzabili.

Perché È un Cambiamento di Paradigma

Il documento ha testato PANDO su 910 diversi compiti web (acquisti, annunci classificati, Reddit). Ecco cosa è successo:

  • Tasso di Successo: PANDO ha avuto successo nel 58,3% dei casi. Questo è migliore rispetto agli agenti attuali di punta (che si aggiravano intorno al 54%).
  • Costo: Questo è il grande successo. PANDO ha utilizzato il 58% in meno di token (denaro) rispetto al prossimo miglior agente.
  • L'Effetto "Pranzo Gratuito":
    • All'inizio: PANDO è un po' lento perché sta imparando le regole.
    • In seguito: Man mano che costruisce la sua libreria di abilità, diventa più veloce ed economico. Alla fine del test, risolveva i compiti con meno passaggi e meno denaro rispetto all'inizio.
    • Analogia: Immagina uno studente che sostiene un esame di matematica.
      • Vecchi Agenti: Ogni volta che vedono un nuovo problema, rivedono la formula da zero. Ci vuole un'eternità.
      • PANDO: La prima volta che vedono un problema, lo risolvono e scrivono la formula su un foglio di appunti. Le successive 99 volte, guardano semplicemente il foglio di appunti. Finiscono l'esame più velocemente e con meno sforzo mentale.

I "Costi Nascosti" Che PANDO Evita

Il documento sottolinea che altri agenti nascondono i loro costi in due modi:

  1. Scoperta Pre-valutazione: Alcuni agenti passano settimane a "addestrarsi" o a "scoprire" strumenti prima ancora che inizi il test. PANDO impara durante il test, quindi non ci sono costi iniziali nascosti.
  2. Scalabilità del Rollout: Alcuni agenti provano semplicemente il compito 10 volte e scelgono il vincitore. PANDO lo prova una volta sola, ma utilizza la sua memoria per far sì che quel singolo tentativo conti.

La Conclusione

PANDO dimostra che non è necessario buttare più denaro su un'AI per renderla migliore. Fornendole una memoria strutturata (una libreria di abilità) e un modo per ripulire i ricordi cattivi (demozione), l'agente diventa più efficiente man mano che lavora.

È la differenza tra un lavoratore che dimentica tutto ogni giorno e deve essere riaddestrato costantemente, e un lavoratore che tiene un quaderno di "come fare le cose" e diventa più veloce ogni singolo giorno.

Concetto Chiave: PANDO non diventa solo più intelligente; diventa più economico da eseguire man mano che guadagna esperienza.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →