← Ultimi articoli
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

Autori originali: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

Pubblicato 2026-05-15
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler imparare a giocare a un videogioco molto lungo e complicato, come Pokémon o The Legend of Zelda, ma senza alcun manuale di istruzioni, senza un insegnante e senza nessuno che ti dica quali pulsanti premere. La maggior parte dei programmi informatici che tentano di farlo si blocca dopo poche ore perché si affidano a regole pre-scritte o a enormi quantità di dati etichettati attentamente dagli esseri umani.

Il documento presenta un nuovo sistema chiamato ASH (Agenti che si affinano autonomamente tramite apprendimento incarnato). Immagina ASH non come un robot che segue una sceneggiatura, ma come un giocatore umano curioso che sa come usare Google.

Ecco come funziona ASH, scomposto in passaggi semplici:

1. Il momento "bloccato"

ASH inizia a giocare. Ha una memoria a breve termine (cosa è accaduto negli ultimi 30 secondi) e una memoria a lungo termine (momenti importanti che ha già visto). Gioca finché non incontra un muro. Forse non sa come combattere un mostro, o non sa quale strada prendere in un labirinto. Nei termini del documento, si "blocca".

2. La "ricerca su Google"

Quando ASH si blocca, non si arrende. Invece, osserva ciò che ha appena visto sullo schermo e si rivolge a internet (in particolare, a una vasta raccolta di video YouTube) per trovare altre persone che stanno giocando al gioco. Cerca video che assomiglino esattamente al momento in cui si trova bloccato.

3. Il "filtro intelligente"

Internet è pieno di rumore. ASH non guarda semplicemente video a caso; utilizza uno strumento speciale per trovare i momenti chiave. Immagina di guardare un video di 20 ore di qualcuno che gioca; non hai bisogno di guardare tutto per imparare come sconfiggere un boss. Ti basta vedere i 30 secondi specifici in cui capiscono la strategia. ASH trova automaticamente questi "brani salienti" e li salva nella sua memoria a lungo termine.

4. L'"ingegneria inversa"

Ecco la parte difficile: i video di internet che ASH trova mostrano solitamente solo lo schermo, non i tasti premuti. ASH ha un "traduttore" (chiamato Modello di Dinamica Inversa) che osserva il video e ipotizza: "Ok, per passare da questo schermo a quello schermo, il giocatore deve aver premuto 'A' e poi 'Su'". Trasforma il video muto in un insieme di istruzioni.

5. Il ciclo di "auto-miglioramento"

Ora, ASH prende queste nuove istruzioni e le mette in pratica. Aggiorna il proprio "cervello" (la sua politica) in modo che, la prossima volta che si blocca, sappia cosa fare. Quindi torna a giocare al gioco. Se si blocca di nuovo più tardi su un problema diverso, ripete l'intero processo: si blocca, cerca su internet, impara il trucco e continua.

I Risultati: Perché è importante

I ricercatori hanno testato ASH in due giochi molto diversi:

  • Pokémon Emerald: Un gioco strategico in cui viaggi, catturi mostri e combatti.
  • The Legend of Zelda: The Minish Cap: Un gioco d'azione in cui corri, salti, risolvi enigmi e combatti nemici in tempo reale.

Hanno confrontato ASH con altri metodi di intelligenza artificiale:

  • L'apprendista "da manuale": Questi sistemi hanno cercato di imparare da un enorme dataset di mosse pre-etichettate. Si sono bloccati presto perché non potevano gestire nuove situazioni che non avevano mai visto prima.
  • Il modello "genio": Questi sono enormi modelli di intelligenza artificiale che cercano di indovinare la risposta senza addestramento. Spesso "allucinano" (inventano cose) e si scontrano contro muri o parlano con personaggi inesistenti.
  • ASH: ASH continuava a migliorare. Mentre gli altri sistemi smettevano di progredire dopo circa 6 ore, ASH è andato avanti per 8 ore, imparando nuove abilità come combattere, catturare mostri e risolvere enigmi. Ha completato quasi tutti gli obiettivi principali in entrambi i giochi.

Il quadro generale

Il documento afferma che ASH dimostra che non serve un essere umano per scrivere un sistema di ricompensa o etichettare ogni singolo video per insegnare a un'intelligenza artificiale un compito lungo e complesso. Invece, se si dà a un'intelligenza artificiale la capacità di bloccarsi, cercare aiuto su internet e imparare da esso, può insegnarsi da sola a padroneggiare avventure lunghe e aperte.

È come insegnare a un bambino a andare in bicicletta non scrivendo un manuale, ma lasciandolo cadere, facendogli guardare un video di qualcun altro che va in bicicletta e poi riprovando. ASH è il primo sistema a eseguire con successo questo ciclo automaticamente in videogiochi complessi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →