← Ultimi articoli
💬 NLP

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Il documento introduce Video2GUI, un framework automatizzato che sintetizza un dataset su larga scala di 12 milioni di traiettorie di interazione con interfacce grafiche (GUI) tratte da video internet non etichettati per superare la scarsità di dati e migliorare significativamente le prestazioni di generalizzazione degli agenti multimodali per le GUI.

Autori originali: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

Pubblicato 2026-05-15
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler insegnare a un robot come usare un computer, un telefono o un sito web. Per farlo, devi mostrargli milioni di esempi di persone che cliccano sui pulsanti, digitano testo e scorrono le pagine.

Il problema è che trovare questi esempi è incredibilmente difficile. Di solito, i ricercatori devono assumere persone per registrare e etichettare manualmente ogni singolo clic, un processo lento, costoso e che li limita a pochi tipi di applicazioni. È come cercare di imparare una lingua leggendo solo poche pagine di un dizionario.

Video2GUI è un nuovo sistema che risolve questo problema trasformando l'intero internet in un'enorme e gratuita aula scolastica. Ecco come funziona, utilizzando alcune semplici metafore:

1. Il Grande Filtro (Trovare i Video Giusti)

Internet è pieno di video, ma la maggior parte è inutile per insegnare a un robot (come programmi di cucina o video di gatti). I ricercatori hanno iniziato con 500 milioni di video di YouTube.

  • La Setacciatura Grossolana: Prima, hanno utilizzato un'intelligenza artificiale intelligente per scansionare titoli e descrizioni. È come un bibliotecario che controlla rapidamente i dorsi dei libri per vedere se parlano di "computer" prima ancora di aprirli. Questo ha ridotto il mucchio a 20 milioni.
  • La Setacciatura Fine: Successivamente, hanno utilizzato un'intelligenza artificiale più avanzata per "guardare" effettivamente il primo minuto di quei video. Ha verificato: lo schermo è chiaro? La voce spiega bene i passaggi? Mostra effettivamente come usare il software? È come un insegnante severo che valuta i video per assicurarsi che siano tutorial di alta qualità.
  • Il Risultato: Si sono ritrovati con 4,2 milioni di video tutorial di alta qualità.

2. Il Traduttore (Trasformare il Video in Istruzioni)

Ora avevano i video, ma un robot non può semplicemente "guardare" un video e comprenderlo come farebbe un umano. Il video deve essere tradotto in un elenco strutturato di istruzioni.

  • Il Processo: Hanno utilizzato un'intelligenza artificiale potente (come un traduttore super-intelligente) per guardare i video e scomporli. Ha identificato l'obiettivo (ad esempio, "Compra scarpe"), i passaggi compiuti e il momento esatto in cui è avvenuto ogni clic.
  • La Magia: L'intelligenza artificiale non ha solo indovinato; ha esaminato i fotogrammi del video per trovare le coordinate esatte dei pulsanti cliccati. Ha trasformato un video di 10 minuti di qualcuno che fa shopping online in una mappa precisa, passo dopo passo: "Alle 0:05, clicca sulla barra di ricerca. Alle 0:10, digita 'sneakers'."

3. La Biblioteca (WildGUI)

Tutte queste istruzioni tradotte sono state raccolte in una nuova biblioteca massiccia chiamata WildGUI.

  • La Scala: Questa biblioteca contiene 12 milioni di percorsi di interazione (traiettorie) che coprono oltre 1.500 diverse applicazioni e siti web.
  • La Varietà: Include tutto, dai desktop Windows ai telefoni Android e ai computer Mac. È come avere una biblioteca che contiene ogni possibile modo in cui un umano abbia mai usato un computer, tutto organizzato e pronto per essere studiato da un robot.

4. L'Addestramento (Insegnare al Robot)

I ricercatori hanno preso due modelli di intelligenza artificiale esistenti (Qwen2.5-VL e Mimo-VL) e li hanno "nutriti" con questa nuova biblioteca.

  • Il Risultato: Dopo aver studiato questo enorme set di dati, i robot sono diventati significativamente migliori. Hanno migliorato le prestazioni dal 5% al 20% su vari test.
  • La Prova: Ora potevano trovare i pulsanti, cliccare sulle cose giuste e navigare siti web complessi molto meglio di prima, eguagliando o superando i migliori robot attualmente esistenti.

Il Punto Cruciale

Il documento afferma che automatizzando il processo di trasformazione dei video internet in dati di addestramento, hanno creato un enorme set di dati diversificato che rende gli agenti di intelligenza artificiale molto più abili nell'uso dei computer. Non hanno inventato un nuovo tipo di robot; hanno semplicemente fornito a quelli esistenti un libro di testo molto migliore, più grande e più diversificato da studiare.

Hanno rilasciato questo set di dati e gli strumenti utilizzati per costruirlo in modo che altri ricercatori possano utilizzarli per costruire agenti di intelligenza artificiale ancora migliori in futuro.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →