← Ultimi articoli
💻 computer science

Covering Human Action Space for Computer Use: Data Synthesis and Benchmark

Questo articolo affronta la scarsa affidabilità degli agenti per l'uso del computer in interazioni complesse e a bassa frequenza introducendo il benchmark CUActSpot e una pipeline di sintesi dei dati basata sul rendering, che insieme permettono a un modello da 4 miliardi di parametri di superare modelli open-source più grandi su diverse modalità GUI.

Autori originali: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

Pubblicato 2026-05-13
📖 5 min di lettura🧠 Approfondimento

Autori originali: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo

Articolo originale dedicato al pubblico dominio sotto CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a un maggiordomo robot come usare il tuo computer. Vuoi che clicchi sui pulsanti, scriva e-mail e organizzi i file esattamente come fai tu. Da molto tempo, i ricercatori hanno addestrato questi robot principalmente su compiti di semplice clic, come premere un pulsante "Invia" o cliccare su un collegamento. È come insegnare al robot solo come premere il campanello.

Ma l'uso reale del computer è molto più complesso. A volte è necessario trascinare un file da una cartella all'altra, disegnare un cerchio intorno a una foto per ritagliarla o selezionare un paragrafo specifico di testo per eliminarlo. Il documento sostiene che i maggiordomi robot attuali falliscono in questi compiti "a coda lunga" perché non sono stati praticati abbastanza. Sono come uno studente che ha studiato solo per un test a scelta multipla ma viene improvvisamente chiamato a scrivere un saggio.

Ecco una panoramica di ciò che gli autori hanno fatto per risolvere il problema, utilizzando analogie semplici:

1. Il Problema: La Trappola del "Solo Clic"

Gli autori hanno analizzato perché i modelli AI avanzati (come GPT-5.4) falliscono quando cercano di usare i computer. Hanno scoperto che, mentre i robot sono bravi nei semplici clic, si confondono quando vengono richiesti di fare cose complesse come trascinare una cella di un foglio di calcolo o disegnare una forma.

  • L'Analogia: Immagina un esame di guida in cui l'unica cosa che hai mai esercitato è girare la chiave nel contatto. Se improvvisamente devi fare una manovra di parcheggio parallelo o immetterti in autostrada, farai un incidente. I modelli AI attuali sono ottimi a girare la chiave (cliccare) ma terribili nel parcheggiare (trascinare e disegnare).

2. La Soluzione Parte 1: Un Nuovo "Esame di Guida" (CUActSpot)

Per risolvere il problema, il team ha costruito un nuovo benchmark chiamato CUActSpot. Pensalo come un nuovo esame di guida più difficile per i robot.

  • Cosa cambia? Invece di chiedere semplicemente al robot di "cliccare sul pulsante rosso", questo test gli chiede di:
    • Trascinare un file nel cestino.
    • Disegnare una linea per collegare due forme.
    • Selezionare una parola specifica in un documento.
    • Ritagliare una persona da una foto.
  • I Cinque Mondi: Il test copre cinque diversi "mondi" sul tuo schermo: applicazioni standard (GUI), documenti di testo, fogli di calcolo (Tabelle), aree di disegno e foto naturali.
  • Le Regole: Hanno creato regole rigorose per valutare i robot. Se il robot tenta di trascinare un file ma clicca accidentalmente su un'area "Vietata" (come un annuncio pop-up), fallisce immediatamente. Questo garantisce che il robot sia preciso, non solo fortunato.

3. La Soluzione Parte 2: La "Fabbrica Magica" (Sintesi dei Dati)

Il problema più grande era che non c'erano abbastanza esempi di queste azioni complesse per insegnare ai robot. Non si può semplicemente aspettare che gli umani registrino milioni di ore di trascinamento e disegno; ci vuole troppo tempo.

  • L'Analogia: Invece di aspettare che i guidatori reali si esercitino, il team ha costruito un simulatore di videogiochi.
  • Come funziona: Hanno scritto codice per generare automaticamente milioni di schermate di computer fake.
    • Hanno creato fogli di calcolo finti con numeri casuali.
    • Hanno disegnato forme finte su un'area di disegno.
    • Hanno preso foto reali e contrassegnato parti specifiche di esse.
  • Il "Maestro" (LLM): Hanno utilizzato un'intelligenza artificiale intelligente (un LLM) per guardare queste schermate finte e scrivere istruzioni come: "Trascina la freccia verde sulla parte superiore del cerchio giallo". L'AI ha anche calcolato le coordinate esatte a cui il robot doveva muoversi.
  • Il Risultato: Hanno generato 50 milioni di campioni di pratica. È come dare al robot un milione di ore di pratica di guida in un simulatore prima che tocchi mai una macchina reale.

4. La Scoperta: La Varietà è Meglio del Volume

Il team ha condotto esperimenti per vedere cosa rende un robot più intelligente. Hanno scoperto qualcosa di sorprendente:

  • Il Vecchio Modo: Dare semplicemente al robot più della stessa cosa (ad esempio, 10 milioni di esempi di clic sui pulsanti) non ha aiutato molto.
  • Il Nuovo Modo (Scalabilità della Varietà): Dare al robot diversi tipi di compiti (clic, trascinamento, disegno, tabelle, testo) lo ha reso molto più intelligente.
  • L'Analogia: È come uno chef. Se pratichi solo il trinciare cipolle, diventi bravo con le cipolle. Ma se pratichi il trinciare cipolle, affettare pomodori, grigliare bistecche e cuocere il pane, diventi uno chef maestro in grado di gestire qualsiasi ricetta. Il robot ha imparato che la competenza di muovere il mouse è più importante dell'oggetto specifico che sta muovendo.

5. Il Risultato: Il Nuovo Robot (Phi-Ground-Any-4B)

Utilizzando questo nuovo "esame di guida" e la "fabbrica magica" di dati, hanno addestrato un nuovo modello chiamato Phi-Ground-Any-4B.

  • Il Raggiungimento: Questo modello è relativamente piccolo (solo 4 miliardi di parametri), eppure supera modelli open-source molto più grandi (alcuni oltre i 32 miliardi di parametri) in questi compiti complessi.
  • Il Rovescio della Medaglia: Il modello è ancora un po' debole nello stile vecchio di test (che si concentrano solo sul cliccare pulsanti standard), ma è un campione nei nuovi compiti complessi che contano davvero per l'uso reale del computer.

Riassunto

Il documento afferma: "Smettete di insegnare ai robot solo come cliccare. L'uso reale del computer comporta trascinamento, disegno e modifica. Abbiamo costruito un nuovo test per misurare queste competenze, creato una fabbrica per generare milioni di esempi di pratica e dimostrato che insegnare ai robot una vasta varietà di azioni li rende molto più bravi nell'usare i computer rispetto al semplice insegnamento del clic".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →