← Ultimi articoli
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

Il documento presenta InfantAgent-Next, un agente generalista multimodale altamente modulare che integra capacità basate su strumenti e capacità puramente visive per abilitare un'interazione collaborativa e passo-passo con il computer, ottenendo prestazioni all'avanguardia su diversi benchmark tra cui OSWorld, GAIA e SWE-Bench.

Autori originali: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Pubblicato 2026-05-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un assistente personale molto intelligente, ma leggermente goffo, di nome InfantAgent-Next.

Nel mondo dell'automazione informatica, la maggior parte degli assistenti odierni sono come specialisti che sanno fare una sola cosa molto bene, o generalisti che cercano di fare tutto ma spesso si confondono.

  • Alcuni assistenti sono come Bibliotecari: sono ottimi nell'utilizzare un elenco specifico di strumenti (come "cerca sul web" o "apri un file"), ma se chiedi loro di cliccare un pulsante su uno schermo che non hanno mai visto prima, si bloccano perché non dispongono di uno strumento per quel pulsante specifico.
  • Altri assistenti sono come Artisti: possono guardare uno schermo e "vedere" cosa c'è, ma faticano a fare calcoli complessi o a scrivere codice perché cercano di farlo tutto solo con gli occhi, senza una calcolatrice o un editor di testo.

InfantAgent-Next è diverso. È come assumere un Team di Coltelli Svizzeri invece di una singola persona.

Come Funziona: Il Team "Cervello e Mani"

Invece di un unico cervello gigante che cerca di fare tutto, InfantAgent-Next scompone ogni lavoro in piccoli passaggi e invia ciascun passaggio all'esperto più adatto.

  1. Il Manager (Il Pianificatore): Quando chiedi "Salva questa pagina web nei miei segnalibri", un modello "Manager" di alto livello legge la tua richiesta. Non cerca di cliccare il mouse da solo. Invece, dice: "Ok, dobbiamo aprire il browser, trovare il pulsante dei segnalibri e cliccarlo".
  2. Gli Specialisti: Il Manager chiama quindi l'esperto giusto per il lavoro:
    • L'Occhio (Grounding Visivo): Se il compito è "clicca il pulsante rosso", un modello di visione specializzato guarda lo schermo, trova le coordinate esatte dei pixel di quel pulsante rosso e dice al sistema dove cliccare. È come un osservatore dagli occhi acuti che guida un arciere bendato.
    • La Calcolatrice (Esecuzione del Codice): Se il compito è "analizza questo file Excel", il Manager consegna il file a un esperto di programmazione che scrive uno script per fare i calcoli istantaneamente, invece di cercare di contare le righe guardando lo schermo.
    • L'Orecchio (Analisi Audio): Se carichi una registrazione e chiedi "A che numero di pagina viene fatto riferimento?", un modello audio specializzato ascolta il file ed estrae la risposta.
  3. La Memoria: Il sistema mantiene un quaderno condiviso. Ogni volta che uno specialista completa un passaggio, lo scrive. Il prossimo specialista prende il quaderno, legge cosa è successo e continua la storia. Questo assicura che il team non perda di vista l'obiettivo.

Perché Questo È Importante (I Trucchi "Magici")

Il documento evidenzia due problemi principali che questo sistema risolve:

  • Il Problema del "Clic": Molti agenti AI sono bravi a cliccare nel punto giusto sullo schermo. Potrebbero cliccare 5 pixel a sinistra e mancare il pulsante. InfantAgent-Next utilizza una tecnica "Zoom-In". Se deve cliccare un pulsante, non indovina semplicemente. Scatta una foto dello schermo, trova l'area generale, ritaglia quell'area per ingrandirla, trova di nuovo il pulsante, lo ritaglia di nuovo e poi clicca. È come usare una lente d'ingrandimento per trovare un ago in un pagliaio, assicurando che il clic sia preciso.
  • Il Problema della "Modifica": Quando si modifica un file di testo, l'AI spesso sbaglia i numeri di riga (ad esempio, "Cambia la riga 5" quando dovrebbe essere la riga 6). InfantAgent-Next ha un sistema di "Doppio Controllo". Propone una modifica, poi guarda il testo effettivo per verificare: "La riga 5 dice davvero quello che penso che dica?". Se non è così, aggiusta il suo piano prima di apportare la modifica, prevenendo errori disordinati.

Cosa Può Fare (La Prova)

I ricercatori hanno testato questo "Team di Specialisti" contro altri agenti AI di alto livello su tre tipi di sfide:

  1. Compiti Desktop del Mondo Reale (OSWorld): Hanno chiesto all'agente di fare cose come "scaricare un file", "modificare un documento" e "navigare un sito web". InfantAgent-Next ha battuto il famoso agente "Claude Computer Use" del 7,27%. Era migliore nel portare effettivamente a termine il lavoro senza aiuto umano.
  2. Programmazione e Correzione di Bug (SWE-Bench): Hanno chiesto all'agente di correggere codice rotto in progetti software reali. Ha funzionato tanto bene, o meglio, di molti agenti commerciali costosi e a codice chiuso.
  3. Conoscenza Generale e Logica (GAIA): Hanno posto domande complesse che richiedevano la ricerca sul web, la lettura di file e il ragionamento. InfantAgent-Next si è classificato secondo tra tutti gli agenti open-source, dimostrando di poter gestire logica complessa e multi-step.

La Conclusione

InfantAgent-Next non è un unico grande modello AI che cerca di essere tutto. È un direttore d'orchestra modulare che sa esattamente quando chiamare "L'Occhio", "L'Orecchio", "Il Programmatore" o "Il Cliccatore di Mouse". Consentendo a ogni specialista di fare ciò in cui è migliore, l'intero sistema diventa molto più intelligente, più accurato e capace di gestire i compiti disordinati e del mondo reale che affrontiamo sui nostri computer ogni giorno.

I ricercatori hanno reso disponibile il codice per questo "Team di Specialisti" affinché chiunque possa usarlo e studiarlo, sperando di aiutare a costruire assistenti informatici ancora migliori in futuro.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →