← Ultimi articoli
🤖 AI

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX introduce una fonderia composibile e adattiva che evolve sistematicamente le interfacce di runtime degli agenti AI attraverso un'algebra di sostituzione e un'evoluzione multi-agente guidata dalle tracce, ottenendo guadagni di prestazioni significativi in vari benchmark senza fare affidamento esclusivamente sulla scalabilità del modello.

Autori originali: Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang, Yuan Xie, Heng Qu, Kun Shao, Jian Luan

Pubblicato 2026-06-15
📖 5 min di lettura🧠 Approfondimento

Autori originali: Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang, Yuan Xie, Heng Qu, Kun Shao, Jian Luan

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un tirocinante brillante ma inesperto (il modello AI). Vuoi che risolva un problema complesso, come pianificare un viaggio, riparare un sito web interrotto o navigare in un videogioco.

Attualmente, la maggior parte delle persone cerca di rendere il tirocinante più intelligente assumendo un "super-tirocinante" (un modello AI più grande e costoso). Ma questo articolo, HarnessX, sostiene che il vero segreto non sia solo assumere un tirocinante migliore; è costruire un ufficio, un kit di strumenti e un manuale di regole migliore per fargli lavorare.

Gli autori chiamano questa "configurazione dell'ufficio" un Harness (Imbracatura/Struttura).

Il Problema: L'Ufficio "Fatto a Mano"

Attualmente, se vuoi che un'IA svolga un nuovo lavoro, un ingegnere umano deve costruire manualmente un ufficio personalizzato per lei. Scrive istruzioni specifiche (prompt), collega strumenti specifici e imposta sistemi di memoria.

  • Il Problelo: Questi uffici sono statici. Se il tirocinante cambia o il lavoro cambia, l'intero ufficio deve essere ricostruito da zero.
  • Lo Spreco: Quando il tirocinante sbaglia, guardiamo l'errore, sistemiamo l'ufficio manualmente e riproviamo. Raramente usiamo quegli errori per migliorare automaticamente l'ufficio o persino per addestrare il tirocinante a essere migliore al tentativo successivo.

La Soluzione: La "Fonderia dell'Harness"

HarnessX è una fabbrica (una "fonderia") che costruisce questi uffici automaticamente. Tratta la configurazione dell'ufficio come un'entità viva che può essere assemblata, adattata ed evoluta autonomamente.

Ecco come funziona, suddiviso in tre parti semplici:

1. Composizione: L'Ufficio LEGO

Invece di un ufficio disordinato e aggrovigliato, HarnessX costruisce l'ufficio partendo da blocchi LEGO intercambiabili e tipizzati chiamati "Processor" (Processori).

  • L'Analogia: Immagina che l'ufficio abbia degli slot specifici: uno per gli "Strumenti", uno per la "Memoria", uno per le "Regole" e uno per il "Contesto".
  • Come funziona: Puoi incastrare un blocco "Ricerca Web" nello slot degli Strumenti o un blocco "Memoria a lungo termine" nello slot della Memoria. Poiché si tratta di blocchi standardizzati, puoi sostituirli senza rompere l'intera struttura. Questo rende l'ufficio modulare e sicuro da modificare.

2. Adattamento: Il Manager che si Auto-Migliora (AEGIS)

Questo è il cervello del sistema. HarnessX utilizza un manager speciale chiamato AEGIS che osserva il lavoro del tirocinante e corregge automaticamente l'ufficio.

  • Lo Specchio: AEGIS tratta l'uffio come un personaggio di un videogioco. Osserva le "tracce" (il registro passo dopo passo di ciò che ha fatto il tirocinante) e si chiede: "Perché ha fallito? È stato lo strumento? La regola? Il prompt?".
  • Il Ciclo in 4 Fasi:
    1. Digest (Digerire): Legge i log disordinati e riassume i fallimenti.
    2. Plan (Pianificare): Decide che tipo di modifica è necessaria (ad es. "Abbiamo bisogno di un nuovo strumento" rispetto a "Dobbiamo riscrivere le istruzioni").
    3. Evolve (Evolvere): Costruisce effettivamente la nuova configurazione dell'ufficio.
    4. Critic (Criticare): Agisce come un rigoroso ispettore della sicurezza. Testa il nuovo ufficio per assicurarsi che non rompa le cose che funzionavano prima.
  • Il Risultato: L'ufficio migliora costantemente da solo, senza che un essere umano debba riscrivere il codice ogni volta.

3. Co-Evoluzione: Una Strada a Doppio Senso

Di solito, o sistemiamo l'ufficio o addestriamo il tirocinante. HarnessX fa entrambe le cose contemporaneamente.

  • L'Analogia: Immagina che l'ufficio migliori, il che aiuta il tirocinante a imparare nuovi trucchi. Poi, il tirocinante diventa più intelligente, il che permette all'ufficio di tentare compiti ancora più complessi.
  • Il Ciclo: Il sistema usa i fallimenti del tirocinante per aggiornare l'ufficio e usa il nuovo ufficio per generare dati di addestramento migliori per aggiornare il cervello del tirocinante. Si sollevano a vicenda.

Cosa è Emerso dagli Esperimenti?

Il team ha testato il sistema su cinque diversi "giochi" (benchmark) che spaziano dallo shopping online all'ingegneria del software. Hanno utilizzato tre diversi tipi di modelli AI (dai più piccoli ai più grandi).

  • La Grande Vittoria: In media, il sistema ha migliorato le prestazioni del 14,5%.
  • La Vittoria Straordinaria: Per i modelli AI più deboli, il miglioramento è stato massiccio, fino al 44%.
    • Perché? L'articolo nota che i modelli più deboli hanno più "gap comportamentali" (non sanno come fare certe cose). Un ufficio migliore (harness) può colmare questi gap immediatamente. I modelli più forti sono già piuttosto bravi, quindi l'ufficio li aiuta meno.
  • Il Proble Politico del "Blocco": In un test molto confuso (GAIA), un singolo ufficio non poteva risolvere tutto perché alcuni compiti richiedevano regole opposte. Il sistema ha risolto questo problema creando molteplici versioni dell'ufficio (varianti) e indirizzando ogni compito alla versione più adatta. Questo ha impedito al sistema di "dimenticare" come eseguire i compiti precedenti.

La Conclusione

L'articolo conclude che non dobbiamo aspettare che i modelli AI diventino infinitamente intelligenti per ottenere risultati migliori. Costruendo un ambiente di runtime composibile e auto-evolutivo (l'Harness), possiamo estrarre enormi guadagni di prestazione, specialmente per i modelli più piccoli o meno capaci.

In breve: Non limitarti a comprare un tirocinante più intelligente; costruisci un ufficio più intelligente e capace di auto-ripararsi, e lascia che impari dai propri errori per rendere l'ufficio ancora migliore.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →