← Ultimi articoli
🤖 AI

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill è un framework che converte le abilità testuali in adattatori LoRA plug-and-play tramite una hypernetwork pre-addestrata, consentendo agli agenti LLM di archiviare procedure di task riutilizzabili nello spazio dei pesi anziché nello spazio del contesto, il che riduce significativamente l'overhead dei token migliorando al contempo le prestazioni e consentendo la composizione modulare delle abilità.

Autori originali: Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

Pubblicato 2026-08-18
📖 6 min di lettura🧠 Approfondimento

Autori originali: Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I modelli linguistici di grandi dimensioni sono diventati straordinariamente capaci di ragionare su problemi complessi, agendo spesso come agenti digitali in grado di pianificare, cercare e interagire con il software per completare compiti. Per gestire lavori specializzati, questi agenti si affidano spesso a "competenze" (skills)—essenzialmente istruzioni scritte o procedure che dicono al modello come risolvere un tipo specifico di problema, come organizzare una stanza virtuale o rispondere a una domanda multi-step. Tradizionalmente, queste competenze vengono inserite direttamente nell'input del modello ogni volta che deve usarle, molto simile al leggere una pagina di un manuale pagina per pagina prima di compiere un'azione. Sebbene questo funzioni, crea un collo di bottiglia significativo: più complesso è il compito e più grande è la libreria di competenze, più testo il modello deve elaborare, il che lo rallenta e consuma enormi quantità di potenza di calcolo. Inoltre, mantenere queste istruzioni come testo semplice nell'input le lascia esposte e vulnerabili a essere fraintese o dirottate da altre parti del sistema.

Ricercatori della Shanghai Jiao Tong University e dell'OPPO Research Institute hanno proposto un approccio diverso chiamato LatentSkill, che sposta queste istruzioni dall'input testuale alla struttura della memoria interna del modello. Invece di leggere una descrizione della competenza ogni volta, il sistema utilizza un generatore specializzato per convertire il testo di una competenza in un insieme compatto di aggiustamenti interni, noti come adapter, che sono permanentemente attaccati al "cervello" del modello. Ciò consente all'agente di "conoscere" la competenza senza dover leggere nuovamente le istruzioni. Il team ha scoperto che questo metodo non solo velocizza il processo e riduce la quantità di dati che il modello deve gestire, ma crea anche uno spazio nascosto e organizzato dove diverse competenze possono essere mescolate e accoppiate con precisiona matematica.

L'idea centrale dietro questo lavoro è trattare una competenza non come un documento da leggere, ma come un insieme di pesi da caricare. Nel loro framework, un "compilatore di competenze" prende una descrizione scritta di un compito e genera istantaneamente un insieme unico di modifiche interne per il modello linguistico. Queste modifiche sono piccole, efficienti e modulari, il che significa che possono essere attaccate o staccate dal modello principale senza dover riaddestrare l'intero sistema. Una volta che una competenza viene convertita in questo formato interno, il testo originale viene scartato dal flusso di input. Il modello opera quindi utilizzando questi aggiustamenti nascosti, che guidano il suo comportamento in modo altrettanto efficace quanto farebbe il testo, ma senza l'onere pesante di elaborare migliaia di parole extra per ogni singolo passaggio di un compito.

Per testare ciò, i ricercatori hanno applicato il loro sistema a due sfide distinte: una simulazione testuale di un robot che naviga in una casa per completare faccende domestiche, e una serie di complessi compiti di risposta a domande che richiedono la ricerca attraverso molteplici fonti di informazione. Nel compito di navigazione domestica, il sistema doveva capire come raccogliere oggetti, pulirli e posizionarli in luoghi specifici. Nel compito di risposta alle domande, doveva trovare risposte che richiedevano la connessione di diversi pezzi di informazione. Confrontato con il metodo standard di incollare le istruzioni della competenza nel prompt, il nuovo approccio si è dimostrato significativamente più efficiente. Nei compiti di navigazione domestica, il sistema ha migliorato il suo tasso di successo di oltre venti punti percentuali nei compiti familiari e di più di tredici punti nei compiti nuovi e mai visti, il tutto utilizzando quasi i due terzi in meno di token di input. Nei benchmark di risposta alle domande, ha raggiunto un tasso di accuratezza più elevato riducendo il numero di token elaborati per passaggio di oltre il settanta per cento.

Oltre a risparmiare tempo e risorse, i ricercatori hanno scoperto che questi aggiustamenti interni delle competenze possiedono una sorprendente quantità di struttura. Quando hanno mappato lo spazio matematico in cui vivono queste competenze, hanno scoperto che le competenze appartenenti alla stessa categoria, come i compiti di pulizia o i compiti di ricerca, si raggruppano naturalmente, formando cluster distinti. Ciò suggerisce che il sistema non sta solo memorizzando testo, ma sta imparando la logica sottostante delle procedure. Questa struttura permette un alto grado di controllo; i ricercatori hanno scoperto che potevano regolare la forza di una competenza semplicemente girando una manopola, rappresentata da un numero di scala. Se il numero era troppo basso, la competenza non aveva effetto; se era troppo alto, il modello diventava confuso. Tuttavia, con l'impostazione corretta, il modello operava in modo ottimale, e questo punto di equilibrio rimaneva costante attraverso diversi tipi di compiti.

Forse il reperto più intrigante è stato che queste competenze interne potevano essere combinate. Proprio come si potrebbero mescolare gli ingredienti per creare un nuovo piatto, i ricercatori hanno dimostrato che potevano prendere gli aggiustamenti interni per due diverse competenze e sommarli per creare una nuova competenza composita. Tuttavia, ciò funzionava in modo affidabile solo quando le competenze venivano scomposte nei loro componenti più piccoli e allineati prima di essere mescolate. Se semplicemente aggiungevano i blocchi completi delle competenze, il risultato era spesso meno efficace. Allineando attentamente le parti, sono stati in grado di creare una competenza che eseguiva una sequza complessa di azioni senza perdere la capacità di eseguire i singoli passaggi. Ciò suggerisce che il sistema può costruire comportamenti complessi assemblando pezzi modulari di conoscenza in un modo che sia sia flessibile che preciso.

Lo studio ha anche evidenziato un significativo vantaggio in termini di sicurezza. Poiché le competenze sono memorizzate come aggiustamenti interni piuttosto che come testo visibile, sono molto più difficili da manomettere. Quando i ricercatori hanno testato il sistema contro tentativi di dirottare le istruzioni o estrarre la conoscenza nascosta, il nuovo metodo ha resistito notevolmente bene. Mentre l'approccio tradizionale basato sul testo spesso crollava o rivelava i suoi segreti quando attaccato, la versione interna della competenza ha mantenuto le sue prestazioni e ha mantenuto nascoste le sue istruzioni. Ciò indica che spostare le competenze dal prompt visibile ai pesi interni del modello offre un modo più robusto e sicuro per equipaggiare gli agenti artificiali con conoscenze specializzate.

I ricercatori concludono che questo approccio offre una via pratica per costruire agenti IA più capaci ed efficienti. Spostando la memorizzazione della conoscenza procedurale dal flusso di input ai parametri interni del modello, hanno dimostrato un modo per rendere gli agenti più veloci, più sicuri e migliori nel combinare diverse abilità. I risultati suggeriscono che il futuro degli agenti IA potrebbe non risiedere nel nutrirli con più testo, ma nell'insegnare loro a portare le proprie competenze internamente, pronte per essere dispiegate con un semplice, invisibile interruttore.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →