Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents
Questo articolo introduce "Formal Skill", un'astrazione nativa per il runtime che sostituisce le istruzioni informali in linguaggio naturale con macchine a stati eseguibili e schemi JSON per migliorare l'efficienza, l'accuratezza e l'applicabilità degli agenti LLM, come dimostrato dalle prestazioni superiori del framework open-source FairyClaw su Harness-Bench.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di assumere un tirocinante molto intelligente e velocissimo (l'agente AI) per risolvere un problema complesso nel tuo ufficio, come riparare un componente software rotto.
Il Vecchio Metodo: Il Manuale "Muro di Testo"
Attualmente, la maggior parte degli agenti AI funziona così: gli fornisci un manuale di istruzioni massiccio e dettagliato scritto in inglese semplice (una "Prompt Skill"). Dice cose come: "Prima, guarda il registro degli errori. Poi, prova a correggere il codice. Assicurati di non eliminare i file di test. Se fallisci, riprova. Una volta finito, scrivi un rapporto."
Il documento definisce questo una "Informal Skill". Presenta tre grandi problemi:
- È costoso: L'AI deve leggere questo enorme manuale ogni singola volta che compie un passo. Questo costa molti "token" (la valuta della potenza di calcolo dell'AI).
- È vago: L'AI deve indovinare cosa significhino realmente "riprova" o "non eliminare". È come dire a un umano "Stai attento", senza definire cosa significhi "stare attenti".
- È fragile: Se l'AI commette un errore, deve riesaminare l'intera cronologia della conversazione per ricordare dove si trovava. Non ha una "lista di controllo" integrata per sapere se ha finito o se deve tornare indietro di un passo.
Il Nuovo Metodo: La "Formal Skill"
Gli autori propongono un nuovo approccio chiamato "Formal Skill". Invece di fornire all'AI un lungo manuale testuale, gli forniscono un kit di strumenti programmabile.
Pensaci come al passaggio dal fornire a uno chef un libro di ricette di 50 pagine al fornirgli una cucina intelligente con funzioni di sicurezza integrate:
- La Ricetta è Codice, non Testo: Invece di leggere paragrafi, l'AI interagisce con pulsanti specifici (strumenti) e segue un diagramma di flusso rigoroso (macchina a stati).
- Il Sistema "Hook": Immagina un buttafuori in un club (l'"Hook"). A seconda della fase del lavoro in cui si trova l'AI, il buttafuori decide quali porte sono aperte.
- Fase 1 (Indagine): Il buttafuori apre solo la porta agli "Strumenti di Ricerca". La porta "Elimina" è bloccata.
- Fase 2 (Riparazione): Il buttafuori apre lo "Strumento di Patch" ma blocca di nuovo la porta "Elimina".
- Fase 3 (Verifica): Il buttafuori non lascerà uscire l'AI dalla stanza finché non mostra un certificato "Approvato" dalla macchina di test.
- La Macchina a Stati: L'AI non deve ricordare l'intera storia. Ha solo un piccolo badge digitale che dice: "Sono attualmente nella fase 'Riparazione'". Se tenta di saltare alla fase "Reporting" prima che "Riparazione" sia completata, il sistema la blocca automaticamente.
Il Motore "FairyClaw"
Per rendere tutto questo funzionante, gli autori hanno costruito un nuovo motore chiamato FairyClaw. Puoi pensare a FairyClaw come al manager intelligente che dirige lo spettacolo.
- Non si limita a chattare con l'AI; gestisce attivamente gli strumenti e le regole dell'AI.
- Suddivide i grandi compiti in sottocompiti più piccoli e assegna la "Formal Skill" corretta a ciascuno.
- Mantiene un registro continuo di esattamente dove si trova l'AI, cosa ha fatto e cosa deve ancora fare, in modo che l'AI non si perda mai.
I Risultati: Più Veloce, Più Economico e Più Sicuro
Gli autori hanno testato questo sistema (FairyClaw) contro altri popolari sistemi di agenti AI utilizzando un test severo chiamato Harness-Bench.
- Il Punteggio: FairyClaw ha ottenuto risultati pari o migliori rispetto agli altri sistemi nel completare effettivamente il lavoro.
- Il Costo: Questo è il grande vantaggio. FairyClaw ha utilizzato il 48% in meno di token (denaro/potenza di calcolo) rispetto alla media degli altri sistemi.
- Analogia: Se gli altri sistemi fossero come un camion delle consegne che gira per la città leggendo ad alta voce un'enorme mappa al conducente ad ogni svolta, FairyClaw sarebbe come un GPS che mostra al conducente solo la prossima svolta e mantiene il resto della mappa nascosto finché non è necessario.
- Il Test "Riparazione Codice": Su un compito specifico relativo alla riparazione di codice buggato, FairyClaw è stato il chiaro vincitore. Poiché la "Formal Skill" ha costretto l'AI a verificare il proprio lavoro prima di terminare, non ha commesso gli errori sciocchi che altri agenti hanno fatto.
Riassunto
Il documento sostiene che dovremmo smettere di trattare le competenze dell'AI come lunghi e vaghi manuali di istruzioni e iniziare a trattarle come protocolli software rigorosi ed eseguibili. Spostando le regole dal "testo che l'AI legge" al "codice che l'AI esegue", otteniamo agenti più economici da far funzionare, più difficili da ingannare e più bravi a seguire procedure complesse.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.