Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital
Questo documento dimostra che agenti linguistici autonomi affidabili che gestiscono capitale reale nei mercati onchain dipendono meno dalle capacità del modello di base e più da un livello operativo robusto caratterizzato da controlli tipizzati, validazione delle policy e guardie di esecuzione, che collettivamente hanno ridotto i fallimenti critici come le regole di trading fabbricate e hanno consentito un elevato successo di liquidazione in un dispiegamento su larga scala di 21 giorni.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di assumere un robot chef altamente intelligente, ma leggermente letterale, per gestire un ristorante. Gli dai un menu e un budget (il tuo "mandato") e gli dici: "Prepara cibo buono e non sprecare denaro".
In passato, i ricercatori hanno testato questi robot chef in una simulazione: gli hanno dato un menu finto e denaro finto. I chef sembravano eccellenti sulla carta. Ma questo documento descrive cosa è successo quando hanno effettivamente aperto il ristorante con denaro reale e clienti reali per 21 giorni.
Ecco la storia di ciò che hanno scoperto, utilizzando analogie semplici.
La Grande Scoperta: Non Si Tratta del Cervello del Chef
Il team si aspettava che, se avessero assunto semplicemente un robot chef "più intelligente" (un modello di intelligenza artificiale più potente), il ristorante funzionasse perfettamente. Si sbagliavano.
Hanno scoperto che l'affidabilità del ristorante non derivava dal cervello del chef da solo. Derivava dal sistema di gestione della cucina che circondava il chef. Lo chiamano "Livello Operativo".
Pensateci in questo modo:
- Il Modello (Il Chef): Può leggere una ricetta e tagliare le verdure.
- Il Livello Operativo (Il Manager della Cucina): Verifica se gli ingredienti sono freschi, impedisce al chef di buttare via il cibo, assicura che il chef non incendi accidentalmente la cucina e controlla che il conto corrisponda a ciò che il cliente ha ordinato.
Il documento sostiene che, affinché un'intelligenza artificiale gestisca denaro reale, serve un Manager della Cucina super-strict, non solo un Chef più intelligente.
L'Esperimento: "DX Terminal Pro"
Il team ha impostato un test nel mondo reale chiamato DX Terminal Pro.
- L'Impostazione: 3.505 persone hanno versato il proprio denaro reale (ETH) in "casseforti".
- La Regola: Gli umani potevano stabilire le regole (come "essere rischiosi" o "essere sicuri"), ma non potevano toccare direttamente il denaro. Solo gli agenti AI potevano acquistare e vendere token.
- Le Enjeu: Ogni volta che l'AI effettuava una transazione, costava denaro reale in commissioni (2,3% per transazione). Se l'AI commetteva un errore, denaro reale svaniva.
- La Scala: L'AI ha preso 7,5 milioni di decisioni, scambiando circa 20 milioni di dollari in criptovalute.
Gli "Incubi della Cucina" (Modalità di Fallimento)
Prima dell'evento reale, il team ha condotto test e ha individuato cinque modi specifici in cui i chef AI stavano sbagliando. Hanno risolto questi problemi modificando le regole del "Manager della Cucina", non licenziando i chef.
Il Problema della "Regola Finta" (Falsificazione delle Regole):
- Il Glitch: L'AI inventava regole che non esistevano, dicendo ad esempio: "Devo vendere perché la 'Regola #2' lo dice", quando una tale regola non esisteva.
- La Soluzione: Hanno detto all'AI: "Non inventare leggi. Se non l'hai visto scritto, non è una regola".
- Risultato: Le regole false sono scese dal 57% delle decisioni a solo il 3%.
Il Problema della "Paralisi da Commissioni":
- Il Glitch: L'AI vedeva la commissione del 2,3% e si spaventava così tanto da rifiutarsi di fare qualsiasi transazione, anche quando si trattava di un'opportunità valida. Era come un chef che si rifiuta di cucinare perché accendere il fornello costa denaro.
- La Soluzione: Hanno spostato l'avviso sulla commissione alla fine delle istruzioni, subito dopo l'opportunità di mercato. Hanno insegnato all'AI: "Sì, c'è una commissione, ma ecco perché la transazione ne vale la pena".
- Risultato: L'AI ha smesso di bloccarsi e ha ricominciato a fare transazioni.
Il Problema della "Confusione Matematica" (Indurimento dei Numeri):
- Il Glitch: L'AI trattava suggerimenti soft come leggi rigide. Se dicevi "prova a spendere circa il 33%", l'AI cercava ossessivamente di raggiungere esattamente il 33% ogni singola volta, anche quando non aveva senso.
- La Soluzione: Hanno smesso di usare numeri esatti e hanno usato invece confronti (ad esempio, "spendi di più quando il mercato è caldo").
- Risultato: L'AI ha iniziato ad agire in modo più naturale e meno robotico.
Il Problema della "Trappola dei Token" (Errata Interpretazione della Tokenomics):
- Il Glitch: Un token è crollato di prezzo. L'AI ha visto il crollo e ha venduto tutto immediatamente, non rendendosi conto che quel token aveva una regola speciale per cui i detentori venivano pagati anche se il prezzo scendeva. Era come vendere un buono sconto solo perché il negozio aveva cambiato il logo, non rendendosi conto che il buono funzionava ancora.
- La Soluzione: Hanno fornito all'AI una spiegazione chiara e strutturata della regola di pagamento speciale prima di mostrare il crollo del prezzo.
- Risultato: L'AI ha smesso di andare nel panico e ha preso decisioni più intelligenti.
Il Problema dell'"Osservatore dell'Orologio" (Trading di Cadenza):
- Il Glitch: L'AI ha iniziato a fare transazioni solo perché "erano passati 10 minuti dall'ultima transazione", ignorando il mercato. Era come un chef che taglia le verdure solo perché l'orologio dice che è ora, non perché le verdure avevano bisogno di essere tagliate.
- La Soluzione: Hanno detto all'AI di ignorare l'orologio e di fare transazioni solo in base ai segnali di mercato.
I Risultati: Un Ristorante Migliore
Una volta riparato il "Manager della Cucina" (il Livello Operativo), il sistema ha funzionato incredibilmente bene:
- Tasso di Successo del 99,9%: Quasi ogni transazione che l'AI ha tentato di fare era valida e andata a buon fine.
- Comportamento Reale: L'AI non seguiva solo gli ordini; reagiva al mercato. A volte, quando un'AI vedeva un buon affare, centinaia di altre lo vedevano anch'esse e compravano allo stesso tempo (un effetto "gregge"), proprio come fanno gli esseri umani reali.
- Istruzioni Migliori: Gli utenti che davano istruzioni chiare e specifiche (usando cursori e caselle di controllo) ottenevano risultati migliori rispetto a quelli che scrivevano solo note vaghe come "rendimi ricco".
La Conclusione Principale
Il documento conclude che se vuoi che un'intelligenza artificiale gestisca denaro reale, non cercare solo un modello AI più intelligente.
Devi costruire un sistema migliore intorno ad esso. Devi:
- Tradurre i desideri umani in regole chiare e strutturate.
- Controllare il lavoro dell'AI prima che spenda un centesimo.
- Mantenere un registro perfetto di ogni pensiero, decisione e transazione in modo da poter capire esattamente cosa è andato storto se succede.
Il "Livello Operativo" è la rete di sicurezza che trasforma un robot intelligente ma confuso in un agente finanziario affidabile.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.