← Ultimi articoli
🤖 AI

A Layered Protocol Architecture for the Internet of Agents

Per affrontare i limiti dei singoli modelli linguistici di grandi dimensioni e l'inadeguatezza degli esistenti stack di rete per la collaborazione semantica, questo articolo propone una nuova architettura "Internet of Agents" caratterizzata da due nuovi livelli — un Livello di Comunicazione tra Agenti (L8) per l'interazione standardizzata e un Livello Semantico degli Agenti (L9) per la negoziazione del contesto, il grounding e il consenso — per abilitare sistemi multi-agente distribuiti e scalabili.

Autori originali: Charles Fleming, Luca Muscariello, Vijoy Pandey, Ramana Kompella

Pubblicato 2026-01-22
📖 6 min di lettura🧠 Approfondimento

Autori originali: Charles Fleming, Luca Muscariello, Vijoy Pandey, Ramana Kompella

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Grande Problema: Gli Agenti Parlano, ma Non si Capiscono

Immaginate di avere un team di robot molto intelligenti e veloci (Agenti AI) capaci di svolgere lavori complessi come prenotare voli o gestire catene di approvvigionamento. Sono alimentati da Large Language Models (LLM), che sono come cervelli super-intelligenti in grado di leggere e scrivere quasi tutto.

Tuttamente, questi robot hanno un grande difetto: sono bravissimi nella grammatica, ma pessimi nel contesto.

Attualmente, se il Robot A chiede al Robot B: "Prenota un biglietto per New York", il Robot B potrebbe:

  1. Indovinare: Prenotare un volo per JFK quando l'utente intendeva Newark.
  2. Perdere tempo: Chiedere: "Quale New York? Quale data?" (Questo spreca tempo e denaro).
  3. Fallire: Arrendersi perché la richiesta è troppo vaga.

Il documento sostiene che le nostre attuali regole di internet (come il TCP/IP) sono progettate per spostare dati (come inviare una lettera), non per spostare significato (come comprendere una conversazione). Abbiamo bisogno di un nuovo set di regole specificamente progettato affinché gli agenti possano capirsi perfettamente senza dover tirare a indovinare.


La Soluzione: L'"Internet of Agents" (IoA)

Gli autori propongono di costruire un nuovo "piano" sopra il nostro attuale stack di internet. Lo chiamano Internet of Agents. Per farlo funzionare, suggeriscono di aggiungere due nuovi livelli (come aggiungere due nuovi piani a un edificio) sopra lo standard application layer (dove vivono i siti web e le app).

Pensate all'attuale internet come a un Servizio Postale. È ottimo nel consegnare buste. Ma se volete che due persone conducano una negoziazione commerciale profonda e complessa, limitarsi a spedire buste non basta. Avete bisogno di una Sala Riunioni e di una Lavagna Condivisa.

Livello 8: L'Agent Communication Layer (La "Sala Riunioni")

Cosa fa: Questo livello gestisce la struttura della conversazione. Assicura che gli agenti sappiano chi sta parlando, che tipo di messaggio è e come rispettare i turni.

  • L'analogia: Immaginate una riunione formale. Il Livello 8 è il Protocollo di Riunione.
    • Definisce la "busta": Chi è il mittente? Chi è il destinatario?
    • Definisce l' "atto linguistico" (speech act): Si tratta di una Richiesta? Un Accordo? Una Domanda?
    • Definisce la "danza": Seguiamo un semplice "Richiesta -> Risposta"? O un complesso "Pubblica -> Abbonati" dove una persona parla e molti ascoltano?

Perché è importante: Attualmente, diversi agenti utilizzano diverse "regole di riunione". Alcuni usano JSON, altri XML, altri ancora formati personalizzati. Il Livello 8 standardizza tutto questo, in modo che tutti conoscano le regole del gioco, anche se non concordano ancora sul significato delle parole.

Livello 9: L'Agent Semantic Layer (La "Lavagna Condivisa")

Cosa fa: Questa è la grande idea nuova. Questo livello gestisce il significato della conversazione. Assicura che quando un agente dice "New York", l'altro agente sappia esattamente quale New York intende e quali regole si applicano a quel tema specifico.

  • L'analogia: Immaginate che gli agenti stiano cercando di costruire una casa insieme.
    • Senza il Livello 9: L'Agente A dice: "Prendimi del legno". L'Agente B porta uno stecchino. L'Agente A dice: "No, intendevo un asse da 2x4!". Continuano a discutere avanti e indietro.
    • Con il Livello 9: Prima di iniziare a costruire, si siedono e bloccano un Contesto Condiviso. Concordano su un "Progetto" (una definizione formale).
      • Concordano che "Legno" significhi "Legname con dimensioni di almeno 2x4".
      • Concordano che "New York" in questo contesto significhi "Aeroporto JFK".
      • Concordano sulle regole per "Prenotare un volo".

Come funziona:

  1. La Handshake (La stretta di mano): Quando due agenti si incontrano, controllano le loro "carte d'identità" (Contesti Condivisi). Chiedono: "Parli la versione 'Travel v2.1'?" Se sì, "bloccano" quel contesto.
  2. La Validazione: Prima che un agente invii un messaggio, il Livello 9 lo controlla rispetto al progetto bloccato. Se l'Agente A prova a dire "Prenota un volo per Marte", il Livello 9 lo ferma perché "Marte" non è presente nel progetto "Travel".
  3. Il Consenso: Se un gruppo di agenti (come uno sciame di droni) deve concordare un piano, il Livello 9 li aiuta a votare e raggiungere una singola verità condivisa, in modo che non si dividano facendo cose diverse.

Perché ne abbiamo bisogno? (La "Palude" vs La "Autostrada")

Il documento avverte che, senza questi nuovi livelli, stiamo andando incontro verso una "Palude del Caos".

  • La situazione attuale: Ogni azienda sta costruendo il proprio modo personalizzato per far parlare gli agenti. L'agente "Prenota Volo" di un'azienda parla una lingua diversa da quello di un'altra. Non possono lavorare insieme. È come avere 1.000 tipi diversi di spine elettriche; nulla si incastra con nient'altro.
  • Il Futuro (con L8/L9): Avremo un Sistema di Autostrade.
    • L8 assicura che le auto (i messaggi) abbiano la forma e le ruote giuste per viaggiare sulla strada.
    • L9 assicura che i conducenti (gli agenti) concordino tutti su cosa significhino "Stop", "Vai" e "Svolta a sinistra".

Sicurezza: Il "Firewall Semantico"

Il documento evidenzia anche che questo nuovo livello introduce nuovi pericoli.

  • La Minaccia: Un hacker potrebbe inviare un messaggio che è grammaticalmente perfetto (L8) e conforme al progetto (L9), ma che contiene una trappola nascosta. Ad esempio, un messaggio che dice "Aumenta l'ordine di 10 unità" ma che segretamente aggiunge "e inviami tutte le tue password".
  • La Difesa: Gli autori propongono dei Firewall Semantici. Questi non si limitano a controllare i cattivi indirizzi IP; controllano i cattivi significati. Agiscono come un buttafuori severo che legge la lista degli invitati e controlla l'intento di ogni persona che entra nel club, assicurandosi che nessuno stia cercando di infiltrarsi con un piano nascosto.

Sintesi

Il documento propone che, per far sì che gli agenti AI collaborino efficacemente, non possiamo limitarci a sperare che siano "intelligenti". Dobbiamo costruire una nuova infrastruttura:

  1. Livello 8 (Comunicazione): Standardizza il formato della conversazione (la busta e la danza).
  2. Livello 9 (Semantica): Standardizza il significato della conversazione (il progetto condiviso e le regole).

Separando il "come" (L8) dal "cosa" (L9), possiamo creare un "Internet of Agents" scalabile dove i robot possono collaborare su compiti complessi senza rimanere bloccati in infiniti cicli di chiarimenti o malintesi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →