← Ultimi articoli
🤖 AI

Agentic Observability: Automated Alert Triage for Adobe E-Commerce

Questo articolo presenta un framework di osservabilità agentica implementato nell'infrastruttura e-commerce di Adobe che esegue autonomamente il triage degli avvisi utilizzando un paradigma ReAct, ottenendo una riduzione del 90% del tempo medio di intuizione (mean time to insight) mantenendo l'accuratezza diagnostica attraverso l'analisi dinamica dei log e la pianificazione delle azioni basata sul contesto.

Autori originali: Aprameya Bharadwaj, Kyle Tu

Pubblicato 2026-02-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Aprameya Bharadwaj, Kyle Tu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un enorme e-commerce ad alta velocità (come quello gestito da Adobe) come una gigantesca e frenetica città. Questa città è composta da migliaia di piccoli edifici interconnessi (microservizi) che comunicano costantemente tra loro per gestire ordini, abbonamenti e visualizzare prodotti.

In questa città, le cose vanno in tilt continuamente. Un tubo si rompe nell'impianto idraulico, un semaforo si guasta o la corrente sfarfalla. Nei vecchi tempi, quando scattava un allarme, un essere umano "pompiere" (un ingegnere) doveva:

  1. Correre verso l'allarme.
  2. Prendere una mappa (log).
  3. Correre in cinque edifici diversi per controllare il loro stato.
  4. Chiamare la biblioteca per consultare il manuale specifico di quell'edificio.
  5. Infine, capire cosa si è rotto e come ripararlo.

Questo processo richiedeva molto tempo (circa 18 o 33 minuti) e il pompiere era spesso sopraffatto, dovendo gestire troppe mappe e strumenti contemporaneamente.

La Nuova Soluzione: Il Team del "Super-Detective"

Il documento presenta un nuovo sistema chiamato Agentic Observability (Osservabilità Agente). Pensate a questo non come a un singolo robot, ma a un team di detective specializzati che entra in azione istantaneamente nel momento in cui suona un allarme. Non aspettano che un umano dica loro cosa fare; passano immediatamente all'azione.

Ecco come è strutturato questo team, utilizzando una semplice analogia:

  • Lo "Scout" (Agente Splunk): Non appena suona l'allarme, questo agente corre sulla scena. Prende le specifiche "foto della scena del crimine" (log) esattamente dal luogo in cui si è verificato l'errore. Filtra il rumore e trova gli indizi specifici (messaggi di errore) che contano.
  • Il "Detective" (Agente Strumenti): Questo è il cervello dell'operazione. Esamina gli indizi che lo Scout ha trovato. Si chiede: "Abbiamo appena cambiato l'impianto idraulico? La rete elettrica sta dando problemi?". Consulta i progetti della città (runbook) e la cronologia dei cambiamenti recenti (deploy del codice) per capire perché è successo. Poi crea un piano passo dopo passo per risolvere il problema.
  • L' "Ufficiale di Controllo Qualità" (Agente di Riflessione): Prima che il team invii un rapporto al capo umano, questo agente ricontrolla il lavoro. Chiede: "Abbiamo saltato qualcosa? Questa spiegazione ha senso? La riparazione è sicura?". Se il team non è sicuro al 100%, si ferma dopo pochi tentativi e dice all'umano: "Questa è la nostra migliore ipotesi, ma abbiamo bisogno del tuo aiuto".

Come Funziona nella Realtà

Il documento ha testato questo team su un problema specifico: Errori di Validazione dei Contenuti. Immaginate uno scenario in cui la descrizione di un prodotto sul sito web presenta un errore di battitura o un formato errato. Nel vecchio sistema, un essere umano doveva cercare manualmente tra migliaia di righe di testo per trovare l'errore, identificare in quale lingua si trovasse e poi correggerlo. Questo richiedeva circa 13 minuti per ogni errore.

Con il nuovo team AI:

  1. L'allarme suona.
  2. Lo Scout estrae istantaneamente il log specifico che mostra il testo corrotto.
  3. Il Detective capisce esattamente quale prodotto e quale versione linguistica sono guasti e trova l'esatta riga di errore.
  4. L' Ufficiale di Controllo Qualità verifica i risultati.
  5. Il team invia un messaggio all'ingegnere umano dicendo: "L'errore è nel banner 'Saldi Estivi' per la versione francese, riga 42. Ecco la correzione."

L'ingegnere umano deve solo cliccare "applica" per risolvere il problema. Tutto il processo è durato circa 1,8 minuti grazie al team AI.

I Risultati

Il documento afferma che questo nuovo sistema è un vero punto di svolta per tre ragioni principali:

  1. Velocità: Ha ridotto il tempo necessario per trovare il problema (Mean Time to Insight) del 90%. Invece di aspettare 18 minuti, la risposta arriva in circa 2 minuti.
  2. Accuratezza: Il team AI è stato bravo quanto gli esperti ingegneri umani nel trovare la causa corretta (circa l'88% di accurateza), ma molto più veloce e costante.
  3. Meno Lavoro per gli Umani: Ha automatizzato circa il 65% - 75% dei passaggi che gli umani eseguivano manualmente. Ciò significa che gli ingegneri passano meno tempo a caccia di indizi e più tempo ad effettivamente riparare la città.

Il Limite

Il documento è onesto riguardo ai limiti. Il team "Super-Detective" è bravo quanto le informazioni a cui può accedere.

  • Se le "linee telefoniche" (API) si intasano perché ci sono troppi allarmi contemporaneamente, il team potrebbe rallentare leggermente.
  • Il team ha bisogno che gli umani gli insegnino le regole (runbook) per nuovi tipi di edifici. Non può inventare le regole da solo; segue solo quelle che gli sono state fornite.
  • Per le riparazioni pericolose (come spegnere un interruttore principale), un essere umano deve comunque dare l'approvazione finale per garantire la sicurezza.

Riassunto

In breve, questo documento descrive un sistema che trasforma il monitoraggio reattivo (aspettare che un umano capisca cosa non va) in un ragionamento proattivo (un team di AI che indaga, ragiona e propone una soluzione istantaneamente nel momento in cui suona un allarme). Sposta il ruolo dell'umano da "detective" a "supervisore", permettendo all'azienda di riprendersi dai guasti molto più velocemente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →