Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps
Questo articolo introduce un benchmark rigoroso per valutare agenti di ricerca avanzata su compiti di consulenza specialistica mediante prompt redatti da esperti contenenti trappole cognitive, rivelando che i modelli all'avanguardia attuali (Claude, o3 e Gemini) ottengono tassi di accettazione uniformemente bassi a causa di modalità di fallimento distinte come allucinazioni, errori aritmetici e ragionamenti incoerenti.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di assumere un team di assistenti alla ricerca super-intelligenti per svolgere un compito complesso: devono leggere un mucchio disordinato di documenti, trovare numeri specifici, eseguire alcuni calcoli matematici e redigere un rapporto professionale per un CEO. Se sbagliano anche un solo numero, il CEO potrebbe commettere un errore da un miliardo di dollari.
Questo articolo è come un colloquio di lavoro rigoroso per tre dei più avanzati assistenti alla ricerca AI disponibili oggi (Claude, o3 e Gemini). Gli autori, di Deccan AI Research, volevano vedere se queste AI potevano effettivamente svolgere il tipo di lavoro dettagliato e ad alto rischio che fanno i consulenti gestionali umani, o se erano semplicemente bravi a rispondere a semplici domande di cultura generale.
Ecco la spiegazione del loro esperimento, utilizzando analogie semplici:
1. Il Test: Un "Percorso a Ostacoli Pieno di Trappole"
La maggior parte dei test precedenti per l'AI era come chiedere: "Qual è la capitale della Francia?" (richiamo fattuale). Questo test era diverso. Gli autori hanno creato 42 scenari complessi basati su lavori di consulenza reali.
Pensa a questi scenari come a un corso di sopravvivenza progettato per ingannare le AI. I documenti forniti alle AI contenevano "trappole cognitive", come:
- La trappola del "Falso Indizio": Un file pieno di 100 pagine di testo, ma la risposta è nascosta in una piccola nota a piè di pagina alla pagina 98.
- La trappola della "Contraddizione": Un documento dice che il prezzo è 50 dollari, ma una nota a piè di pagina dice: "A meno che non sia martedì, allora è 60 dollari".
- La trappola della "Matematica": Chiedere una media, ma il metodo corretto richiede una media ponderata (come calcolare la tua media basandosi su quanto vale ogni esame).
Se un'AI si limitava a scorrere superficialmente o indovinava, falliva.
2. I Giudici: Due Livelli di Valutazione
L'articolo non ha lasciato che una AI valutasse un'altra AI. Hanno utilizzato un sistema di punteggio a due livelli:
- Livello 1: I Controllori Robot (Verificatori): Questi sono controlli rigorosi e automatizzati. L'AI ha prodotto il file? Ha usato i numeri giusti? Ha citato le fonti corrette? Se l'AI sbagliava un singolo passaggio matematico, questo livello la segnava come fallita.
- Livello 2: L'Esperto Umano (Il SME): Un vero consulente umano (con oltre 15 anni di esperienza) ha letto il rapporto dell'AI. Lo ha valutato su cinque aspetti:
- Integrità dei Dati: Hai inventato fatti?
- Rigorosità Analitica: La tua logica è solida?
- Rilevanza: Hai risposto alla domanda o hai solo divagato?
- Esecuzione: Hai fatto i calcoli matematici correttamente?
- Formato: Il rapporto è professionale e utilizzabile?
Il punteggio finale combinava questi due livelli. Per "superare" il test, un'AI doveva superare entrambi i controlli robotici e impressionare l'esperto umano.
3. I Risultati: Il "Tasso di Superamento" Era Shockantemente Basso
Su un totale di 126 tentativi (42 compiti × 3 AI), quasi nessuno è passato.
- Gemini ha superato circa il 21% delle volte.
- Claude e o3 hanno superato solo il 9,5% delle volte.
In altre parole, se assumessi una di queste AI per un progetto di consulenza da un milione di dollari, c'era una probabilità dal 79% al 90% che non riuscissero a fornire un rapporto utilizzabile e accurato.
4. Come ha Fallito Ogni AI (Le "Personalità" del Fallimento)
L'articolo ha scoperto che ogni AI falliva in modo unico, come tre studenti diversi che sostengono un esame difficile:
Claude (Il Fabbricatore Sicuro di Sé):
- Punto di forza: Era il migliore nel creare effettivamente i file finali (come documenti Word o fogli Excel). Raramente dimenticava di consegnare il compito.
- Debolezza: Era il più propenso a mentire. Quando non trovava una risposta nei documenti, inventava con sicurezza un numero o una fonte per colmare il vuoto. Era come uno studente che scriveva un bel saggio ma inventava tutti i fatti.
o3 (Il Matematico Attento ma Gozzo):
- Punto di forza: Quando ragionava, la sua logica era spesso la più pulita.
- Debolezza: Spesso ometteva sezioni richieste del rapporto o commetteva errori matematici a cascata. Se sbagliava il primo passaggio, il resto della matematica era sbagliato. A volte ignorava anche le istruzioni per creare un file e forniva solo una risposta testuale.
Gemini (L'Altalena):
- Punto di forza: Quando funzionava, era spesso il migliore. Aveva il maggior numero di punteggi "perfetti".
- Debolezza: Era inaffidabile. Aveva il maggior numero di punteggi "zero". A volte si bloccava, rifiutava di rispondere o produceva un file con codice rotto. Era come uno studente che o superava l'esame con il massimo dei voti o falliva così miseramente da non presentarsi nemmeno.
5. La Grande Conclusione
L'articolo conclude che, sebbene questi agenti AI siano impressionanti, non sono ancora pronti per lavori ad alto rischio e di livello decisionale.
Se un consulente umano commette un errore, di solito è una piccola svista. Se queste AI commettono un errore, è spesso un fallimento catastrofico: potrebbero inventare una fonte falsa, bloccare il software o perdere una nota a piè di pagina critica che cambia l'intera decisione aziendale.
Gli autori stanno attualmente preparando una seconda versione, più ampia, di questo test, ma per ora il messaggio è chiaro: Non affidare ancora a queste AI le decisioni da un miliardo di dollari della tua azienda. Stanno ancora imparando a essere ricercatori affidabili.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.