← Ultimi articoli
💻 computer science

Back to the Future: A workbook time machine for spread sheet creation benchmarks

Questo articolo introduce il "workbook time machine", una pipeline che genera wtmcorpus e wtmbench per valutare le prestazioni dei modelli linguistici nei compiti di creazione di fogli di calcolo, rivelando che la specificità della query, l'orchestrazione degli agenti e le API dell'interfaccia influenzano significativamente i risultati.

Autori originali: Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

Pubblicato 2026-08-11
📖 8 min di lettura🧠 Approfondimento

Autori originali: Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a un robot come cucinare. Potresti mostrargli una lasagna finita e deliziosa e dirgli: "Fai questo", ma il robot potrebbe limitarsi a fissare il formaggio e a indovinare la ricetta. Oppure, potresti dargli una lista di istruzioni lunghissima e noiosa: "Prendi 200 grammi di formaggio, taglialo in cubetti da 1 centimetro, posizionali nello strato 3..." Ma gli esseri umani non parlano così; diciamo "Fai una lasagna" e ci aspettiamo che lo chef sappia cosa significa. Questa è la sfida dei "Large Language Models" (LLM) — programmi informatici super intelligenti che possono leggere e scrivere testi. Gli scienziati stanno cercando di insegnare a questi modelli a essere assistenti utili, non solo per scrivere storie, ma per svolgere un lavoro reale, come gestire fogli di calcolo. I fogli di calcolo sono quei programmi a griglia (come Excel) che le persone usano per tracciare i soldi, pianificare feste o analizzare dati. La grande domanda è: può un computer leggere un foglio di calcolo disordinato e reale e capire come costruirlo da zero, semplicemente ascoltando la richiesta di un essere umano?

Questo articolo introduce un trucco ingegnoso chiamato "Workbook Time Machine" (la Macchina del Tempo dei Fogli di Calcolo) per risolvere un problema importante: non avevamo un buon modo per testare se questi chef IA sapessero davvero cucinare. I ricercatori hanno costruito una pipeline che lavora all'indietro. Immagina di prendere un foglio di calcolo finito e complesso, rimuovendo tutti i grafici elaborati, le formule e la codifica a colori finché non rimangono solo i numeri grezzi. Poi, il sistema chiede a un'IA di scrivere un insieme di istruzioni che trasformerebbero quei numeri grezzi di nuovo in il lussuoso foglio di calcolo. In questo modo, hanno creato una enorme libreria di esempi "prima e dopo" con istruzioni che vanno dal super dettagliato al molto vago. Hanno usato questo per costruire un test chiamato WTM-BENCH, che valuta quanto bene i diversi modelli di IA riescano a creare fogli di calcolo.

I risultati sono stati un misto di "non male" e "oh no". Lo studio ha scoperto che le prestazioni dell'IA dipendono pesantemente da come parli con lei e da quali strumenti le dai. Se fornisci all'IA una ricetta molto specifica e passo dopo passo (come "metti questa formula nella cella D2"), essa si comporta piuttosto bene. Ma se le dai una richiesta vaga (come "crea un grafico dei dati"), spesso si perde. Inoltre, i "tools" (strumenti) che l'IA usa per interagire con il foglio di calcolo sono molto importanti; alcuni strumenti sono come un coltellino svizzero che può fare tutto, mentre altri sono come un coltello da burro che fatica con compiti complessi come le tabelle pivot. L'articolo suggerisce che, sebbene l'IA stia diventando brava a seguire ordini dettagliati, fatica ancora con il pensiero complesso e multi-step richiesto dall'automazione dei fogli di calcolo nel mondo reale, specialmente quando le istruzioni sono brevi e i compiti sono complicati.

La Macchina del Tempo in Cucina

Per capire come i ricercatori hanno costruito il loro test, pensa a una macchina del tempo che non viaggia attraverso il tempo, ma attraverso la storia di un foglio di calcolo. Di solito, quando vogliamo testare un robot, gli diamo un compito e vediamo se ha successo. Ma per i fogli di calcolo, è difficile sapere cosa sia un compito "perfetto" perché il lavoro umano reale è disordinato.

Così, gli autori hanno fatto l'opposto. Sono partiti da fogli di lavoro finiti — veri fogli di calcolo che le persone avevano già creato, pieni di formule, grafici e tabelle pivot. Hanno chiamato questo il passaggio "Backward" (all'indietro). La Macchina del Tempo ha rimosso tutti gli oggetti "derivati" (le cose elaborate come grafici e formule) per rivelare i dati "Raw" (grezzi) sottostanti. Era come prendere una torta interamente decorata e rimuovere la glassa e le decorazioni per vedere la base di pan di Spagna sottostante.

Poi è arrivato il passaggio "Forward" (in avanti). Il sistema ha chiesto a un'IA di guardare la base di pan di Spagna semplice e la torta finita e scrivere una ricetta per passare dall'una all'altra. Ma ecco il colpo di scena: non hanno scritto solo una ricetta. Ne hanno scritte tre versioni diverse:

  1. Livello 1 (Il Manuale dello Chef): "Nella cella D2, digita =10000*C2/(B2*B2), trascinalo fino a D7, poi crea un grafico a dispersione usando le colonne A e D."
  2. Livello 2 (L'Assistente Utile): "Calcola l'IMC per tutti e crea un grafico che mostri l'IMC rispetto all'Età."
  3. Livello 3 (Il Capo Vago): "Traccia il trend dell'IMC."

Questo ha creato un enorme dataset chiamato WTM-CORPUS con quasi 9.000 istruzioni. Da questo enorme mucchio, hanno selezionato un set di test bilanciato di 150 compiti chiamato WTM-BENCH. Questo set di test è stato accuratamente curato per garantire che non fosse composto solo da compiti facili di formule (che costituivano il 67% dei dati originali), ma che includesse un mix equo di grafici, tabelle pivot e formattazione condizionale, proprio come servirebbe in un vero ufficio.

Il Grande Scontro dei Fogli di Calcolo

I ricercatori hanno poi sottoposto 6 diversi modelli di IA "frontier" (le più intelligenti disponibili da aziende come Anthropic e OpenAI) a questo test. Non si sono limitati a lasciare che l'IA indovinasse; le hanno dato una "cassetta degli attrezzi" per interagire effettivamente con il foglio di calcolo. Hanno testato tre diverse cassette degli attrezzi:

  • Python (OpenPyXL): Una libreria di programmazione che legge i file come un documento di testo.
  • VBA: Il linguaggio di macro integrato in Excel, potente ma vecchio stile.
  • Office.js: Un modo moderno basato sul web per parlare con Excel.

Hanno anche testato diversi stili di "orchestrazione". Alcuni metodi permettono all'IA di scrivere codice e sperare nel meglio (one-shot). Altri permettono all'IA di scrivere codice, vedere il risultato, commettere un errore, correggerlo e riprovare (multi-turn).

Le scoperte sono state rivelatrici:

  1. La Cassetta degli Attrezzi conta più del Cervello: Il tipo di strumento che l'IA usava per controllare il foglio di calcolo faceva una grande differenza. Ad esempio, creare una "Tabella Pivot" (una tabella di riepilogo complessa) era incredibilmente difficile per lo strumento Python, che doveva gestire molteplici passaggi. Ma con VBA o Office.js, che hanno comandi integrati per questo, l'IA si comportava molto meglio. L'articolo suggerisce che l'interfaccia è importante quanto l'intelligenza del modello.
  2. La Specificità è Regina (per ora): Quando le istruzioni erano super dettagliate (Livello 1), i modelli di IA si comportavano ragionevolmente bene. Ma man mano che le istruzioni diventavano più brevi e vaghe (Livello 3), le prestazioni calavano drasticamente. I modelli faticavano a "riempire i vuoti" come farebbe un essere umano.
  3. Il Problema della Tabella Pivot: Mentre l'IA diventava abbastanza brava a creare formule e grafici, falliva quasi completamente nella creazione di Tabelle Pivot. Il "Soft Score" (una misura di quanto il risultato fosse vicino alla perfezione) per le Tabelle Pivot era vicino allo zero in quasi tutti i modelli. Ciò suggerisce una lacuna fondamentale nella capacità dell'IA di gestire la sintesi dei dati complessi e multi-step.
  4. Non fidarti del messaggio di "Successo": L'articolo ha scoperto che molti modelli di IA dichiaravano di aver finito anche quando avevano fallito. Ad esempio, nei modelli Claude, nell'80% dei casi in cui il modello diceva "Ho finito", aveva in realtà commesso un errore strutturale (come mettere il grafico nel posto sbagliato o mancare completamente l'oggetto). Questo è chiamato "successo allucinato" ed è un ostacolo importante per l'uso nel mondo reale.

Cosa Significa per il Futuro

L'articolo conclude che, sebbene l'IA stia diventando brava a seguire istruzioni rigorose e dettagliate, non è ancora pronta per essere un agente di fogli di calcolo completamente autonomo. La "Workbook Time Machine" ha dimostrato che il modo in cui testiamo l'IA conta tanto quanto l'IA stessa. Se testiamo l'IA solo con prompt facili e dettagliati, potremmo pensare che sia più intelligente di quanto non sia in realtà.

I ricercatori suggeriscono che, per migliorare, potremmo dover insegnare a questi modelli usando un "curriculum": partendo dalle istruzioni dettagliate di Livello 1 e passando lentamente a quelle vaghe di Livello 3, aiutandoli ad apprendere come riempire i vuoti. Notano anche che la pipeline che hanno costruito potrebbe essere estesa per gestire altri compiti dei fogli di calcolo, come eliminare o modificare i dati, non solo crearli.

In definitiva, lo studio mostra che siamo sulla strada giusta, ma la strada verso un agente di fogli di calcolo veramente autonomo è ancora lunga. L'IA può seguire una ricetta, ma ha ancora bisogno di un essere umano che le prenda per mano quando le istruzioni diventano vaghe o il compito si complica. La "Macchina del Tempo" ci ha fornito una mappa migliore di dove l'IA è forte e dove deve ancora imparare, assicurando che i test futuri siano equi, bilanciati e radicati nella realtà disordinata di come gli esseri umani usano effettivamente i fogli di calcolo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →