← Ultimi articoli
💻 computer science

Guidelines for Empirical Studies in Software Engineering involving Large Language Models

Questo lavoro presenta una tassonomia di sette tipi di studi e otto linee guida obbligatorie o raccomandate, sviluppate da 22 ricercatori, per migliorare la riproducibilità e la trasparenza delle ricerche empiriche in ingegneria del software che coinvolgono i modelli linguistici di grandi dimensioni (LLM).

Autori originali: Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treud
Pubblicato 2026-03-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treude, Marcos Kalinowski, Stefano Lambiase, Daniel Russo, Mircea Lungu, Cristina Martinez Montes, Lutz Prechelt, Paul Ralph, Rijnard van Tonder, Stefan Wagner

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina che il mondo della ricerca sul software sia come un grande laboratorio di cucina, dove gli scienziati (i ricercatori) stanno cercando di creare nuove ricette (software) o di capire come cucinano gli altri. Fino a poco tempo fa, usavano solo ingredienti classici e manuali. Ma ora, hanno scoperto un nuovo tipo di "assistente culinario" super intelligente: i Modelli Linguistici di Grande Dimensione (LLM), come ChatGPT o Claude.

Questi assistenti sono magici: scrivono codice, correggono errori e analizzano testi in un batter d'occhio. Ma c'è un problema: sono un po' imprevedibili. Se chiedi la stessa ricetta due volte, potrebbero darti due piatti leggermente diversi. Inoltre, nessuno sa esattamente cosa hanno mangiato per diventare così bravi (i loro dati di addestramento sono segreti) e cambiano continuamente, come se la loro ricetta segreta venisse aggiornata ogni giorno.

Questo crea un caos per la scienza: se un ricercatore dice "Ho fatto questa scoperta usando l'assistente A", un altro scienziato non può ripetere l'esperimento perché l'assistente A potrebbe essere cambiato o perché non sa esattamente come è stato usato.

Per risolvere questo problema, 22 esperti (come un consiglio di chef stellati) hanno scritto una guida pratica per tutti coloro che usano questi assistenti nella ricerca. Ecco i punti chiave, spiegati con metafore semplici:

1. La "Carta d'Identità" dell'Assistente (Dichiara chi e come)

Non puoi dire "Ho usato un robot" senza dire quale robot. Devi scrivere chiaramente: "Ho usato il modello X, versione Y, per fare Z".

  • Metafora: È come dire in una ricetta: "Ho usato un mixer KitchenAid modello 2024, non un frullatore a mano". Se non lo dici, nessuno può ricreare il tuo piatto.

2. La "Fotografia" del Momento (Versioni e Configurazioni)

I modelli cambiano spesso. Devi dire esattamente quale "fotografia" del modello hai usato e quali impostazioni avevi (es. "quanto creativo" doveva essere).

  • Metafora: Se un assistente cambia idea su cosa è "creativo" da un mese all'altro, devi specificare: "L'ho impostato al 70% di creatività il 10 gennaio". Senza questo, il tuo esperimento è come una foto sfocata.

3. Non solo il Motore, ma l'Auto Intera (Architettura)

Spesso l'assistente non lavora da solo, ma è parte di un sistema più grande (come un'auto con GPS, sensori e volante). Devi spiegare come funziona tutto il sistema, non solo il motore.

  • Metafora: Non basta dire "Ho usato un'auto Tesla". Devi spiegare se avevi anche il pilota automatico attivo, quale mappa usavi e come gestivi il traffico.

4. La "Lista della Spesa" delle Domande (Prompt e Log)

Le domande che fai all'assistente (i "prompt") sono fondamentali. Una domanda fatta male dà una risposta sbagliata. Devi mostrare esattamente cosa hai scritto.

  • Metafora: È come mostrare la lista della spesa esatta e le istruzioni precise date allo chef. Se cambi una parola nella domanda ("Fammi un dolce" vs "Fammi una torta al cioccolato"), il risultato cambia. Devi registrare anche le conversazioni complete.

5. Il "Controllo Umano" (Validazione)

L'assistente può sbagliare o allucinare cose. Non puoi fidarti ciecamente di tutto ciò che dice. Devi far controllare il lavoro da un umano esperto.

  • Metafora: Anche se hai un assistente che cucina velocissimo, alla fine devi assaggiare il piatto tu stesso prima di servirlo agli ospiti. Non puoi dire "Il robot ha detto che è buono, quindi lo è".

6. La "Copia di Sicurezza" Aperta (Baseline Open Source)

Se usi un assistente a pagamento (chiuso e segreto), dovresti anche provare a usare un assistente gratuito e aperto (di cui tutti possono vedere il codice) per vedere se i risultati sono simili.

  • Metafora: Se dici che il tuo nuovo motore funziona meglio, dovresti anche testarlo su un motore vecchio e noto per fare un confronto equo. Se usi solo motori segreti, nessuno può verificare se hai ragione.

7. Le "Regole del Gioco" (Metriche e Confronti)

Quando misuri i risultati, devi usare regole chiare e condivise da tutti, non inventare le tue.

  • Metafora: Non puoi dire "Ho vinto perché ho corso veloce". Devi dire "Ho vinto perché ho fatto 100 metri in 10 secondi, misurato con il cronometro ufficiale". Se usi il tuo cronometro personale, nessuno ti crede.

8. Ammettere i "Difetti" (Limiti e Rischi)

Nessuno è perfetto. Devi dire apertamente dove il tuo esperimento potrebbe fallire o dove i risultati potrebbero non valere per tutti.

  • Metafora: È come dire: "Questa ricetta funziona benissimo d'estate, ma d'inverno l'umidità potrebbe rovinare la torta". Essere onesti sui limiti rende la scienza più credibile.

In sintesi

Questa guida è come un manuale di istruzioni per non perdere la testa in un mondo di intelligenza artificiale che cambia velocemente. Dice ai ricercatori: "Siate trasparenti, documentate tutto, fate controllare il lavoro e ammettete i vostri errori". Solo così potremo fidarci delle scoperte fatte con l'aiuto di queste nuove macchine intelligenti e potremo costruire il futuro del software su basi solide, non su sabbia mobile.

La guida è disponibile online e viene aggiornata continuamente, proprio come i software stessi, per essere sempre al passo con i tempi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →