← Ultimi articoli
🤖 machine learning

Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

Questo articolo identifica e corregge due confondenti critici nei confronti del valore tra modelli: il determinismo della risposta, che confonde le differenze di valore genuine con la nitidezza degli impegni a scelta forzata, e l'imbracatura di accesso, in cui gli strati client specifici per l'implementazione alterano significativamente il profilo di valore apparente di un modello, distorcendo di conseguenza le classifiche basate su misurazioni a singola estrazione.

Autori originali: Hong-In Won, Jinseok Jang, Hyoseop Kim

Pubblicato 2026-07-14
📖 6 min di lettura🧠 Approfondimento

Autori originali: Hong-In Won, Jinseok Jang, Hyoseop Kim

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler assaggiare due diverse marche di gelato per vedere quale sia più "dolce". Prendi una pallina del Marchio A e una pallina del Marchio B. Il Marchio A è alla vaniglia, e anche il Marchio B è alla vaniglia, ma il Marchio B è servito in un bicchierino minuscolo e super concentrato, mentre il Marchio A è in una ciotola gigante e soffice. Se assaggiassi solo un cucchiaino, il Marchio B potrebbe sembrare molto più dolce solo perché è intenso e concentrato, non perché il gelato stesso sia fondamentalmente diverso.

Questo è esattamente ciò che questo articolo scopre riguardo ai modelli di Intelligenza Artificiale (IA). Per molto tempo, i ricercatori hanno confrontato diversi modelli di IA ponendo loro una singola domanda: "Se dovessi scegliere tra l'Opzione A e l'Opzione B, quale sceglieresti?". Presupponevano che se il Modello X sceglieva A e il Modello Y sceglieva B, i due modelli avessero "personalità" o "valori" totalmente diversi.

Gli autori, Hong-In Won e Hyoseop Kim, dicono: "Aspettate un attimo. State misurando due cose diverse contemporaneamente e le state confondendo".

I Due Equivoci

1. La Confusione sulla "Decisione" (Determinismo)
Il primo equivoco riguarda quanto nettamente un modello si impegna in una risposta.
Immagina due persone che rispondono a un quiz.

  • Persona A è sicura al 100%. Urla "A!" ogni singola volta che glielo chiedi.
  • Persona B è un po' indecisa. Dice "A" il 60% delle volte e "B" il 40% delle volte.

Se interroghi loro solo una volta, e la Persona A dice "A" e la Persona B dice "B", potresti pensare che siano totali opposti. Ma non lo sono! Entrambi pendono verso "A". La Persona A è solo un fan di "A" rumoroso e deciso, mentre la Persona B è un fan di "A" silenzioso ed esitante.

L'articolo mostra che quando i ricercatori confrontano i modelli di IA usando una singola risposta (un "singolo prelievo"), accidentalmente contano questa "rumorosità" o "decisività" come una differenza di valori.

  • La Scoperta: Gli autori hanno testato nove diversi modelli di IA. Hanno scoperto che alcuni modelli sono incredibilmente decisi (come un modello chiamato GPT-5.5, che era 0,95 su una scala di quanto sia sicuro), mentre altri sono molto più sfumati (come il modello "Opus" di Anthropic, che era solo 0,34 quando misurato attraverso una specifica app).
  • Il Colpo di Scena: Questa "decisività" non è un tratto della personalità fisso che puoi indovinare solo guardando il nome del modello. In una famiglia di modelli, un modello più piccolo e meno costoso era in realtà più deciso del grande modello flagship più costoso. In un'altra famiglia, il modello più grande era più deciso. Gli autori suggeriscono che non si può assumere la "rumorosità" di un modello solo conoscendo chi lo ha creato o quanto sia grande; bisogna misurarlo ogni volta che lo si usa.

2. La Confusione del "Corriere" (L'Access Harness)
Il secondo equivoco è ancora più subdolo. Non riguarda il gelato; riguarda il camion che lo consegna. Gli autori si sono resi conto che il modo in cui poni una domanda all'IA cambia la risposta. Chiamano questo il "access harness" (l'imbracatura di accesso).

  • Immagina di ordinare una pizza. Se chiami direttamente la pizzeria (l'API "Raw"), ricevi la pizza esattamente come l'ha fatta lo chef.
  • Ma se ordini attraverso una specifica app di consegna (come una "CLI" o uno strumento in abbonamento), quell'app potrebbe aggiungere una nota alla cucina: "Falla extra piccante!" oppure "Non lasciare che il cliente dica di no".

Gli autori hanno scoperto che, per alcuni modelli di IA, il "corriere" (il software usato per parlare con l'IA) cambia completamente la personalità del modello.

  • La Prova: Hanno preso lo stesso modello di IA e hanno posto la stessa domanda due volte: una volta attraverso la connessione diretta e una volta attraverso una popolare app in abbonamento.
  • Il Risultato: Attraverso l'app in abbonamento, il modello "Opus" appariva molto debole e incerto (0,34). Ma quando lo hanno interrogato direttamente attraverso la connessione raw, era in realtà piuttosto deciso (0,66). L'app aveva "appiattito" la sua personalità.
  • Il Trucco del "Rifiuto": In un caso, la connessione diretta mostrava il modello che rifiutava di rispondere il 10% delle volte perché sentiva che la domanda fosse ingiusta. Ma l'app in abbonamento costringeva il modello a rispondere ogni volta, facendolo apparire compiacente. Gli autori hanno dimostrato che questo era causato da un "system prompt" nascosto (un insieme di istruzioni che l'app invia insieme alla domanda) che diceva al modello: "Scegli solo una lettera, non discutere".

Cosa Significa per la "Personalità" dell'IA

Quindi, cosa ha effettivamente dimostrato l'articolo?

  • Ha dimostrato che la "distanza" che vediamo tra i modelli di IA è spesso falsa. È un mix di quanto siano rumorosi e di quale software abbiamo usato per parlarci.
  • Ha dimostrato che il software che usiamo per parlare con l'IA (l' "harness") non è un tubo neutro; esso modella attivamente i valori dell'IA.
  • Suggerisce (ma non lo stabilisce del tutto) che la "decisività" varia enormemente tra i modelli e non segue una regola semplice come "i modelli più grandi sono più rumorosi".

Cosa NON è la risposta?
L'articolo esclude esplicitamente l'idea che si possa semplicemente guardare il nome di un modello e conoscerne i valori. Esclude anche l'idea che tutte le differenze tra i modelli siano solo "rumore".

  • La Buona Notizia: Anche dopo aver corretto questi due equivoci, gli autori hanno scoperto che alcuni modelli davvero sono in disaccordo. Ad esempio, un modello chiamato "Grok-3" punta davvero in una direzione diversa rispetto ai modelli di OpenAI o Google su circa il 73% - 88% delle domande. Queste sono differenze reali, non solo errori di misurazione.
  • La Cattiva Notizia: La maggior parte delle differenze che credevamo di vedere all'interno di una singola famiglia di aziende (come tra diversi modelli Anthropic) erano principalmente differenze nel modo in cui erano rumorosi, o in come l'app che stavano usando li stava plasmando.

La Conclusione

Se vuoi sapere se due modelli di IA hanno valori diversi, non puoi limitarti a porre una singola domanda e vedere cosa dicono. Devi:

  1. Porre loro la stessa domanda molte volte per vedere se sono solo "rumorosi" o se sono realmente "diversi".
  2. Assicurarti di parlare con loro attraverso la stessa identica "porta" (lo stesso software di connessione), perché la porta stessa potrebbe cambiare la loro opinione.

Gli autori non hanno risolto il mistero delle personalità dell'IA per sempre, ma hanno costruito una lente d'ingrandimento migliore per osservarle. Ci hanno mostrato che quello che pensavamo fosse un profondo disaccordo filosofico potrebbe essere solo un'IA che urla e un'altra che sussurra, o un'IA che parla con un manager autoritario e un'altra che parla con un amico tranquillo. Le differenze reali esistono, ma devi pulire il rumore per vederle.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →