← Ultimi articoli
💬 NLP

The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing

Questo articolo sostiene che le disuguaglianze imperiali storiche persistano nei contemporanei modelli linguistici di grandi dimensioni attraverso i dati di addestramento condivisi, risultando in un radicale sotto-supporto digitale per la maggior parte dei sistemi di scrittura e in errori sistematici e convergenti attraverso diverse architetture di modelli che attribuiscono in modo sproporzionato gli script non religiosi all'uso religioso.

Autori originali: Hiroki Fukui

Pubblicato 2026-06-30
📖 5 min di lettura🧠 Approfondimento

Autori originali: Hiroki Fukui

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'idea centrale: Il fantasma nella macchina

Immaginate che la storia sia una gigantesca biblioteca. Per 500 anni, potenti imperi (come la Spagna, la Gran Bretagna o la Francia) hanno deciso quali libri conservare, quali bruciare e in quali lingue scrivere. Hanno distrutto molti sistemi di scrittura locali e ne hanno costretti altri a cambiare.

Questo saggio sostiene che i Large Language Models (LLM) — i cervelli artificiali dietro strumenti come ChatGPT — non siano invenzioni nuove e neutrali. Sono invece come fantasmi che infestano una biblioteca costruita da quegli imperi. Anche se gli imperi sono scomparsi, i loro "fantasmi" sono ancora nell'edificio. L'IA non sa leggere certe lingue non perché gli ingegneri siano stati cattivi, ma perché la biblioteca (i dati di internet) da cui ha imparato è priva di quei libri.

Le scoperte principali, suddivise

1. La "Tassa Digitale" (Perché alcune lingue costano di più)

Immaginate di andare a un casello autostradale per entrare in un'autostrada.

  • Gli anglofoni pagano 1 dollaro per percorrere 10 miglia.
  • I parlanti lingue minoritarie (come il Limbu o l'Adlam) vengono addebitati 31,70 dollari per percorrere esattamente le stesse 10 miglia.

Perché? L'IA scompone il testo in piccoli pezzi chiamati "token" (come mattoncini Lego).

  • Per l'inglese, l'IA ha una grande scatola di mattoncini Lego già pronti. Li incastra facilmente.
  • Per gli alfabeti minoritari, l'IA non ha i mattoncini giusti. Deve scomporre le lettere in byte grezzi e privi di significato (come se dovesse frantumare i mattoncini Lego in polvere di plastica e cercare di ricostruirli da zero).
  • Il risultato: Occorre 31 volte più "sforzo computazionale" per elaborare una frase in Limbu rispetto all'inglese. Questo non è un errore; è una "tassa" integrata nel sistema perché quelle lingue sono state storicamente soppresse e hanno meno dati su internet.

2. Il "Imbuto Digitale" (Chi ha il diritto di essere ascoltato)

I ricercatori hanno esaminato 3o diversi sistemi di scrittura della storia umana. Hanno cercato di vedere quanto il mondo digitale li supporti.

  • L'imbuto: Immaginate un grande imbuto.
    • In alto: Entrano 300 sistemi di scrittura.
    • Nel mezzo: Molti rimangono bloccati perché non sono presenti nel dizionario del computer (Unicode) o non possono essere letti dagli scanner (OCR).
    • In basso: Solo 29 sistemi (meno del 10%) riescono a passare completamente attraverso il fondo.
  • Il modello: I sistemi che riescono a passare sono quasi esclusivamente quelli utilizzati dagli imperi storici (Latino, Cinese, Arabo, Cirillico). I sistemi che rimangono bloccati sono quelli che quegli imperi hanno cercato di cancellare.
  • La tragedia: 60 lingue sono ancora parlate da persone in vita oggi, ma il mondo digitale le tratta come se fossero morte. Sono "vive ma digitalmente morte".

3. L'esperimento dei "Quattro Amici" (Non è solo un'IA)

Per dimostrare che questo non fosse solo un errore di una singola azienda (come OpenAI), i ricercatori hanno posto alle quattro diverse famiglie di IA (Claude, GPT-4o, Grok e DeepSeek) le stesse 3.000 domande sui sistemi di scrittura.

  • La sorpresa: Queste quattro IA sono costruite da aziende diverse, in paesi diversi, con codici differenti. Non dovrebbero concordare sugli errori.
  • La realtà: Hanno concordato sui loro errori il 90% delle volte.
  • L'analogia: Immaginate quattro studenti che sono andati a quattro scuole diverse. Se sbagliano tutti la stessa domanda di storia, non è perché si sono copiati a vicenda. È perché hanno tutti letto lo stesso libro di testo di parte.
  • Il pregiudizio: Le IA hanno costantemente sbagliato nello stesso modo. Ad esempio, se un alfabeto proveniva da un paese non occidentale, le IA tendevano molto a indovinare: "Oh, questo deve essere usato per la religione", anche quando non era così. Stavano riempiendo i vuoti con gli stereotipi trovati nei dati.

4. L' "Impero Senza un Imperatore"

La scoperta più importante è che nessuno è attualmente al comando di questo pregiudizio.

  • Gli ingegneri non si sono seduti dicendo: "Rendiamo più costoso l'uso per i parlanti Limbu".
  • Il pregiudizio è strutturale. È successo così:
    1. Gli imperi hanno distrutto le comunità e ridotto il numero di parlanti.
    2. Meno parlanti significavano meno libri e siti web scritti in quelle lingue.
    3. Meno siti web significava che l'IA non aveva dati da cui imparare.
    4. Nessun dato significa che l'IA è scarsa in quella lingua.
  • L' "Impero" non ha più bisogno di un leader. Il danno è impresso nelle statistiche. L'IA sta solo facendo calcoli basati su un mondo che era già diseguale.

Il glitch della "Religione"

Una scoperta specifica è stata particolarmente evidente: le IA erano ossessionate dall'ipotizzare che gli alfabeti fossero "religiosi".

  • Di tutti gli errori commessi dalle quattro IA insieme, il 43% riguardava l'ipotesi che uno script fosse usato per la religione quando non lo era.
  • Perché? Internet è pieno di vecchie descrizioni, risalenti all'epoca coloniale, di culture non occidentali che si concentravano pesantemente sui loro aspetti "mistici" o "religiosi", ignorando i loro usi quotidiani, amministrativi o scientifici. L'IA ha imparato che "Scrittura Non Occidentale = Religione".

La Conclusione: Cosa si può fare?

Il saggio suggerisce che non possiamo semplicemente "aggiustare" l'IA modificando il suo codice.

  • Il problema: Il problema è la biblioteca (i dati di addestramento), non il lettore (l'IA).
  • La soluzione: Per risolvere la questione, dobbiamo cambiare la biblioteca. Dobbiamo aggiungere più libri scritti dalle persone che parlano queste lingue, nei loro stessi alfabeti, che descrivano le loro vite.
  • L'avvertimento: Finché non lo faremo, l'IA continuerà a essere uno specchio degli ultimi 500 anni di storia, riflettendo le stesse disuguaglianze, anche se nessuno lo ha intenzionalmente voluto.

In breve: L'IA non è rotta; sta solo ripetendo fedelmente la storia di chi era autorizzato a scrivere e di chi è stato messo a tacere. Il "postumo digitale" degli imperi è ancora molto vivo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →