Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets
Diese Studie zeigt, dass groß angelegte Bild-Text-Datensätze für KI-Modelle geografisch stark einseitig sind, wobei eine starke Korrelation zwischen dem Bruttoinlandsprodukt eines Landes und seiner Repräsentation in den Daten besteht, während der globale Süden massiv unterrepräsentiert ist.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Woher kommen eigentlich die Bilder? – Die „Weltkarte im Kopf“ der KI
Stell dir vor, du möchtest einen riesigen, digitalen Bilderatlas der ganzen Welt erstellen. Du schickst Millionen von kleinen Robotern ins Internet, die alles fotografieren, was sie finden können: Häuser, Autos, Strände, Berge. Am Ende hast du einen gigantischen Haufen Bilder, mit denen du einer Künstlichen Intelligenz (KI) beibringst, wie die Welt aussieht.
Das Problem: Der Roboter hat eine sehr einseitige Brille auf.
Die Forscher in diesem Paper haben genau das untersucht. Sie wollten wissen: Wenn wir eine KI fragen: „Zeig mir ein Haus“, zeigt sie uns dann ein Haus, wie es in Nigeria aussieht, oder nur eines, wie es in den USA aussieht?
Die Metapher: Das „globale Buffet“
Stell dir vor, du organisierst ein riesiges internationales Buffet für die ganze Welt. Du erwartest eine bunte Mischung aus Sushi aus Japan, Tacos aus Mexiko, Pasta aus Italien und Curry aus Indien.
Aber als du die Decke vom Buffet ziehst, stellst du fest: 90 % des Essens sind Burger, Pommes und Pizza aus den USA und Europa. Von den Spezialitäten aus Afrika oder Südamerika gibt es kaum etwas – vielleicht nur ein paar Krümel am Rand.
Genau das haben die Forscher bei den Datensätzen gefunden, mit denen moderne KIs (wie die hinter Stable Diffusion) trainiert werden:
- Die „Reiche-Länder-Dominanz“: Es gibt eine extrem starke Verbindung zwischen dem Geldbeutel eines Landes (BIP) und seiner Sichtbarkeit in der KI. Je reicher ein Land ist, desto mehr Bilder von ihm „sieht“ die KI.
- Die „Sprach-Falle“: Da die meisten Beschreibungen der Bilder auf Englisch sind, sieht die KI vor allem das, was im englischsprachigen Raum (USA, UK, Kanada) wichtig ist.
- Die „Stereotyp-Falle“: Wenn die KI dann versucht, selbst Bilder zu malen, wird sie oft oberflächlich. Wenn du sie nach einem „Auto in Indien“ fragst, malt sie vielleicht ein altes, kaputtes Auto, während sie für ein „Auto in den USA“ ein glänzendes, neues Modell zeigt. Sie lernt also nicht die echte Vielfalt, sondern nur die Klischees.
Was haben die Forscher gemacht? (Die Detektivarbeit)
Die Forscher haben nicht einfach nur die Bilder angeschaut (denn ein Bild von einem Haus sagt nicht automatisch, wo es steht). Stattdessen haben sie die Bildunterschriften wie Detektive untersucht. Sie haben eine sehr schlaue KI (ein LLM) benutzt, um in den Texten nach versteckten Ortsnamen zu suchen.
Dann haben sie diese Texte gefiltert, um sicherzustellen, dass das Objekt (z. B. ein „Haus“) auch wirklich auf dem Bild zu sehen ist. So konnten sie eine präzise „Landkarte der Daten“ erstellen.
Warum ist das wichtig?
Wenn wir KIs bauen, die für alle Menschen nützlich sein sollen – egal ob in Brasilien, Kenia oder Japan –, dürfen wir sie nicht nur mit den „Resten“ der westlichen Welt füttern.
Wenn die KI nur die Welt durch die Brille der USA sieht, wird sie blind für den Rest des Planeten. Das führt dazu, dass die Technologie kulturelle Unterschiede nicht versteht, sondern sie entweder ignoriert oder durch Klischees ersetzt.
Das Fazit des Papers: Wir müssen das „digitale Buffet“ bunter machen, damit die KI die echte, vielfältige Welt lernt und nicht nur eine sehr teure, westliche Kopie davon.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.