Extremely coarse learning objectives induce human-aligned representations in AI vision models
Diese Studie zeigt, dass das Training von KI-Visionsmodellen mit extrem groben Lernzielen, wie etwa der Unterscheidung von nur acht breiten Kategorien, interne Repräsentationen hervorbringt, die enger mit menschlichen neuronalen Antworten und perzeptiven Urteilen übereinstimmen als Modelle, die auf feingliedrigen oder selbstüberwachten Aufgaben trainiert wurden.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Seit Jahrzehnten versuchen Wissenschaftler zu verstehen, wie das menschliche Gehirn eine Flut von Licht in ein klares Bild der Welt verwandelt. Sie vermuteten schon lange, dass die Antwort in der Art und Weise liegt, wie unser visuelles System Informationen organisiert und das Chaos der Natur in ordentliche Kategorien wie „Tier“, „Werkzeug“ oder „Fahrzeug“ sortiert. Um diese Ideen zu testen, haben Forscher Systeme der künstlichen Intelligenz gebaut, die die Struktur des Gehirns nachahmen und darauf trainiert wurden, Tausende spezifischer Objekte zu erkennen. Diese digitalen Gehirne sind zu leistungsstarken Werkzeugen geworden, doch eine Frage blieb bestehen: Muss das Gehirn tatsächlich lernen, eine so riesige Anzahl spezifischer Etiketten zu kennen, um ein menschenähnliches Verständnis des Sehens aufzubauen? Vielleicht liegt das Geheimnis, wie man wie ein Mensch sieht, nicht im Auswendiglernen einer massiven Enzyklopädie von Objekten, sondern im Erlernen einer viel einfacheren, breiteren Art, die Welt zu sortieren.
Ein Forschungsteam der Johns Hopkins University setzte sich zum Ziel, diese Möglichkeit zu testen, indem es die Komplexität des standardmäßigen KI-Trainings reduzierte. Anstatt ihre künstlichen Netzwerke darauf zu trainieren, zwischen eintausend verschiedenen Bildkategorien zu unterscheiden, wie es üblich ist, brachten sie ihnen bei, dieselben Bilder in nur eine Handvoll sehr breiter Gruppen zu sortieren. Sie verwendeten keine vom Menschen geschaffenen Bezeichnungen für diese Gruppen; stattdessen ließen sie den Computer seine eigenen natürlichen Unterteilungen innerhalb der Daten finden, wodurch Kategorien entstehen konnten, die etwa „Lebewesen“ von „Maschinen“ oder „Innenräume“ von „Außenbereichen“ trennen könnten. Sie trainierten daraufhin hunderte dieser Netzwerke, wobei sie die Anzahl der Gruppen von so wenig wie zwei bis hin zu vierundsechzig variierten, und verglichen, wie gut die daraus resultierenden digitalen Gehirne der tatsächlichen Aktivität des menschlichen Gehirns und dem Verhalten menschlicher Beobachter entsprachen.
Die Ergebnisse waren überraschend. Die Forscher fanden heraus, dass Netzwerke, die auf diesen extrem einfachen, groben Kategorien trainiert wurden, interne Karten der visuellen Welt entwickelten, die ebenso gut – und oft sogar besser – darin waren, die menschliche Gehirnaktivität widerzuspiegeln, wie Netzwerke, die auf die vollen eintausend Kategorien trainiert wurden. Als sie maßen, wie gut diese künstlichen Gehirne mit Scans des menschlichen visuellen Kortex und Aufzeichnungen aus den Gehirnen von Makaken übereinstimmten, zeigten die Modelle, die auf nur acht breiten Gruppen trainiert worden waren, eine Leistung auf Augenhöhe mit den komplexesten Modellen. Noch erstaunlicher war, dass diese einfachen Netzwerke die menschlichen Urteile darüber, welche Objekte einander ähnlich sehen, besser widerspiegelten als jedes andere getestete Modell, einschließlich der fortschrittlichsten heute verfügbaren Systeme der künstlichen Intelligenz.
Diese Entdeckung stellt die vorherrschende Vorstellung infrage, dass man lernen muss, eine massive, detaillierte Liste spezifischer Objektnamen zu kennen, um eine Maschine zu bauen, die wie ein Mensch sieht. Die Studie legt nahe, dass das menschliche visuelle System möglicherweise keine feingliedrige, tausendfache Klassifizierungsaufgabe benötigt, um sein anspruchsvolles Verständnis der Welt zu entwickeln. Stattdessen scheint die Fähigkeit, Bilder in breite, bedeutungsvolle Cluster zu gruppieren, ausreichend zu sein, um eine Repräsentation des Sehens zu erzeugen, die unserer eigenen ähnelt. Die Forscher zeigten, dass dieser Effekt über verschiedene Arten von neuronalen Netzwerkarchitekturen hinweg Bestand hat, von älteren, einfacheren Designs bis hin zu modernen, komplexen Systemen, und dass er selbst dann funktioniert, wenn die Trainingsdaten begrenzt sind.
Das Team untersuchte auch, ob die spezifische Art und Weise, wie sie diese breiten Kategorien erstellten, eine Rolle spielte. Sie fanden heraus, dass die Ergebnisse stabil blieben, egal ob die Kategorien aus den statistischen Mustern der Bilder selbst abgeleitet oder durch klare, für Menschen verständliche Konzepte wie „natürlich versus künstlich“ oder „klein versus groß“ definiert wurden. Dies deutet darauf hin, dass der entscheidende Faktor die Grobkörnigkeit des Lernziels selbst ist und nicht die spezifischen Etiketten. Die Studie zeigte ferner, dass diese grob trainierten Netzwerke nicht einfach eine vereinfachte Version dessen lernten, was ein komplexes Netzwerk lernt, sondern eine grundlegend andere Art der Organisation visueller Informationen entwickelten, die zufällig enger mit der menschlichen Wahrnehmung übereinstimmte.
Indem sie zeigten, dass ein überraschend einfaches Lernziel ein menschenähnliches Sehen hervorbringen kann, definiert diese Arbeit unser Verständnis dessen neu, was notwendig ist, damit eine Maschine sieht. Es legt nahe, dass der Weg zu einer künstlichen Intelligenz, die die menschliche Wahrnehmung wahrhaft widerspiegelt, nicht darin liegen könnte, ihr mehr Daten oder komplexere Aufgaben zuzuführen, sondern darin, sie zu lehren, die Welt in breiteren, grundlegenderen Begriffen zu sehen. Die Ergebnisse eröffnen einen neuen Weg für den Bau von KI-Systemen, die nicht nur leistungsfähig, sondern auch wahrhaftig mit der Art und Weise abgestimmt sind, wie menschliche Wesen ihre visuelle Erfahrung wahrnehmen und organisieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.