Bongards at the Boundary of Perception and Reasoning: Programs or Language?
Dieses Paper stellt einen neurosymbolischen Ansatz vor, der Large Language Models zur Generierung parametrisierter Programme mit Bayesscher Optimierung zur Parameteranpassung kombiniert, um Bongard-Probleme zu lösen und damit die Lücke zwischen visueller Wahrnehmung und abstraktem Schließen zu schließen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das Große Ganze: Die Herausforderung des „Visuellen Rätsels“
Stellen Sie sich vor, Sie bekommen einen Satz von 12 Zeichnungen vorgelegt. Sechs davon sind „gut“ (positiv) und sechs sind „schlecht“ (negativ). Ihre Aufgabe ist es, die geheime Regel zu finden, die die guten von den schlechten unterscheidet.
Dies wird als Bongard-Problem bezeichnet. Dies sind keine einfachen „Finde den Fehler“-Rätsel. Die Regeln können unglaublich knifflig sein.
- Beispiel: Vielleicht haben die „guten“ Bilder alle eine Form mit einem „Hals“, der horizontal verläuft, während die „schlechten“ einen vertikalen Hals haben. Oder vielleicht sind die „guten“ Formen „geschwungen“, während die „schlechten“ glatt sind.
Die Arbeit stellt eine große Frage: Kann Künstliche Intelligenz (KI) diese Rätsel so lösen, wie Menschen es tun? Menschen sind groß darin, sich in einer völlig neuen Situation eine neue Idee (wie „horizontaler Hals“) im Flug auszudenken und anzuwenden. Aktuelle KI ist groß darin, Dinge zu erkennen, die sie schon einmal gesehen hat (wie „das ist eine Katze“), aber sie hat oft Schwierigkeiten, wenn sie ein neues Konzept von Grund auf neu erfinden muss.
Das Problem: KI ist entweder zu starr oder zu vage
Die Forscher fanden heraus, dass KI zwei Hauptarten des Denkens hat, und beide haben Mängel bei der Lösung dieser Rätsel:
Der „Chatbot“-Ansatz (Natürliche Sprache):
- Wie es funktioniert: Die KI betrachtet die Bilder und versucht, die Regel in Worten zu beschreiben, wie ein Detektiv, der einen Bericht schreibt.
- Der Fehler: Sie ist gut bei großen Ideen, aber schlecht bei der Präzision. Sie könnte sagen: „Die guten Formen sind irgendwie spitz“, aber sie kann nicht zwischen einer „leicht spitzen“ und einer „sehr spitzen“ Form unterscheiden. Es ist wie ein Koch, der weiß, dass das Rezept sagt „eine Prise Salz hinzufügen“, aber nicht genau weiß, wie viel das ist.
Der „Programmierer“-Ansatz (Code):
- Wie es funktioniert: Die KI schreibt ein Computerprogramm, um die Bilder zu prüfen. Sie kann exakte Abstände, Winkel und Anzahlen messen.
- Der Fehler: Sie ist groß bei der Präzision, aber schlecht bei der Kreativität. Wenn die Regel lautet „die Form sieht aus wie ein trauriges Gesicht“, hat ein Computerprogramm Schwierigkeiten, „Traurigkeit“ mathematisch zu definieren. Es ist wie ein Roboter, der einen Raum auf den Millimeter genau ausmessen kann, aber das Konzept von „gemütlich“ nicht versteht.
Die Lösung: Das „Übersetzer“-Team
Die Autoren entwickelten ein neues System, das wie ein Team aus zwei Spezialisten arbeitet, die zusammenarbeiten. Sie nennen dies einen „neurosymbolischen“ Ansatz (die Kombination aus neuronalen Netzen/KI und symbolischer Logik/Programmen).
So arbeitet ihr Team Schritt für Schritt:
Schritt 1: Der Ideen-Generator (Der „Chatbot“)
Zuerst bitten sie eine leistungsstarke KI (ein Vision-Language-Modell), das Rätsel anzusehen und ein paar mögliche Regeln in einfacher englischer Sprache vorzuschlagen.
- Analogie: Stellen Sie sich eine Brainstorming-Sitzung vor, in der ein kreativer Autor vorschlägt: „Vielleicht geht die Regel um den ‚Hals‘ der Form!“
Schritt 2: Der Übersetzer (Der „Programmierer“)
Als Nächstes nimmt das System diese englischen Vermutungen und versucht, sie in Computercode umzuwandeln.
- Der Clou: Die KI schreibt nicht nur den Code, sondern lässt „Lücken“ für die schwierigen Zahlen. Wenn die Regel zum Beispiel lautet „Formen mit einem Hals länger als X“, schreibt die KI den Code, lässt aber X als eine Geheimvariable offen.
- Analogie: Der Autor sagt: „Der Hals muss länger als [LÜCKE] sein.“ Der Programmierer richtet die Maschine so ein, dass sie den Hals misst, wartet aber auf die exakte Zahl.
Schritt 3: Der Tuner (Bayesianische Optimierung)
Dies ist die Geheimzutat. Das System durchläuft einen „Versuch und Irrtum“-Prozess, um die perfekte Zahl für diese Lücken zu finden. Es testet verschiedene Zahlen (wie 5 Pixel, 10 Pixel, 15 Pixel), um zu sehen, welche die „guten“ Bilder perfekt von den „schlechten“ trennt.
- Analogie: Stellen Sie sich vor, Sie stimmen ein Radio ab. Sie wissen, dass der Sender irgendwo zwischen 90 und 100 liegt, aber Sie kennen die exakte Frequenz nicht. Sie drehen langsam am Regler, bis das Rauschen aufhört und die Musik perfekt ist. Das System macht dies mathematisch, um den exakten „Schwellenwert“ der Regel zu finden.
Schritt 4: Der Richter (Der Verifizierer)
Schließlich prüft das System: „Funktioniert dieser Code tatsächlich bei allen Trainingsbildern?“
- Wenn der Code perfekt funktioniert, akzeptiert das System die Regel.
- Wenn der Code fehlschlägt, kehrt das System zum „Chatbot“ zurück, sagt: „Diese Idee hat nicht funktioniert, versuche es erneut“, und der Zyklus wiederholt sich.
Was haben sie herausgefunden?
Die Forscher testeten diesen „Team-Ansatz“ gegen die besten verfügbaren KI-Modelle (wie GPT-4o und Claude 3.7) und sogar gegen die durchschnittliche menschliche Leistung.
- Das Team gewinnt: Durch die Kombination der Kreativität des Chatbots mit der Präzision des Programmierers löste ihr System 51 von 100 Bongard-Problemen.
- Menschen übertreffen: Der durchschnittliche Mensch löste in früheren Studien etwa 47 Probleme. Ihr KI-Team löste 51, was markiert, dass eine KI zum ersten Mal die durchschnittliche menschliche Leistung in diesem speziellen Test übertroffen hat.
- Unterschiedliche Stärken:
- Wenn das Problem mit Geometrie und Mathematik zu tun hatte (wie „sind diese Linien parallel?“), war der „Programmierer“-Teil des Teams der Held.
- Wenn das Problem mit abstrakten Konzepten zu tun hatte (wie „ist diese Form ‚offen‘ oder ‚geschlossen‘?“), war der „Chatbot“-Teil des Teams der Held.
- Wenn sie nur den Chatbot oder nur den Programmierer verwendeten, waren sie schlechter. Sie brauchten beide.
Der „Auswendiglernen“-Check
Die Forscher waren besorgt, dass die KI die Antworten vielleicht einfach nur aus dem Internet auswendig gelernt hat (da diese Rätsel alt und populär sind). Um dies zu testen, drehten sie die Regeln um: Sie sagten der KI, dass die „schlechten“ Bilder eigentlich die „guten“ seien. Die KI schnitt immer noch gut ab, was bewies, dass sie nicht nur memorierte Antworten wiedergab, sondern tatsächlich die Logik durchdrang.
Das Fazit
Diese Arbeit zeigt, dass KI, um schwierige visuelle Rätsel zu lösen, nicht nur versuchen sollte, wie ein Mensch zu „denken“ oder wie ein Computer zu „rechnen“. Sie muss beides tun. Indem sie eine kreative KI Ideen vorschlagen lässt und einen präzisen Computer diese mit exakter Mathematik verifizieren lässt, können wir Systeme bauen, die neue visuelle Konzepte fast so gut wie – und manchmal sogar besser als – Menschen lernen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.