← Neueste Arbeiten
🤖 AI

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

GraFT ist ein trainingsfreies Framework, das das räumliche Denken in multimodalen großen Sprachmodellen verbessert, indem es einen 3D-Szenengraphen nutzt, um deterministische Geometrie, allozentrische Layouts und visuelle Attribut-Verankerung bereitzustellen, wodurch signifikante Leistungssteigerungen bei Benchmarks wie ScanQA und VSI-Bench ohne die Notwendigkeit eines kostspieligen Fine-Tunings oder dedizierter Encoder erzielt werden.

Ursprüngliche Autoren: Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

Veröffentlicht 2026-09-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Um die physische Welt zu navigieren, verlassen sich Menschen auf einen intuitiven Sinn für den Raum. Wir wissen, wie weit ein Stuhl entfernt ist, ob eine Tür links oder rechts von uns liegt und wie der Grundriss eines Raumes mit dem dahinter liegenden Flur zusammenhängt. Diese Fähigkeit, die dreidimensionale Struktur unserer Umgebung zu interpretieren, ist grundlegend dafür, wie wir mit allem interagieren, von Möbeln bis hin zu Fahrzeugen. In den letzten Jahren haben Wissenschaftler Computern beigebracht, zu sehen und zu sprechen, indem sie massive Modelle der künstlichen Intelligenz einsetzen, die sowohl Bilder als auch Texte verarbeiten. Diese Systeme, bekannt als multimodale große Sprachmodelle, können ein Bild beschreiben oder eine Frage zu einem Objekt mit beeindruckender Eloquenz beantworten. Wenn sie jedoch gebeten werden, Aufgaben auszuführen, die präzise räumliche Logik erfordern – wie etwa das Messen des Abstands zwischen zwei Gegenständen, das Verständnis des vollständigen Grundrisses eines Raumes aus einer einzigen Perspektive oder die Bestimmung der exakten Größe eines Objekts –, scheitern diese Modelle oft. Sie neigen dazu, basierend auf Mustern in ihren Trainingsdaten zu raten, anstatt die tatsächliche Geometrie der Szene zu berechnen, was zu Fehlern führt, die einem menschlichen Beobachter offensichtlich wären.

Ein Team von Forschern bei Huawei Technologies hat einen neuen Ansatz entwickelt, um diese Lücke zu schließen, ohne die Modelle der künstlichen Intelligenz selbst neu trainieren zu müssen. Sie führten ein System namens GraFT ein, das als Brücke zwischen den rohen visuellen Daten, die ein Computer sieht, und der logischen Argumentation fungiert, die er zur Ausführung benötigt. Anstatt die KI dazu zu zwingen, räumliche Regeln von Grund auf neu zu lernen, erstellt GraFT eine kompakte, strukturierte Karte der Umgebung, bekannt als 3D-Szenengraph. Diese Karte ist kein komplexes Bild oder eine Punktwolke aus Millionen von Punkten, sondern vielmehr eine saubere, organisierte Liste von Objekten, ihrer Größen, ihrer Positionen und der Art und Weise, wie sie zueinander in Beziehung stehen. Sobin diese Karte erstellt wurde, nutzt das System sie, um der KI die spezifische Art von Evidenz zur Verfügung zu stellen, die sie für eine gegebene Frage benötigt, wodurch ein unverändertes, untrainiertes Modell komplexe räumliche Rätsel mit hoher Genauigkeit lösen kann.

Die Kerninnovation von GraFT liegt darin, wie es die Informationen, die es der KI zuführt, auf die jeweilige Aufgabe abstimmt. Die Forscher stellten fest, dass unterschiedliche Fragen unterschiedliche Arten von visuellen Belegen erfordern. Für Fragen nach exakten Maßen, wie etwa dem Abstand zwischen einem Tisch und einem Sofa, umgeht das System die visuelle Interpretation der KI vollständig. Stattdessen verwendet es einen Satz symbolischer Werkzeuge, um die Antwort direkt aus den präzisen Koordinaten zu berechnen, die im 3D-Szenengraph gespeichert sind. Dies stellt sicher, dass die Antwort mathematisch exakt ist und aus der bekannten Geometrie der Szene abgeleitet wird, anstatt auf einer Vermutung zu beruhen. Für Fragen über den allgemeinen Grundriss eines Raumes, wie etwa die Bestimmung der Blickrichtung einer Person relativ zu einem Gebäude, generiert das System eine maßgeschneiderte Draufsicht der Szene. Im Gegensatz zu einer Standardfotografie ist diese Ansicht von allen Unordnung befreit und zeigt nur die relevanten Objekte als einfache Boxen mit ihren wahren Proportionen, wodurch die räumlichen Beziehungen unmittelbar klar werden. Schließlich, für Fragen darüber, wie ein Objekt aussieht, zeigt das System der KI nicht jeden Frame eines Videos. Es nutzt die Geometrie der Szene, um die verfügbaren Kamerawinkel zu bewerten, wobei es nur die wenigen Frames auswählt, in denen das Objekt am deutlichsten sichtbar und zentriert ist, und den Rest verwirft.

Die Forscher testeten dieses Framework an zwei bedeutenden Benchmarks, die zur Evaluierung des räumlichen Denkens in der künstlichen Intelligenz verwendet werden. In einem Testset, das Fragen zu Entfernungen, Größen und Anzahl beinhaltet, verbesserte das System die Leistung eines Standard-KI-Modells um eine signifikante Marge, wobei einige Metriken Zuwächse von fast 60 Prozent zeigten. In einem anderen Testset, das sich auf das Verständnis von Raumgrundrissen und das Navigieren durch diese konzentrierte, ermöglichte das System einem einfachen, untrainierten Modell, nicht nur andere allgemeine KI-Modelle, sondern auch mehrere spezialisierte Modelle, die intensiv auf räumliche Daten trainiert wurden, zu übertreffen. Bemerkenswerterweise erreichte das System diese Ergebnisse, ohne einen einzigen Parameter des zugrunde liegenden KI-Modells zu ändern; es änderte lediglich die Art und Weise, wie Informationen an dieses präsentiert wurden. Die Forscher fanden heraus, dass sie durch die Abstimmung der richtigen Art von Evidenz auf die richtige Frage die räumlichen Denkfähigkeiten freisetzen konnten, die zuvor in Modellen, die als unfähig zu solchen Aufgaben galten, verschlossen waren.

Der Erfolg von GraFT deutet darauf hin, dass die Einschränkung aktueller KI-Modelle nicht ein Mangel an Intelligenz ist, sondern eine Diskrepanz zwischen den Daten, die sie erhalten, und der Art der gestellten Frage. Indem es eine saubere, strukturierte Repräsentation der physischen Welt bereitstellt, ermöglicht das System der KI, sich auf das logische Denken zu konzentrieren, anstatt mit der Interpretation roher, verrauschter visueller Daten zu kämpfen. Die Forscher merkten an, dass die Genauigkeit des Systems letztlich durch die Qualität der initialen 3D-Karte begrenzt ist, aber da diese Karte leicht zu pflegen und zu aktualisieren ist, kann das Framework ohne die Notwendigkeit eines teuren Retrainings auf neue Aufgaben erweitert werden. Dieser Ansatz bietet einen praktischen Weg nach vorn, um das räumliche Verständnis in KI-Systeme zu integrieren, und beweist, dass mit den richtigen Werkzeugen und der richtigen Perspektive selbst ein unverändertes Modell lernen kann, die Welt in drei Dimensionen zu sehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →