← Neueste Arbeiten
💬 NLP

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

Dieses Paper führt den Point-of-View Benchmark (POVBench) ein, um die Fähigkeit von Vision-Language-Modellen zur „kontextuellen Beobachter-Verankerung“ – dem Schlussfolgern der situierten Perspektive eines Sprechers aus kontextuellen Hinweisen – zu evaluieren, und zeigt auf, dass aktuelle Modelle bei dieser Aufgabe zwar Schwierigkeiten haben, eine explizite Zerlegung des beobachterrelativen räumlichen Denkens die Ziellokalisierung jedoch signifikant verbessern kann.

Ursprüngliche Autoren: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

Veröffentlicht 2026-09-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie müssten einen verlorenen Gegenstand in einem Raum finden, den Sie noch nie betreten haben, basierend nur auf der Beschreibung eines Freundes, wo er ihn hinterlassen hat. Sie könnten zum Beispiel hören: „Ich habe meine Schlüssel auf den Tisch links neben der Lampe gelegt, während ich Kaffee gekocht habe.“ Um dieses Rätsel zu lösen, müssen Sie nicht nur wissen, wie ein Tisch und eine Lampe aussehen; Sie müssen zuerst die Position Ihres Freundes im Raum rekonstruieren, seine Sichtlinie vorstellen und dann die Schlüssel relativ zu diesem spezifischen Blickwinkel gedanklich platzieren. Diese Fähigkeit, Raum aus der Perspektive einer anderen Person zu verstehen, unter Verwendung von Hinweisen über deren Tätigkeit und die Umgebung, ist ein grundlegender Teil der menschlichen Kommunikation. Sie ermöglicht es uns, effizient zusammenzuarbeiten, ohne jedes einzelne visuelle Detail teilen zu müssen. Damit Roboter und künstliche Intelligenz in unseren Häusern mit uns zusammenarbeiten können, müssen sie dieselbe Fähigkeit beherrschen, die als situatives räumliches Denken bekannt ist.

Eine neue Studie von Forschern der Universität Tokio und der Carnegie Mellon University untersucht, ob moderne Systeme der künstlichen Intelligenz diese Aufgabe wirklich ausführen können. Das Team, geleitet von Mimo Shirasaka, Haochen Zhang und Yonatan Bisk, entwickelte einen strengen Test namens „Point-of-View Benchmark“, um zu sehen, ob Maschinen den Standort eines Sprechers ableiten und dann ein Objekt basierend auf dieser abgeleiteten Perspektive lokalisieren können. Ihre Arbeit zeigt, dass aktuelle KI-Modelle zwar bei vielen visuellen Aufgaben beeindruckend sind, aber erheblich Schwierigkeiten haben, wenn sie gebeten werden, über einen Raum aus einer Perspektive zu denken, die sie nicht direkt sehen können, selbst wenn ihnen klare Anweisungen gegeben werden.

Die Forscher bauten ihren Test mit einer computergenerierten Welt aus prozedural erstellten Häusern auf, die mit realistischen Möbeln und Grundrissen ausgestattet sind. In dieser digitalen Umgebung erkundet ein simulierter Roboter jedes Haus und fängt dabei eine Serie von First-Person-Bildern ein, während er sich von Raum zu Raum bewegt. Der Kern des Experiments besteht in einem natürlichen Sprachsatz, der den Ort eines Objekts beschreibt, wie etwa: „Ich habe das Buch links neben dem Bett gesehen.“ Die Herausforderung für die künstliche Intelligenz besteht darin, die Fotos der Erkundung des Roboters zu betrachten, herauszufinden, wo die sprekende Person stand, als sie diesen Satz sagte, und dann darauf zu zeigen, wo sich das Buch in dieser spezifischen Ansicht befinden würde. Die Studie testete drei verschiedene Schwierigkeitsstufen, um genau zu verstehen, an welcher Stelle die KI scheitert. In der schwierigsten Version gibt der Satz nur einen Hinweis auf die Tätigkeit, wie etwa „Beim Austauschen einer Glühbirne“, was die KI zwingt, den Standort zu erraten. In einer mittleren Version nennt der Satz explizit das Objekt, mit dem die Person interagiert hat, wie zum Beispiel „Beim Austauschen der Glühbirne an der Stehlampe“. In der einfachsten Version wird der KI einfach das exakte Foto aus der Perspektive des Sprechers gezeigt.

Die Ergebnisse waren aufschlussreich. Über ein breites Spektrum fortgeschrittener KI-Modelle hinweg, einschließlich sowohl kommerzieller als auch Open-Source-Versionen, blieb die Leistung in allen drei Szenarien gering. Selbst wenn der KI explizit gesagt wurde, welches Objekt sich in der Nähe des Sprechers befand, oder wenn ihr das exakte Foto aus der Sichtweise des Sprechers gezeigt wurde, versagten die Modelle häufig dabei, den korrekten Ort zu bestimmen. Die Lücke zwischen der schwierigsten und der mittleren Version war überraschend klein, was darauf hindeutet, dass die Hauptschwierigkeit nicht nur darin besteht, herauszufinden, wo der Sprecher stand, sondern vielmehr darin, eine Beschreibung wie „links neben“ in einen spezifischen Punkt in einer visuellen Szene zu übersetzen. Die Modelle wählten oft das falsche Zimmer oder verwechselten das Referenzobjekt, indem sie beispielsweise einen Türrahmen mit einem Kühlschrank verwechselten, weil sie es nicht effektiv schafften, die visuellen Hinweise mit dem Kontext der Tätigkeit zu kombinieren.

Um zu verstehen, ob die Modelle mit Hilfe besser werden könnten, versuchten die Forscher einen anderen Ansatz. Sie baten die KI, ihren Denkprozess Schritt für Schritt aufzuschlüsseln, indem sie explizit angibt, wie sie die Position des Sprechers identifiziert, das Referenzobjekt lokalisiert und dann die Richtung des Zielobjekts bestimmt hat. Diese Methode, die die Autoren als strukturiertes räumliches Denken bezeichnen, führte zu einer spürbaren Verbesserung der Genauigkeit. Wenn die Modelle angeleitet wurden, das Problem auf diese strukturierte Weise zu durchdenken, wurden sie besser darin, die verborgenen Objekte zu lokalisieren. Dies deutet darauf an, dass die KI über die notwendigen Informationen verfügt, aber Schwierigkeiten hat, sie ohne explizite Anleitung dazu, wie man die Punkte verbindet, zu einem kohärenten mentalen Modell zusammenzufügen.

Die Studie testete diese Ideen auch in der realen Welt anhand von tatsächlichem Videomaterial von Menschen, die durch Häuser gehen. Die Ergebnisse spiegelten die Computersimulationen wider: Die KI-Modelle hatten weiterhin Schwierigkeiten mit der Aufgabe und erreichten eine Erfolgsquote von höchstens fünfzig Prozent. Die Modelle, die jedoch den schrittweisen Denkansatz nutzten, zeigten erneut bessere Ergebnisse als diejenigen, die dies nicht taten. Dies deutet darauf hin, dass die Schwierigkeit nicht nur ein Fehler der computergenerierten Umgebung ist, sondern eine echte Herausforderung für die aktuelle Technologie darstellt, wenn sie mit der unordentlichen, komplexen Realität menschlicher Räume konfrontiert wird.

Letztendlich hebt diese Forschung eine kritische Lücke in den Fähigkeiten der verkörperten künstlichen Intelligenz hervor. Während Maschinen Objekte erkennen und Fragen zu dem beantworten können, was sie sehen, haben sie noch nicht gelernt, natürlich die Perspektive eines menschlichen Sprechers abzuleiten oder eine Szene aus einem Blickwinkel zu rekonstruieren, den sie selbst nie direkt beobachtet haben. Die Ergebnisse legen nahe, dass Roboter, um wirklich mit Menschen in unserem täglichen Leben zusammenzuarbeiten, eine tiefere Fähigkeit entwickeln müssen, über den Raum aus der Sichtweise einer anderen Person zu denken und dabei Kontext und gesunden Menschenverstand zu nutzen, um die fehlenden Teile des visuellen Puzzles zu ergänzen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →