← Neueste Arbeiten
🤖 machine learning

How smoothing the affinity matrix affects neighborhood preservation in t-SNE

Dieses Paper führt eine zeilenweise Potenztransformation der t-SNE-Affinitätsmatrix ein, die eine punktabhängige Glättung oder Schärfung ermöglicht, wobei nachgewiesen wird, dass Schärfung die Erhaltung der sehr nächsten Nachbarn verbessert, während Glättung die Erhaltung breiterer lokaler Nachbarschaften verbessert und dabei Multiskalen-Methoden im mittleren lokalen Bereich übertrifft.

Ursprüngliche Autoren: Shirin Mohebi, Guillaume Bied, Jefrey Lijffijt

Veröffentlicht 2026-08-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Shirin Mohebi, Guillaume Bied, Jefrey Lijffijt

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine riesige, komplexe Stadt zu verstehen, indem Sie auf eine einzige, flache Karte blicken. Sie können die wichtigsten Wahrzeichen sehen und wie die Stadtteile zueinander in Beziehung stehen, aber in dem Moment, in dem man versucht, eine dreidimensionale Welt auf eine zweidimensionale Oberfläche zu projizieren, geht immer etwas verloren. Dies ist die tägliche Herausforderung für Wissenschaftler, die mit hochdimensionalen Daten arbeiten, bei denen jedes Informationsstück durch Dutzende oder sogar Hunderte von Merkmalen beschrieben wird. Um dies begreifbar zu machen, nutzen sie eine Technik namens Dimensionsreduktion, die wie ein Kartograf wirkt, der komplexe Daten in einen einfachen Scatterplot zusammendrückt, den Menschen tatsächlich lesen können. Unter den vielen verfügbaren Werkzeugen hat eine Methode sich als Goldstandard für die Bewahrung der lokalen Details dieser Datencluster etabliert: eine Technik namens t-SNE. Sie ist dafür bekannt, Punkte, die in den ursprünglichen Daten nah beieinander liegen, auch im Bild nah beieinander zu halten, was sie unentbehrlich macht, um Muster in allem – von Zelltypen bis hin zu handgeschriebenen Ziffern – zu erkennen. Doch selbst dieses leistungsstarke Werkzeug hat einen Makel: Während es exzellent darin ist, die absolut nächsten Nachbarn zusammenzuhalten, kämpft es manchmal damit, die breitere Struktur der Nachbarschaften aufrechtzuerhalten, und die Qualität der Karte kann von einem Teil des Bildes zum anderen stark variieren.

Ein Team von Forschern der Universität Gent machte sich daran zu untersuchen, warum das geschieht und ob sie die Fähigkeit des Werkzeugs verbessern könnten, das Gesamtbild darzustellen. Sie konzentrierten sich auf das Herzstück des t-SNE-Prozesses, eine mathematische Struktur namens Affinitätsmatrix. Man kann sich diese Matrix als einen Satz von Anweisungen vorstellen, der dem Computer sagt, wie stark zwei Punkte in dem fertigen Bild zueinander angezogen werden sollten. In der Standardversion des Werkzeugs werden diese Anweisungen durch eine spezifische Regel erzeugt, die sicherstellt, dass jeder Punkt dieselbe „Perplexität“ besitzt – ein Konzept, das sich grob als die effektive Anzahl der Nachbarn beschreiben lässt, auf die ein Punkt Wert legt. Die Forscher stellten fest, dass diese Regel in der Praxis oft Anweisungen erzeugt, die zu extrem sind. Für viele Punkte bevorzugen die Anweisungen massiv nur wenige, engste Nachbarn und ignorieren dabei die etwas weiter entfernten, die dennoch Teil derselben lokalen Gruppe sind. Es ist, als hätte der Kartograf entschieden, dass nur die Person, die direkt neben einem steht, zählt, während die Person, die drei Schritte entfernt steht, unsichtbar ist.

Um zu testen, ob dieser extreme Fokus das Problem war, führten die Forscher eine einfache Anpassung ein, die sie eine Potenztransformation nennen. Dies ist eine kontrollierte Art und Weise, die Anweisungen in der Affinitätsmatrix entweder zu verschärfen oder zu glätten. Wenn sie die Anweisungen verschärften, würde das Werkzeug sich noch intensiver auf die allernächsten Nachbarn konzentrieren. Wenn sie die Anweisungen glätteten, würde das Werkzeug die Aufmerksamkeit gleichmäßiger verteilen und einem breiteren Kreis von Nachbarn ein bedeutsames Gewicht verleihen, ohne die Reihenfolge dessen, wer am nächsten liegt, zu verändern. Sie führten tausende Experimente an realen Datensätzen durch, einschließlich Bildern von handgeschriebenen Zahlen und genetischen Daten aus Mausgehirnzellen, um zu sehen, wie diese Anpassungen die finalen Karten veränderten.

Die Ergebnisse offenbarten einen klaren Zielkonflikt, der von der Skala der betrachteten Nachbarschaft abhängt. Wenn die Forscher die Anweisungen verschärften, wurde das Werkzeug außergewöhnlich gut darin, die absolut nächsten Nachbarn zusammenzuhalten, verlor aber die Fähigkeit, die weiteren lokalen Gruppen an ihrem Platz zu halten. Umgekehrt verbesserten sie durch das Glätten der Anweisungen die Fähigkeit des Werkzeugs, diese breiteren lokalen Nachbarschaften zu bewahren. Die geglätteten Karten zeigten eine klarere Trennung zwischen verschiedenen Datenclustern und verhinderten, dass distinkte Gruppen zu einem unordentlichen Klumpen in der Mitte des Bildes verschmelzen. Entscheidend war, dass die Forscher fanden, dass diese Verbesserung nicht einfach dadurch erreicht werden konnte, dem Standardwerkzeug zu sagen, dass es sich mehr Nachbarn ansehen soll, indem man seine Perplexitäts-Einstellung erhöht. Das Ändern der Perplexität beeinflusst jeden Punkt auf die gleiche Weise, aber die Glättungstechnik ermöglicht es dem Werkzeug, sich für jeden Punkt unterschiedlich anzupassen, was eine nuanciertere und genauere Darstellung der lokalen Struktur der Daten schafft.

Die Studie legt nahe, dass die Art und Weise, wie t-SNE seine Nachbarn gewichtet, ein kritischer, wenn auch oft übersehener Faktor dafür ist, wie gut es Daten visualisiert. Durch das Glätten der Affinitätsmatrix zeigten die Forscher, dass es möglich ist, die Bewahrung mittlerer lokaler Strukturen zu verbessern, ohne die Geschwindigkeit oder Skalierbarkeit des Werkzeugs zu opfern. Dies bedeutet nicht, dass die Standardmethode fehlerhaft ist, sondern vielmehr, dass sie eine spezifische Voreingenommenheit gegenüber den allernächsten Nachbarn besitzt, die feinjustiert werden kann. Für Wissenschaftler, die die feinen Details von Cluster-Substrukturen untersuchen müssen, oder für diejenigen, die sehen wollen, wie verschiedene Gruppen auf einer größeren Skala zueinander in Beziehung stehen, bietet diese Glättungstechnik eine leichtgewichtige Möglichkeit, den Fokus der Visualisierung zu verschieben. Die Arbeit bestätigt, dass die Qualität dieser Datenkarten nicht nur von der Optimierung des Algorithmus abhängt, sondern davon, wie die anfänglichen Beziehungen zwischen den Datenpunkten definiert werden, was den Forschern einen neuen Hebel an die Hand gibt, wenn sie benötigen, dass ihre Karten eine vollständigere Geschichte erzählen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →