← Neueste Arbeiten
💻 computer science

Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging

Dieses Paper stellt Retrieval-Augmented Visual Prompting (RAVP) vor, ein Framework, das die Zero-Shot-Neuronen-Detektion und Instanzsegmentierung in der Zwei-Photonen-Kalzium-Bildgebung verbessert, indem es abgerufene annotierte Exemplare als visuelle Prompts in Foundation-Modelle wie SAM 3 injiziert und somit eine effektive Alternative zum traditionellen Fine-Tuning zur Inferenzzeit bietet.

Ursprüngliche Autoren: Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

Veröffentlicht 2026-08-25
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der stillen, dunklen Welt im Inneren eines lebenden Gehirns nutzen Wissenschaftler ein leistungsstarkes Mikroskop, um das Feuern von Neuronen zu beobachten. Diese Technik, bekannt als Zwei-Photonen-Calcium-Imaging, erfasst die elektrische Aktivität einzelner Gehirnzellen als helle, leuchtende Punkte vor einem dunklen Hintergrund. Sie ist ein Eckpfeiler der modernen Neurowissenschaft und ermöglicht es Forschern zu sehen, wie Populationen von Zellen zusammenarbeiten, um Gedanken und Bewegungen zu erzeugen. Es ist jedoch unglaublich schwierig, diese leuchtenden Videos in nützliche Daten umzuwandeln. Die Bilder sind unordentlich; einige Zellen leuchten hell, während andere schwach erscheinen, und das Aussehen der Zellen verändert sich drastisch, je nach Tier, der Tiefe des gefilmten Gehirns oder der verwendeten Ausrüstung. Um diese Zellen zu untersuchen, müssen Wissenschaftler zuerst eine präzise Umrandung um jede einzelne ziehen – eine Aufgabe, die langsam, teuer und anfällig für menschliche Fehler ist. Jahrelang war die Hoffnung, dass künstliche Intelligenz dies automatisch lernen könnte, aber die schiere Vielfalt der Erscheinungsformen dieser Zellen hat es Computerprogrammen erschwert, von einem Experiment auf das nächste zu generalisieren.

Kürzlich ist eine neue Generation von Modellen der künstlichen Intelligenz aufgetaucht, die Bilder mit sehr wenig Anweisung verstehen kann. Dies sind Fundamentmodelle (Foundation Models), die auf massiven Sammlungen alltäglicher Fotos trainiert wurden und gelernt haben, Formen und Objekte zu erkennen, ohne dass ihnen jedes einzelne Detail beigebracht werden muss. Ein solches Modell, das darauf ausgelegt ist, alles in einem Bild zu segmentieren, hat in der medizinischen Bildgebung vielversprechende Ergebnisse gezeigt. Doch als Forscher versuchten, dieses leistungsstarke Werkzeug direkt auf die komplexe, sich verändernde Welt der Gehirnzellvideos anzuwenden, hatte es Schwierigkeiten. Das Modell, das auf Katzen, Autos und Bäumen trainiert wurde, verstand die subtilen, leuchtenden Flecken eines Neurons nicht von Natur aus. Es brauchte Hilfe, aber die traditionelle Art, einer künstlichen Intelligenz zu helfen, besteht darin, sie neu zu trainieren, indem man ihr tausende neue Beispiele einspeist, bis sie die neuen Regeln lernt. Dieser Prozess ist langsam, erfordert enorme Mengen an beschrifteten Daten und macht das Modell oft auf eine bestimmte Art und Weise fest, wie es die Welt sieht, was es für zukünftige Experimente weniger flexibel macht.

Ein Forschungsteam der Universität Catania in Italien stellte eine andere Frage. Anstatt zu versuchen, das Gehirn der künstlichen Intelligenz zu verändern, fragten sie sich, ob sie die Augen ändern könnten, durch die sie sieht. Sie schlugen eine Methode namens Retrieval-Augmented Visual Prompting vor. Stellen Sie sich vor, Sie versuchen, einem Freund, der noch nie eine bestimmte Art von Wolke gesehen hat, diese zu beschreiben. Sie könnten versuchen, die Form und Farbe mit Worten zu erklären, oder Sie könnten ihm einfach ein Bild dieser Wolke zeigen. Die Forscher erkannten, dass der beste Weg, die künstliche Intelligenz zu leiten, darin bestand, ihr ein Bild zu zeigen. Sie bauten ein System, bei dem dem Modell, bevor es ein neues Gehirnbild betrachtet, ein kleines, sorgfältig ausgewähltes Beispiel eines Neurons aus einer Bibliothek zuvor annotierter Bilder gezeigt wird. Dieses Beispiel wird direkt neben das neue Bild platziert und fungiert als visueller Hinweis. Das Modell wird dann aufgefordert, alle anderen Neuronen zu finden, die dem Beispiel ähneln.

Die Forscher testeten diese Idee an einem massiven öffentlichen Datensatz von Hirnaufzeichnungen von Mäusen. Sie fanden heraus, dass es die Fähigkeit des Modells, Neuronen zu finden und zu umranden, drastisch verbesserte, wenn man dem Modell einfach ein einziges, gut gewähltes Beispiel zeigte – selbst wenn das Modell diesen spezifischen Typ der Hirnaufzeichnung noch nie zuvor gesehen hatte. Der Schlüssel lag nicht nur darin, irgendein Beispiel zu zeigen, sondern das richtige. Sie entwickelten eine intelligente Methode, um das beste Beispiel aus ihrer Bibliothek auszuwählen, indem sie die Helligkeit und Textur des Beispiels an das spezifische Bild anpassten, das analysiert wurde. Als sie diese Methode anwandten, sprang die Leistung des Modells signifikant an und schloss die Lücke zwischen einem brandneuen, ungetrainierten Modell und einem, das intensiv auf den spezifischen Daten nachjustiert worden war. Tatsächlich war die Verwendung eines einzigen, perfekt passenden Beispiels effektiver, als dem Modell mehrere verschiedene Beispiele gleichzeitig zu zeigen. Die Studie legt nahe, dass der effizienteste Weg für spezialisierte Aufgaben wie die Analyse von Hirnscans möglicherweise nicht darin besteht, die künstliche Intelligenz von Grund auf neu aufzubauen, sondern ihr im Moment der Entscheidung einfach den richtigen visuellen Kontext zu geben.

Die Ergebnisse waren klar und konsistent über verschiedene Arten von Hirnaufzeichnungen hinweg. Wenn das Modell auf sich allein gestellt war, übersah es oft schwache Zellen oder zeichnete unordentliche Umrisse. Aber als die Forscher ihm ein einziges, relevantes Beispiel aus ihrer Bibliothek zur Verfügung stellten, verstand das Modell plötzlich, wonach es suchen musste. Es wurde viel besser darin, die schwachen, dunklen Zellen zu finden, die normalerweise unbemerkt bleiben, und Zellen zu trennen, die sich berühren. Die Forscher entdeckten auch, dass die Art und Weise, wie sie das Beispiel auswählten, entscheidend war. Ein zufälliges Beispiel half, aber ein Beispiel, das so gewählt wurde, dass es den spezifischen Bedingungen des neuen Bildes entsprach, half noch mehr. Sie trainierten ein kleines, leichtgewichtiges Computerprogramm, das als Selektor fungierte und lernte, vorherzusagen, welches Beispiel für ein gegebenes Bild am nützlichsten sein würde. Dieser Selektor ermöglichte es dem System, sich augenblicklich an neue Bedingungen anzupassen, ohne jemals die Kerneinstellungen des Haupt-KI-Modells zu verändern.

Dieser Ansatz bietet eine überzeugende Alternative zur Standardmethode des Retrainings von künstlicher Intelligenz. Retraining erfordert erhebliche Rechenleistung und Zeit, und es führt oft dazu, dass ein Modell zwar exzellent in einer spezifischen Aufgabe ist, aber vergisst, wie man andere Aufgaben erledigt. Die neue Methode hält das ursprüngige Modell eingefroren und unverändert, wodurch sein allgemeines Wissen bewahrt wird, während es durch einfache visuelle Hinweise in der Lage ist, sich an neue, schwierige Aufgaben anzupassen. Die Forscher fanden heraus, dass diese Methode einen Großteil der Leistungssteigerungen, die normalerweise durch ein vollständiges Retraining erreicht werden, mit einem Bruchteil der Kosten wiederherstellte. Dies deutet darauf hin, dass in Bereichen, in denen Daten knapp sind und die Bedingungen stark variieren, die Zukunft der künstlichen Intelligenz weniger darin liegen könnte, der Maschine neue Fakten beizubringen, sondern vielmehr darin, ihr beizubringen, die Welt durch die richtige Linse zu betrachten. Indem sie das visuelle Gedächtnis direkt in den Input injizierten, haben die Forscher gezeigt, dass ein Fundamentmodell geleitet werden kann, um Expertenaufgaben in der spezialisierten biomedizinischen Bildgebung zu erfüllen, ohne die schwere Last der Parameteranpassung.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →